feat(episode): DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R63_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 63 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ,
This commit is contained in:
Ember 2026-06-06 00:40:06 +00:00
parent e648d6b8d1
commit 2c6bc7ef16

View file

@ -0,0 +1,50 @@
---
episode_id: "e9b8c269-c282-490e-801d-b24028b55e3a"
puente_flat: "DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R63_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260601.LUMEN_CAPACIDAD_LLM_LIGERO"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 63 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, basta"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-06-06T00:39:14.335730+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
**Investigación exhaustiva completa y entregada, John.** Te respondo directo a tu pregunta:
## ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, bastante
**LUMEN es usable** para bajo peso vía `qwen2.5-coder:7b` (15 tok/s, cabe holgado en los ~21 GiB). Lo demostré empíricamente: clasificó y generó HyDE correctamente. Lo que **NO** puede: cargar ningún modelo de 20 GB (incluido `lumen-v4` — OOM 26.1>21.3 GiB), ni generación larga, ni razonamiento profundo.
**El sweet spot (todo verificado con benchmark real):**
- ✅ Clasificación / routing / sentiment → ~2-4s warm
- ✅ Tagging / extracción de entidades → ~3-5s
- ✅ Generación HyDE (3-5 preguntas) → ~6-8s
- ✅ Resúmenes 1-2 líneas → ~5-9s (7b rápido / 14b mejor prosa)
- ❌ Textos largos (500 tok = 33s), reasoning clase GPT-4, latencia-crítica bloqueante
**La oportunidad estratégica:** mover tareas ligeras de OpenRouter/Claude (pago por token) a LUMEN `7b` (local **gratis**) para colas batch no-latencia-crítica. Regla de oro: **batch, no realtime**, con `keep_alive` para matar la carga fría de 5s.
## Entregable
`docs/HALLAZGO_LUMEN_CAPACIDAD_LLM_LIGERO_S20260601.md` → commit `6e694fe` triple-remoto (mapa de capacidad + casos viables/no-viables + recomendaciones operacionales + drift INFRA_MANIFEST).
**Drift detectado:** `INFRA_MANIFEST:1360` lista 6 modelos (los de 20GB) pero omite `7b` y `14b` — justo los útiles. No lo edité (D3 infra-crítico, lo dejo para tu OK).
## 📌 PILA (R6) — COMPACT
## ¿Hacia dónde? (tu llamada)
La investigación está cerrada. Las direcciones concretas:
1. **POC real:** cablear una tarea ligera de EMBER a LUMEN `7b` (ej. generador HyDE batch, o un helper de clasificación) — feature nueva, requiere tu go.
2. **Fix drift:** actualizar INFRA_MANIFEST con `7b`/`14b` documentados (D3, OK tuyo).
3. **Probar un caso tuyo:** dime qué tarea concreta tienes en mente y la benchmarkeo end-to-end.
4. **Cerrar** y volver al menú de deuda.
Número o me dices.