feat(episode): DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R68_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting Summary: EPISODIO 68 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ,
This commit is contained in:
parent
d2bfcb9251
commit
3bdaba1aed
1 changed files with 50 additions and 0 deletions
|
|
@ -0,0 +1,50 @@
|
||||||
|
---
|
||||||
|
episode_id: "94cf14c8-95d2-435b-b3c9-95f988068f5a"
|
||||||
|
puente_flat: "DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R68_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260601.LUMEN_CAPACIDAD_LLM_LIGERO"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "NONE"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 68 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, basta"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-06-06T06:01:37.062799+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
**Investigación exhaustiva completa y entregada, John.** Te respondo directo a tu pregunta:
|
||||||
|
|
||||||
|
## ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, bastante
|
||||||
|
|
||||||
|
**LUMEN es usable** para bajo peso vía `qwen2.5-coder:7b` (15 tok/s, cabe holgado en los ~21 GiB). Lo demostré empíricamente: clasificó y generó HyDE correctamente. Lo que **NO** puede: cargar ningún modelo de 20 GB (incluido `lumen-v4` — OOM 26.1>21.3 GiB), ni generación larga, ni razonamiento profundo.
|
||||||
|
|
||||||
|
**El sweet spot (todo verificado con benchmark real):**
|
||||||
|
- ✅ Clasificación / routing / sentiment → ~2-4s warm
|
||||||
|
- ✅ Tagging / extracción de entidades → ~3-5s
|
||||||
|
- ✅ Generación HyDE (3-5 preguntas) → ~6-8s
|
||||||
|
- ✅ Resúmenes 1-2 líneas → ~5-9s (7b rápido / 14b mejor prosa)
|
||||||
|
- ❌ Textos largos (500 tok = 33s), reasoning clase GPT-4, latencia-crítica bloqueante
|
||||||
|
|
||||||
|
**La oportunidad estratégica:** mover tareas ligeras de OpenRouter/Claude (pago por token) a LUMEN `7b` (local **gratis**) para colas batch no-latencia-crítica. Regla de oro: **batch, no realtime**, con `keep_alive` para matar la carga fría de 5s.
|
||||||
|
|
||||||
|
## Entregable
|
||||||
|
|
||||||
|
`docs/HALLAZGO_LUMEN_CAPACIDAD_LLM_LIGERO_S20260601.md` → commit `6e694fe` triple-remoto (mapa de capacidad + casos viables/no-viables + recomendaciones operacionales + drift INFRA_MANIFEST).
|
||||||
|
|
||||||
|
**Drift detectado:** `INFRA_MANIFEST:1360` lista 6 modelos (los de 20GB) pero omite `7b` y `14b` — justo los útiles. No lo edité (D3 infra-crítico, lo dejo para tu OK).
|
||||||
|
|
||||||
|
## 📌 PILA (R6) — COMPACT
|
||||||
|
|
||||||
|
## ¿Hacia dónde? (tu llamada)
|
||||||
|
|
||||||
|
La investigación está cerrada. Las direcciones concretas:
|
||||||
|
1. **POC real:** cablear una tarea ligera de EMBER a LUMEN `7b` (ej. generador HyDE batch, o un helper de clasificación) — feature nueva, requiere tu go.
|
||||||
|
2. **Fix drift:** actualizar INFRA_MANIFEST con `7b`/`14b` documentados (D3, OK tuyo).
|
||||||
|
3. **Probar un caso tuyo:** dime qué tarea concreta tienes en mente y la benchmarkeo end-to-end.
|
||||||
|
4. **Cerrar** y volver al menú de deuda.
|
||||||
|
|
||||||
|
Número o me dices.
|
||||||
Loading…
Reference in a new issue