feat(episode): DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R63_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting Summary: EPISODIO 63 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ,
This commit is contained in:
parent
e648d6b8d1
commit
2c6bc7ef16
1 changed files with 50 additions and 0 deletions
|
|
@ -0,0 +1,50 @@
|
|||
---
|
||||
episode_id: "e9b8c269-c282-490e-801d-b24028b55e3a"
|
||||
puente_flat: "DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R63_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||
session_code: "S20260601.LUMEN_CAPACIDAD_LLM_LIGERO"
|
||||
acto_dialogico: "informar"
|
||||
actor_flujo: "multi_actor"
|
||||
criticidad_aegis: "low"
|
||||
skill_dominante: "NONE"
|
||||
fase_proyecto: "operations"
|
||||
tipo_semantico: "troubleshooting"
|
||||
summary_one_line: "EPISODIO 63 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, basta"
|
||||
source_type: "claude_code"
|
||||
trust_boundary: "internal"
|
||||
created_at: "2026-06-06T00:39:14.335730+00:00"
|
||||
relectura_tagged: false
|
||||
forgejo_commit_sha: "pending"
|
||||
---
|
||||
|
||||
**Investigación exhaustiva completa y entregada, John.** Te respondo directo a tu pregunta:
|
||||
|
||||
## ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, bastante
|
||||
|
||||
**LUMEN es usable** para bajo peso vía `qwen2.5-coder:7b` (15 tok/s, cabe holgado en los ~21 GiB). Lo demostré empíricamente: clasificó y generó HyDE correctamente. Lo que **NO** puede: cargar ningún modelo de 20 GB (incluido `lumen-v4` — OOM 26.1>21.3 GiB), ni generación larga, ni razonamiento profundo.
|
||||
|
||||
**El sweet spot (todo verificado con benchmark real):**
|
||||
- ✅ Clasificación / routing / sentiment → ~2-4s warm
|
||||
- ✅ Tagging / extracción de entidades → ~3-5s
|
||||
- ✅ Generación HyDE (3-5 preguntas) → ~6-8s
|
||||
- ✅ Resúmenes 1-2 líneas → ~5-9s (7b rápido / 14b mejor prosa)
|
||||
- ❌ Textos largos (500 tok = 33s), reasoning clase GPT-4, latencia-crítica bloqueante
|
||||
|
||||
**La oportunidad estratégica:** mover tareas ligeras de OpenRouter/Claude (pago por token) a LUMEN `7b` (local **gratis**) para colas batch no-latencia-crítica. Regla de oro: **batch, no realtime**, con `keep_alive` para matar la carga fría de 5s.
|
||||
|
||||
## Entregable
|
||||
|
||||
`docs/HALLAZGO_LUMEN_CAPACIDAD_LLM_LIGERO_S20260601.md` → commit `6e694fe` triple-remoto (mapa de capacidad + casos viables/no-viables + recomendaciones operacionales + drift INFRA_MANIFEST).
|
||||
|
||||
**Drift detectado:** `INFRA_MANIFEST:1360` lista 6 modelos (los de 20GB) pero omite `7b` y `14b` — justo los útiles. No lo edité (D3 infra-crítico, lo dejo para tu OK).
|
||||
|
||||
## 📌 PILA (R6) — COMPACT
|
||||
|
||||
## ¿Hacia dónde? (tu llamada)
|
||||
|
||||
La investigación está cerrada. Las direcciones concretas:
|
||||
1. **POC real:** cablear una tarea ligera de EMBER a LUMEN `7b` (ej. generador HyDE batch, o un helper de clasificación) — feature nueva, requiere tu go.
|
||||
2. **Fix drift:** actualizar INFRA_MANIFEST con `7b`/`14b` documentados (D3, OK tuyo).
|
||||
3. **Probar un caso tuyo:** dime qué tarea concreta tienes en mente y la benchmarkeo end-to-end.
|
||||
4. **Cerrar** y volver al menú de deuda.
|
||||
|
||||
Número o me dices.
|
||||
Loading…
Reference in a new issue