Skill: NONE | Type: troubleshooting Summary: EPISODIO 91 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ,
2.6 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| f7f07eed-19ea-4407-baa4-795a2a0e3640 | DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R91_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260601.LUMEN_CAPACIDAD_LLM_LIGERO | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 91 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, basta | claude_code | internal | 2026-06-06T12:01:31.464154+00:00 | false | pending |
Investigación exhaustiva completa y entregada, John. Te respondo directo a tu pregunta:
¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, bastante
LUMEN es usable para bajo peso vía qwen2.5-coder:7b (15 tok/s, cabe holgado en los ~21 GiB). Lo demostré empíricamente: clasificó y generó HyDE correctamente. Lo que NO puede: cargar ningún modelo de 20 GB (incluido lumen-v4 — OOM 26.1>21.3 GiB), ni generación larga, ni razonamiento profundo.
El sweet spot (todo verificado con benchmark real):
- ✅ Clasificación / routing / sentiment → ~2-4s warm
- ✅ Tagging / extracción de entidades → ~3-5s
- ✅ Generación HyDE (3-5 preguntas) → ~6-8s
- ✅ Resúmenes 1-2 líneas → ~5-9s (7b rápido / 14b mejor prosa)
- ❌ Textos largos (500 tok = 33s), reasoning clase GPT-4, latencia-crítica bloqueante
La oportunidad estratégica: mover tareas ligeras de OpenRouter/Claude (pago por token) a LUMEN 7b (local gratis) para colas batch no-latencia-crítica. Regla de oro: batch, no realtime, con keep_alive para matar la carga fría de 5s.
Entregable
docs/HALLAZGO_LUMEN_CAPACIDAD_LLM_LIGERO_S20260601.md → commit 6e694fe triple-remoto (mapa de capacidad + casos viables/no-viables + recomendaciones operacionales + drift INFRA_MANIFEST).
Drift detectado: INFRA_MANIFEST:1360 lista 6 modelos (los de 20GB) pero omite 7b y 14b — justo los útiles. No lo edité (D3 infra-crítico, lo dejo para tu OK).
📌 PILA (R6) — COMPACT
¿Hacia dónde? (tu llamada)
La investigación está cerrada. Las direcciones concretas:
- POC real: cablear una tarea ligera de EMBER a LUMEN
7b(ej. generador HyDE batch, o un helper de clasificación) — feature nueva, requiere tu go. - Fix drift: actualizar INFRA_MANIFEST con
7b/14bdocumentados (D3, OK tuyo). - Probar un caso tuyo: dime qué tarea concreta tienes en mente y la benchmarkeo end-to-end.
- Cerrar y volver al menú de deuda.
Número o me dices.