--- episode_id: "acfec6a0-8a81-450a-b582-04ec0ab33e4a" puente_flat: "DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R60_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260601.LUMEN_CAPACIDAD_LLM_LIGERO" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "NONE" fase_proyecto: "operations" tipo_semantico: "troubleshooting" summary_one_line: "EPISODIO 60 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, basta" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-06-05T19:27:11.195105+00:00" relectura_tagged: false forgejo_commit_sha: "pending" --- **Investigación exhaustiva completa y entregada, John.** Te respondo directo a tu pregunta: ## ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, bastante **LUMEN es usable** para bajo peso vía `qwen2.5-coder:7b` (15 tok/s, cabe holgado en los ~21 GiB). Lo demostré empíricamente: clasificó y generó HyDE correctamente. Lo que **NO** puede: cargar ningún modelo de 20 GB (incluido `lumen-v4` — OOM 26.1>21.3 GiB), ni generación larga, ni razonamiento profundo. **El sweet spot (todo verificado con benchmark real):** - ✅ Clasificación / routing / sentiment → ~2-4s warm - ✅ Tagging / extracción de entidades → ~3-5s - ✅ Generación HyDE (3-5 preguntas) → ~6-8s - ✅ Resúmenes 1-2 líneas → ~5-9s (7b rápido / 14b mejor prosa) - ❌ Textos largos (500 tok = 33s), reasoning clase GPT-4, latencia-crítica bloqueante **La oportunidad estratégica:** mover tareas ligeras de OpenRouter/Claude (pago por token) a LUMEN `7b` (local **gratis**) para colas batch no-latencia-crítica. Regla de oro: **batch, no realtime**, con `keep_alive` para matar la carga fría de 5s. ## Entregable `docs/HALLAZGO_LUMEN_CAPACIDAD_LLM_LIGERO_S20260601.md` → commit `6e694fe` triple-remoto (mapa de capacidad + casos viables/no-viables + recomendaciones operacionales + drift INFRA_MANIFEST). **Drift detectado:** `INFRA_MANIFEST:1360` lista 6 modelos (los de 20GB) pero omite `7b` y `14b` — justo los útiles. No lo edité (D3 infra-crítico, lo dejo para tu OK). ## 📌 PILA (R6) — COMPACT ## ¿Hacia dónde? (tu llamada) La investigación está cerrada. Las direcciones concretas: 1. **POC real:** cablear una tarea ligera de EMBER a LUMEN `7b` (ej. generador HyDE batch, o un helper de clasificación) — feature nueva, requiere tu go. 2. **Fix drift:** actualizar INFRA_MANIFEST con `7b`/`14b` documentados (D3, OK tuyo). 3. **Probar un caso tuyo:** dime qué tarea concreta tienes en mente y la benchmarkeo end-to-end. 4. **Cerrar** y volver al menú de deuda. Número o me dices.