ember-memory-test/episodes/DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R17_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember a0c8d2e956 feat(episode): DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R17_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 17 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ,
2026-06-02 17:45:29 +00:00

2.6 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
dc12c43f-16b1-4b15-99cb-bd4fa1de0968 DEPURA_qu-trabajo-llm-de-bajo-peso-puede-hacer_S20260601.R17_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260601.LUMEN_CAPACIDAD_LLM_LIGERO informar multi_actor low NONE operations troubleshooting EPISODIO 17 — BLINDADAS: ¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, basta claude_code internal 2026-06-02T17:45:05.553520+00:00 false pending

Investigación exhaustiva completa y entregada, John. Te respondo directo a tu pregunta:

¿Qué trabajo LLM de bajo peso puede hacer LUMEN? — SÍ, bastante

LUMEN es usable para bajo peso vía qwen2.5-coder:7b (15 tok/s, cabe holgado en los ~21 GiB). Lo demostré empíricamente: clasificó y generó HyDE correctamente. Lo que NO puede: cargar ningún modelo de 20 GB (incluido lumen-v4 — OOM 26.1>21.3 GiB), ni generación larga, ni razonamiento profundo.

El sweet spot (todo verificado con benchmark real):

  • Clasificación / routing / sentiment → ~2-4s warm
  • Tagging / extracción de entidades → ~3-5s
  • Generación HyDE (3-5 preguntas) → ~6-8s
  • Resúmenes 1-2 líneas → ~5-9s (7b rápido / 14b mejor prosa)
  • Textos largos (500 tok = 33s), reasoning clase GPT-4, latencia-crítica bloqueante

La oportunidad estratégica: mover tareas ligeras de OpenRouter/Claude (pago por token) a LUMEN 7b (local gratis) para colas batch no-latencia-crítica. Regla de oro: batch, no realtime, con keep_alive para matar la carga fría de 5s.

Entregable

docs/HALLAZGO_LUMEN_CAPACIDAD_LLM_LIGERO_S20260601.md → commit 6e694fe triple-remoto (mapa de capacidad + casos viables/no-viables + recomendaciones operacionales + drift INFRA_MANIFEST).

Drift detectado: INFRA_MANIFEST:1360 lista 6 modelos (los de 20GB) pero omite 7b y 14b — justo los útiles. No lo edité (D3 infra-crítico, lo dejo para tu OK).

📌 PILA (R6) — COMPACT

¿Hacia dónde? (tu llamada)

La investigación está cerrada. Las direcciones concretas:

  1. POC real: cablear una tarea ligera de EMBER a LUMEN 7b (ej. generador HyDE batch, o un helper de clasificación) — feature nueva, requiere tu go.
  2. Fix drift: actualizar INFRA_MANIFEST con 7b/14b documentados (D3, OK tuyo).
  3. Probar un caso tuyo: dime qué tarea concreta tienes en mente y la benchmarkeo end-to-end.
  4. Cerrar y volver al menú de deuda.

Número o me dices.