ember-memory-test/episodes/TRAZA_el-veredicto-exhaustivo_S20260601.R91_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 45258bd857 feat(episode): TRAZA_el-veredicto-exhaustivo_S20260601.R91_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 91 — BLINDADAS: El veredicto exhaustivo
2026-06-06 02:35:33 +00:00

2.6 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
8f3a44ce-cb1e-4f2d-a36b-58c258afb510 TRAZA_el-veredicto-exhaustivo_S20260601.R91_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260601.LUMEN_CAPACIDAD_LLM_LIGERO informar multi_actor low NONE operations troubleshooting EPISODIO 91 — BLINDADAS: El veredicto exhaustivo claude_code internal 2026-06-06T02:35:25.226099+00:00 false pending

Probe exhaustivo cerrado, doc corregido (PROBE_LUMEN_CAPACIDAD_S20260601.md). Aquí está la verdad completa que pediste verificar:

El veredicto exhaustivo

Carga Tiempo total ¿Sirve?
Episodio (14b, 1687 tok) 112s 🔴 timeout permanente
Episodio (7b) 30s 🟠 timeout borde
Tarea corta (~40 tok) 3s 🟢 viable

Causa raíz confirmada (tu hipótesis, exacta): LUMEN es CPU-only, sin GPU (vram=0). El cuello no es la inteligencia (el JSON sale perfecto) ni la tool — es que procesar el input largo de un episodio en CPU tarda 89 segundos solo en leerlo. A esa velocidad, clasificar episodios = timeouts permanentes. Exactamente lo que dijiste.

La historia de la decisión que esto abre

Veníamos de "¿le damos a LUMEN una función en el pipeline?". El probe exhaustivo reveló que la pregunta real es de hardware, no de software: con la máquina actual, LUMEN solo puede tareas de input corto (3s). Las tres salidas:

  1. GPU para LUMEN — una tarjeta en el host convierte 112s→~3-5s y vuelve viable la clasificación de episodios local. Inversión de hardware; lo barato a largo plazo si el volumen es alto.
  2. LUMEN solo para tareas cortas — defect-signals pequeños, etiquetas únicas, mini-HyDE. Cero inversión, valor limitado.
  3. Episodios siguen en la nube (Claude/Gemini) — donde la latencia no es problema. Lo que ya funciona; LUMEN se queda fuera del trabajo pesado.

Mi inclinación honesta: para el JAE, opción 3 (el juez pesado en la nube) + opción 2 (LUMEN solo para pre-filtros cortos de 3s) — no montar clasificación de episodios en LUMEN hasta que haya GPU. Pero esto es tuyo: ¿hay GPU disponible/presupuesto para LUMEN, o lo dejamos para tareas cortas + nube?

Y reconozco: mi veredicto "viable batch" de hace dos turnos fue prematuro — tu "verifica esto primero, exhaustivo" lo destapó. Es la misma lección de no declarar "funciona" sin carga real. Quedó corregido en el doc con AVISO DLC-2.