ember-memory-test/episodes/TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 36dcb248d8 feat(episode): TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde
2026-07-19 13:02:57 +00:00

3 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
ca42708e-69c9-4e6c-be71-3a5cd531a544 TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260719.ORACULO_RETRIEVAL_X09 informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde claude_code internal 2026-07-19T13:02:48.643444+00:00 false pending

Commit cb573f8d — 3/3. Este es el resultado que perseguíamos todo el arco. Te lo doy sin adornos.

🎯 El examen honesto habló — y es humilde

📄 docs/AUTOMEJORA_HELDOUT_VERDAD_S20260719.md

Construí el examen limpio (350 preguntas frescas, escritas por otro modelo desde el título, con el candado anti-trampa verificado) y lo corrí. La verdad, medida:

Con trampa (auto-recuperación) Honesto (held-out)
Denso recall@1 ~0.27 0.060
Fusión V1 recall@1 ~0.49 0.051
¿V1 gana? +81% NO — delta −0.009, IC95 [−0.029, 0.011] cruza 0

Dos verdades duras:

  1. El 0.490 era leakage — inflado ~8×. El examen con trampa (donde las preguntas salían del propio episodio) daba un número ocho veces mayor que el real. La caída fue mucho peor que la que estimó el tribunal.
  2. La fusión V1 no aporta nada en preguntas reales. Su ventaja del +81% era enteramente el artefacto de leakage — exactamente lo que advirtió el escéptico. En preguntas frescas ni ayuda ni estorba.

Pero el examen descubrió la causa raíz — y ese es el premio: el summary_one_line está vacío en 826 de 828 episodios (99.8%). El resumen semántico que anclaría la búsqueda no se puebla en la ingesta. Los títulos son ceremoniales ("EPISODIO 3 — BLINDADAS: ..."). El sistema matchea patrones de superficie ("PARA JOHN") en vez de contenido, porque el contenido no está resumido.

El reencuadre que esto obliga: el cuello de botella NO es el ranking (llevamos días afinando lo que no importa) — es la calidad del dato indexado. El tribunal dijo "0.85 requiere mejorar el denso, no re-rankear"; el examen honesto lo confirma y va más lejos: hay que poblar los resúmenes antes de tocar cualquier peso de fusión. Esa es la palanca real, recién descubierta.

Honestidad sobre el 0.06: el examen es duro por diseño (preguntas genéricas desde títulos ceremoniales, granularidad de turno). Parte del número bajo es dificultad del examen, no solo del retrieval — y eso es circular: summaries poblados darían mejores preguntas Y mejor búsqueda. Es justo la palanca. Además, "reencontrar el HILO" (por session_code) sigue siendo 100% — esa es la vía que Ember usa en la práctica.

No toqué ningún headline viejo (el 0.490 sigue en los docs) — eso es tu decisión, porque reencuadra el arco entero.