Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde
3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ca42708e-69c9-4e6c-be71-3a5cd531a544 | TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260719.ORACULO_RETRIEVAL_X09 | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde | claude_code | internal | 2026-07-19T13:02:48.643444+00:00 | false | pending |
Commit cb573f8d — 3/3. Este es el resultado que perseguíamos todo el arco. Te lo doy sin adornos.
🎯 El examen honesto habló — y es humilde
📄 docs/AUTOMEJORA_HELDOUT_VERDAD_S20260719.md
Construí el examen limpio (350 preguntas frescas, escritas por otro modelo desde el título, con el candado anti-trampa verificado) y lo corrí. La verdad, medida:
| Con trampa (auto-recuperación) | Honesto (held-out) | |
|---|---|---|
| Denso recall@1 | ~0.27 | 0.060 |
| Fusión V1 recall@1 | ~0.49 | 0.051 |
| ¿V1 gana? | +81% | NO — delta −0.009, IC95 [−0.029, 0.011] cruza 0 |
Dos verdades duras:
- El 0.490 era leakage — inflado ~8×. El examen con trampa (donde las preguntas salían del propio episodio) daba un número ocho veces mayor que el real. La caída fue mucho peor que la que estimó el tribunal.
- La fusión V1 no aporta nada en preguntas reales. Su ventaja del +81% era enteramente el artefacto de leakage — exactamente lo que advirtió el escéptico. En preguntas frescas ni ayuda ni estorba.
Pero el examen descubrió la causa raíz — y ese es el premio: el summary_one_line está vacío en 826 de 828 episodios (99.8%). El resumen semántico que anclaría la búsqueda no se puebla en la ingesta. Los títulos son ceremoniales ("EPISODIO 3 — BLINDADAS: ..."). El sistema matchea patrones de superficie ("PARA JOHN") en vez de contenido, porque el contenido no está resumido.
El reencuadre que esto obliga: el cuello de botella NO es el ranking (llevamos días afinando lo que no importa) — es la calidad del dato indexado. El tribunal dijo "0.85 requiere mejorar el denso, no re-rankear"; el examen honesto lo confirma y va más lejos: hay que poblar los resúmenes antes de tocar cualquier peso de fusión. Esa es la palanca real, recién descubierta.
Honestidad sobre el 0.06: el examen es duro por diseño (preguntas genéricas desde títulos ceremoniales, granularidad de turno). Parte del número bajo es dificultad del examen, no solo del retrieval — y eso es circular: summaries poblados darían mejores preguntas Y mejor búsqueda. Es justo la palanca. Además, "reencontrar el HILO" (por session_code) sigue siendo 100% — esa es la vía que Ember usa en la práctica.
No toqué ningún headline viejo (el 0.490 sigue en los docs) — eso es tu decisión, porque reencuadra el arco entero.