feat(episode): TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde
This commit is contained in:
Ember 2026-07-19 13:02:57 +00:00
parent 55eb54cd40
commit 36dcb248d8

View file

@ -0,0 +1,43 @@
---
episode_id: "ca42708e-69c9-4e6c-be71-3a5cd531a544"
puente_flat: "TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260719.ORACULO_RETRIEVAL_X09"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-07-19T13:02:48.643444+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Commit `cb573f8d` — 3/3. Este es el resultado que perseguíamos todo el arco. Te lo doy sin adornos.
# 🎯 El examen honesto habló — y es humilde
📄 [docs/AUTOMEJORA_HELDOUT_VERDAD_S20260719.md](docs/AUTOMEJORA_HELDOUT_VERDAD_S20260719.md)
Construí el examen limpio (350 preguntas frescas, escritas por otro modelo desde el título, con el candado anti-trampa verificado) y lo corrí. **La verdad, medida:**
| | Con trampa (auto-recuperación) | **Honesto (held-out)** |
|---|---|---|
| Denso recall@1 | ~0.27 | **0.060** |
| Fusión V1 recall@1 | ~0.49 | **0.051** |
| ¿V1 gana? | +81% | **NO — delta 0.009, IC95 [0.029, 0.011] cruza 0** |
**Dos verdades duras:**
1. **El 0.490 era leakage — inflado ~8×.** El examen con trampa (donde las preguntas salían del propio episodio) daba un número ocho veces mayor que el real. La caída fue mucho peor que la que estimó el tribunal.
2. **La fusión V1 no aporta nada en preguntas reales.** Su ventaja del +81% era enteramente el artefacto de leakage — exactamente lo que advirtió el escéptico. En preguntas frescas ni ayuda ni estorba.
**Pero el examen descubrió la causa raíz — y ese es el premio:** **el `summary_one_line` está vacío en 826 de 828 episodios (99.8%).** El resumen semántico que anclaría la búsqueda no se puebla en la ingesta. Los títulos son ceremoniales ("EPISODIO 3 — BLINDADAS: ..."). El sistema matchea patrones de superficie ("PARA JOHN") en vez de contenido, porque **el contenido no está resumido**.
**El reencuadre que esto obliga:** el cuello de botella NO es el ranking (llevamos días afinando lo que no importa) — **es la calidad del dato indexado.** El tribunal dijo "0.85 requiere mejorar el denso, no re-rankear"; el examen honesto lo confirma y va más lejos: hay que **poblar los resúmenes** antes de tocar cualquier peso de fusión. Esa es la palanca real, recién descubierta.
**Honestidad sobre el 0.06:** el examen es duro por diseño (preguntas genéricas desde títulos ceremoniales, granularidad de turno). Parte del número bajo es dificultad del examen, no solo del retrieval — y eso es circular: summaries poblados darían mejores preguntas Y mejor búsqueda. Es justo la palanca. Además, "reencontrar el HILO" (por session_code) sigue siendo 100% — esa es la vía que Ember usa en la práctica.
No toqué ningún headline viejo (el 0.490 sigue en los docs) — eso es tu decisión, porque reencuadra el arco entero.