feat(episode): TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde
This commit is contained in:
parent
55eb54cd40
commit
36dcb248d8
1 changed files with 43 additions and 0 deletions
|
|
@ -0,0 +1,43 @@
|
||||||
|
---
|
||||||
|
episode_id: "ca42708e-69c9-4e6c-be71-3a5cd531a544"
|
||||||
|
puente_flat: "TRAZA_el-examen-honesto-habl-y-es-humilde_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260719.ORACULO_RETRIEVAL_X09"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "NONE"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 1 — MNEMO_PRE_DIGEST: 🎯 El examen honesto habló — y es humilde"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-07-19T13:02:48.643444+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
Commit `cb573f8d` — 3/3. Este es el resultado que perseguíamos todo el arco. Te lo doy sin adornos.
|
||||||
|
|
||||||
|
# 🎯 El examen honesto habló — y es humilde
|
||||||
|
|
||||||
|
📄 [docs/AUTOMEJORA_HELDOUT_VERDAD_S20260719.md](docs/AUTOMEJORA_HELDOUT_VERDAD_S20260719.md)
|
||||||
|
|
||||||
|
Construí el examen limpio (350 preguntas frescas, escritas por otro modelo desde el título, con el candado anti-trampa verificado) y lo corrí. **La verdad, medida:**
|
||||||
|
|
||||||
|
| | Con trampa (auto-recuperación) | **Honesto (held-out)** |
|
||||||
|
|---|---|---|
|
||||||
|
| Denso recall@1 | ~0.27 | **0.060** |
|
||||||
|
| Fusión V1 recall@1 | ~0.49 | **0.051** |
|
||||||
|
| ¿V1 gana? | +81% | **NO — delta −0.009, IC95 [−0.029, 0.011] cruza 0** |
|
||||||
|
|
||||||
|
**Dos verdades duras:**
|
||||||
|
1. **El 0.490 era leakage — inflado ~8×.** El examen con trampa (donde las preguntas salían del propio episodio) daba un número ocho veces mayor que el real. La caída fue mucho peor que la que estimó el tribunal.
|
||||||
|
2. **La fusión V1 no aporta nada en preguntas reales.** Su ventaja del +81% era enteramente el artefacto de leakage — exactamente lo que advirtió el escéptico. En preguntas frescas ni ayuda ni estorba.
|
||||||
|
|
||||||
|
**Pero el examen descubrió la causa raíz — y ese es el premio:** **el `summary_one_line` está vacío en 826 de 828 episodios (99.8%).** El resumen semántico que anclaría la búsqueda no se puebla en la ingesta. Los títulos son ceremoniales ("EPISODIO 3 — BLINDADAS: ..."). El sistema matchea patrones de superficie ("PARA JOHN") en vez de contenido, porque **el contenido no está resumido**.
|
||||||
|
|
||||||
|
**El reencuadre que esto obliga:** el cuello de botella NO es el ranking (llevamos días afinando lo que no importa) — **es la calidad del dato indexado.** El tribunal dijo "0.85 requiere mejorar el denso, no re-rankear"; el examen honesto lo confirma y va más lejos: hay que **poblar los resúmenes** antes de tocar cualquier peso de fusión. Esa es la palanca real, recién descubierta.
|
||||||
|
|
||||||
|
**Honestidad sobre el 0.06:** el examen es duro por diseño (preguntas genéricas desde títulos ceremoniales, granularidad de turno). Parte del número bajo es dificultad del examen, no solo del retrieval — y eso es circular: summaries poblados darían mejores preguntas Y mejor búsqueda. Es justo la palanca. Además, "reencontrar el HILO" (por session_code) sigue siendo 100% — esa es la vía que Ember usa en la práctica.
|
||||||
|
|
||||||
|
No toqué ningún headline viejo (el 0.490 sigue en los docs) — eso es tu decisión, porque reencuadra el arco entero.
|
||||||
Loading…
Reference in a new issue