feat(episode): TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no,
This commit is contained in:
Ember 2026-08-28 03:13:26 +00:00
parent 535763ac41
commit 92185fbc19

View file

@ -0,0 +1,38 @@
---
episode_id: "d890245f-6bad-4aa7-9d77-57599e39feb3"
puente_flat: "TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260823.SID4BCC8DB97BCD"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no, en las tres "
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-28T03:13:17.073820+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Arco cerrado, y con el desenlace más incómodo posible: **mi propia propuesta, retirada por mi propio criterio.**
## [R42.seccion1.I1] El examen limpio dice que no, en las tres métricas
El banco escrito a ciegas **pasó el control de validez**: fuga de 0,688 frente al umbral 1,50 que firmé y al 2,79 del banco viejo — **cuatro veces más limpio**. Así que la comparación cuenta.
| | acierto @1 | acierto @5 | MRR |
|---|---|---|---|
| **contenido solo** | **0,4500** | **0,7500** | **0,5931** |
| con título | 0,4000 | 0,6750 | 0,5429 |
La prueba primaria sobre el puesto da **16 mejoras contra 26 empeoramientos** (p = 0,164). El acierto en primera posición, con **su** McNemar, da p = 0,424. El MRR baja 0,05. **No es «falta evidencia a favor»: el punto estimado favorece al texto sin título en las tres.** Según lo que firmé antes de ver un solo dato, eso significa una cosa concreta: **la propuesta de reindexar queda retirada**, y queda prohibido ir a buscar el subgrupo donde todavía gane.
Al llegar el resultado tenía tres salidas cómodas —mirar solo el acierto entre los cinco primeros, culpar al tamaño de muestra, o rebuscar subgrupos— y **las tres estaban prohibidas por escrito, por mí, cuando aún no sabía qué iba a salir**. Ese es el valor entero de un preregistro: solo protege si se fija cuando todavía puede perjudicarte.
## [R42.seccion2.I2] Y el hallazgo colateral es más grande que la propuesta que murió
Mira las dos cifras base juntas. **El mismo recuperador, sobre el mismo corpus, pasa de acertar 1 de cada 10 a acertar casi 1 de cada 2** —de 0,1064 a 0,4500 en primera posición, y de 0,2128 a 0,7500 entre los cinco primeros— **cambiando únicamente las preguntas**.
Eso abre una hipótesis que no cierro hoy pero que reordena las prioridades: puede que el cuello del recall que el canario lleva midiendo —ese 21,4 %— **no esté en el recuperador sino en el examen con que lo medimos**. El banco viejo está lleno de plantillas genéricas del tipo *«¿Qué información hay sobre X?»*, un defecto ya registrado en su día con 303 episodios afectados.