Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no,
2.7 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| d890245f-6bad-4aa7-9d77-57599e39feb3 | TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260823.SID4BCC8DB97BCD | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no, en las tres | claude_code | internal | 2026-08-28T03:13:17.073820+00:00 | false | pending |
Arco cerrado, y con el desenlace más incómodo posible: mi propia propuesta, retirada por mi propio criterio.
[R42.seccion1.I1] El examen limpio dice que no, en las tres métricas
El banco escrito a ciegas pasó el control de validez: fuga de 0,688 frente al umbral 1,50 que firmé y al 2,79 del banco viejo — cuatro veces más limpio. Así que la comparación cuenta.
| acierto @1 | acierto @5 | MRR | |
|---|---|---|---|
| contenido solo | 0,4500 | 0,7500 | 0,5931 |
| con título | 0,4000 | 0,6750 | 0,5429 |
La prueba primaria sobre el puesto da 16 mejoras contra 26 empeoramientos (p = 0,164). El acierto en primera posición, con su McNemar, da p = 0,424. El MRR baja 0,05. No es «falta evidencia a favor»: el punto estimado favorece al texto sin título en las tres. Según lo que firmé antes de ver un solo dato, eso significa una cosa concreta: la propuesta de reindexar queda retirada, y queda prohibido ir a buscar el subgrupo donde todavía gane.
Al llegar el resultado tenía tres salidas cómodas —mirar solo el acierto entre los cinco primeros, culpar al tamaño de muestra, o rebuscar subgrupos— y las tres estaban prohibidas por escrito, por mí, cuando aún no sabía qué iba a salir. Ese es el valor entero de un preregistro: solo protege si se fija cuando todavía puede perjudicarte.
[R42.seccion2.I2] Y el hallazgo colateral es más grande que la propuesta que murió
Mira las dos cifras base juntas. El mismo recuperador, sobre el mismo corpus, pasa de acertar 1 de cada 10 a acertar casi 1 de cada 2 —de 0,1064 a 0,4500 en primera posición, y de 0,2128 a 0,7500 entre los cinco primeros— cambiando únicamente las preguntas.
Eso abre una hipótesis que no cierro hoy pero que reordena las prioridades: puede que el cuello del recall que el canario lleva midiendo —ese 21,4 %— no esté en el recuperador sino en el examen con que lo medimos. El banco viejo está lleno de plantillas genéricas del tipo «¿Qué información hay sobre X?», un defecto ya registrado en su día con 303 episodios afectados.