ember-memory-test/episodes/TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 92185fbc19 feat(episode): TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no,
2026-08-28 03:13:26 +00:00

2.7 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
d890245f-6bad-4aa7-9d77-57599e39feb3 TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260823.SID4BCC8DB97BCD informar multi_actor low NONE operations troubleshooting EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no, en las tres claude_code internal 2026-08-28T03:13:17.073820+00:00 false pending

Arco cerrado, y con el desenlace más incómodo posible: mi propia propuesta, retirada por mi propio criterio.

[R42.seccion1.I1] El examen limpio dice que no, en las tres métricas

El banco escrito a ciegas pasó el control de validez: fuga de 0,688 frente al umbral 1,50 que firmé y al 2,79 del banco viejo — cuatro veces más limpio. Así que la comparación cuenta.

acierto @1 acierto @5 MRR
contenido solo 0,4500 0,7500 0,5931
con título 0,4000 0,6750 0,5429

La prueba primaria sobre el puesto da 16 mejoras contra 26 empeoramientos (p = 0,164). El acierto en primera posición, con su McNemar, da p = 0,424. El MRR baja 0,05. No es «falta evidencia a favor»: el punto estimado favorece al texto sin título en las tres. Según lo que firmé antes de ver un solo dato, eso significa una cosa concreta: la propuesta de reindexar queda retirada, y queda prohibido ir a buscar el subgrupo donde todavía gane.

Al llegar el resultado tenía tres salidas cómodas —mirar solo el acierto entre los cinco primeros, culpar al tamaño de muestra, o rebuscar subgrupos— y las tres estaban prohibidas por escrito, por mí, cuando aún no sabía qué iba a salir. Ese es el valor entero de un preregistro: solo protege si se fija cuando todavía puede perjudicarte.

[R42.seccion2.I2] Y el hallazgo colateral es más grande que la propuesta que murió

Mira las dos cifras base juntas. El mismo recuperador, sobre el mismo corpus, pasa de acertar 1 de cada 10 a acertar casi 1 de cada 2 —de 0,1064 a 0,4500 en primera posición, y de 0,2128 a 0,7500 entre los cinco primeros— cambiando únicamente las preguntas.

Eso abre una hipótesis que no cierro hoy pero que reordena las prioridades: puede que el cuello del recall que el canario lleva midiendo —ese 21,4 %— no esté en el recuperador sino en el examen con que lo medimos. El banco viejo está lleno de plantillas genéricas del tipo «¿Qué información hay sobre X?», un defecto ya registrado en su día con 303 episodios afectados.