feat(episode): TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no,
This commit is contained in:
parent
535763ac41
commit
92185fbc19
1 changed files with 38 additions and 0 deletions
|
|
@ -0,0 +1,38 @@
|
||||||
|
---
|
||||||
|
episode_id: "d890245f-6bad-4aa7-9d77-57599e39feb3"
|
||||||
|
puente_flat: "TRAZA_r42seccion1i1-el-examen-limpio-dice-que_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260823.SID4BCC8DB97BCD"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "NONE"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 2 — HANDOFF_PROMPT.md: [R42.seccion1.I1] El examen limpio dice que no, en las tres "
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-08-28T03:13:17.073820+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
Arco cerrado, y con el desenlace más incómodo posible: **mi propia propuesta, retirada por mi propio criterio.**
|
||||||
|
|
||||||
|
## [R42.seccion1.I1] El examen limpio dice que no, en las tres métricas
|
||||||
|
|
||||||
|
El banco escrito a ciegas **pasó el control de validez**: fuga de 0,688 frente al umbral 1,50 que firmé y al 2,79 del banco viejo — **cuatro veces más limpio**. Así que la comparación cuenta.
|
||||||
|
|
||||||
|
| | acierto @1 | acierto @5 | MRR |
|
||||||
|
|---|---|---|---|
|
||||||
|
| **contenido solo** | **0,4500** | **0,7500** | **0,5931** |
|
||||||
|
| con título | 0,4000 | 0,6750 | 0,5429 |
|
||||||
|
|
||||||
|
La prueba primaria sobre el puesto da **16 mejoras contra 26 empeoramientos** (p = 0,164). El acierto en primera posición, con **su** McNemar, da p = 0,424. El MRR baja 0,05. **No es «falta evidencia a favor»: el punto estimado favorece al texto sin título en las tres.** Según lo que firmé antes de ver un solo dato, eso significa una cosa concreta: **la propuesta de reindexar queda retirada**, y queda prohibido ir a buscar el subgrupo donde todavía gane.
|
||||||
|
|
||||||
|
Al llegar el resultado tenía tres salidas cómodas —mirar solo el acierto entre los cinco primeros, culpar al tamaño de muestra, o rebuscar subgrupos— y **las tres estaban prohibidas por escrito, por mí, cuando aún no sabía qué iba a salir**. Ese es el valor entero de un preregistro: solo protege si se fija cuando todavía puede perjudicarte.
|
||||||
|
|
||||||
|
## [R42.seccion2.I2] Y el hallazgo colateral es más grande que la propuesta que murió
|
||||||
|
|
||||||
|
Mira las dos cifras base juntas. **El mismo recuperador, sobre el mismo corpus, pasa de acertar 1 de cada 10 a acertar casi 1 de cada 2** —de 0,1064 a 0,4500 en primera posición, y de 0,2128 a 0,7500 entre los cinco primeros— **cambiando únicamente las preguntas**.
|
||||||
|
|
||||||
|
Eso abre una hipótesis que no cierro hoy pero que reordena las prioridades: puede que el cuello del recall que el canario lleva midiendo —ese 21,4 %— **no esté en el recuperador sino en el examen con que lo medimos**. El banco viejo está lleno de plantillas genéricas del tipo *«¿Qué información hay sobre X?»*, un defecto ya registrado en su día con 303 episodios afectados.
|
||||||
Loading…
Reference in a new issue