feat(episode): DEPURA_r18seccion1i1-la-cifra-que-llevamos-das_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 1 — MEMORIA: [R18.seccion1.I1] La cifra que llevamos días persiguiendo
This commit is contained in:
Ember 2026-09-01 03:34:39 +00:00
parent 70adb59bd1
commit 029c84cef3

View file

@ -0,0 +1,49 @@
---
episode_id: "dfdf4699-2966-4442-9e0f-29c8debe2e2f"
puente_flat: "DEPURA_r18seccion1i1-la-cifra-que-llevamos-das_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260828.SID3E411925EAA3"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "TESSERA"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — MEMORIA: [R18.seccion1.I1] La cifra que llevamos días persiguiendo mi"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-09-01T03:34:38.779663+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Auditoría cerrada y hallazgo medido. Te cuento lo importante.
## [R18.seccion1.I1] La cifra que llevamos días persiguiendo mide el examen, no la memoria
Puse a competir dos exámenes sobre **el mismo recuperador, el mismo corpus y los mismos episodios**. Solo cambié de dónde salen las preguntas:
| Examen | corpus 200 | corpus 700 |
|---|---|---|
| El que usan todas nuestras métricas | **0,08** | **0,04** |
| Preguntas hechas desde el contenido | **0,70** | **0,62** |
**Diferencia: 0,62.** Y el tamaño del corpus —mi sospecha— explica apenas **0,08**. No manda el corpus: manda el examen.
**Y aquí viene la parte que no te puedo vender como buena noticia.** Sería fácil decirte "tu memoria acierta el 70 %, no el 14 %". Sería falso. El examen fácil genera la pregunta *a partir del texto* y luego busca *contra ese mismo texto* — es casi pedir "encuentra el párrafo del que salió esta pregunta". Los dos exámenes están sesgados, **en direcciones opuestas**: uno hunde la cifra, el otro la infla.
Lo que sí queda establecido, y basta para cambiar cómo decidimos: **la cifra real está entre 0,08 y 0,70, y ningún experimento nuestro la determina**. Cualquier decisión tomada contra un número concreto de recall está tomada contra una propiedad del examen elegido.
`★ Insight ─────────────────────────────────────`
Cuando dos instrumentos discrepan seis veces más que el efecto que buscan medir, el resultado no es "uno de los dos miente" — es que la magnitud carece de sentido hasta fijar el instrumento. Esa es la definición operativa de una métrica no calibrada.
Esto explica el patrón que os persigue desde julio: siete hipótesis medidas contra este banco, siete resultados desconcertantes. Cuando el instrumento domina la señal, los experimentos miden el instrumento.
`─────────────────────────────────────────────────`
**Lo que NO se cae con esto:** el reordenador desplegado. Su medición es *pareada* —mismo examen, mismo corpus, solo cambia el reordenamiento— y un examen sesgado desplaza los dos brazos por igual. La ganancia (×2) sobrevive; lo que queda en duda es el nivel absoluto.
## [R18.seccion2.L1] Lo que encontré roto al auditar
Revisando lo truncado, apareció esto: