feat(episode): DEPURA_r18seccion1i1-la-cifra-que-llevamos-das_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: troubleshooting Summary: EPISODIO 1 — MEMORIA: [R18.seccion1.I1] La cifra que llevamos días persiguiendo
This commit is contained in:
parent
70adb59bd1
commit
029c84cef3
1 changed files with 49 additions and 0 deletions
|
|
@ -0,0 +1,49 @@
|
||||||
|
---
|
||||||
|
episode_id: "dfdf4699-2966-4442-9e0f-29c8debe2e2f"
|
||||||
|
puente_flat: "DEPURA_r18seccion1i1-la-cifra-que-llevamos-das_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260828.SID3E411925EAA3"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "TESSERA"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 1 — MEMORIA: [R18.seccion1.I1] La cifra que llevamos días persiguiendo mi"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-09-01T03:34:38.779663+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
Auditoría cerrada y hallazgo medido. Te cuento lo importante.
|
||||||
|
|
||||||
|
—
|
||||||
|
|
||||||
|
## [R18.seccion1.I1] La cifra que llevamos días persiguiendo mide el examen, no la memoria
|
||||||
|
|
||||||
|
Puse a competir dos exámenes sobre **el mismo recuperador, el mismo corpus y los mismos episodios**. Solo cambié de dónde salen las preguntas:
|
||||||
|
|
||||||
|
| Examen | corpus 200 | corpus 700 |
|
||||||
|
|---|---|---|
|
||||||
|
| El que usan todas nuestras métricas | **0,08** | **0,04** |
|
||||||
|
| Preguntas hechas desde el contenido | **0,70** | **0,62** |
|
||||||
|
|
||||||
|
**Diferencia: 0,62.** Y el tamaño del corpus —mi sospecha— explica apenas **0,08**. No manda el corpus: manda el examen.
|
||||||
|
|
||||||
|
**Y aquí viene la parte que no te puedo vender como buena noticia.** Sería fácil decirte "tu memoria acierta el 70 %, no el 14 %". Sería falso. El examen fácil genera la pregunta *a partir del texto* y luego busca *contra ese mismo texto* — es casi pedir "encuentra el párrafo del que salió esta pregunta". Los dos exámenes están sesgados, **en direcciones opuestas**: uno hunde la cifra, el otro la infla.
|
||||||
|
|
||||||
|
Lo que sí queda establecido, y basta para cambiar cómo decidimos: **la cifra real está entre 0,08 y 0,70, y ningún experimento nuestro la determina**. Cualquier decisión tomada contra un número concreto de recall está tomada contra una propiedad del examen elegido.
|
||||||
|
|
||||||
|
`★ Insight ─────────────────────────────────────`
|
||||||
|
Cuando dos instrumentos discrepan seis veces más que el efecto que buscan medir, el resultado no es "uno de los dos miente" — es que la magnitud carece de sentido hasta fijar el instrumento. Esa es la definición operativa de una métrica no calibrada.
|
||||||
|
Esto explica el patrón que os persigue desde julio: siete hipótesis medidas contra este banco, siete resultados desconcertantes. Cuando el instrumento domina la señal, los experimentos miden el instrumento.
|
||||||
|
`─────────────────────────────────────────────────`
|
||||||
|
|
||||||
|
**Lo que NO se cae con esto:** el reordenador desplegado. Su medición es *pareada* —mismo examen, mismo corpus, solo cambia el reordenamiento— y un examen sesgado desplaza los dos brazos por igual. La ganancia (×2) sobrevive; lo que queda en duda es el nivel absoluto.
|
||||||
|
|
||||||
|
—
|
||||||
|
|
||||||
|
## [R18.seccion2.L1] Lo que encontré roto al auditar
|
||||||
|
|
||||||
|
Revisando lo truncado, apareció esto:
|
||||||
Loading…
Reference in a new issue