feat(episode): TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en
This commit is contained in:
Ember 2026-08-12 00:58:30 +00:00
parent 1cf3867132
commit 00a17647bd

View file

@ -0,0 +1,52 @@
---
episode_id: "30a2fa48-ff2d-44f3-9528-00cb4d4568ff"
puente_flat: "TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260808.MEMORIA_SOTA_BRECHA"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en "
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-12T00:58:17.228670+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Fable devolvió, y **tu idea de la doble medición acaba de justificarse sola**.
## Las dos mediciones coinciden en el veredicto y discrepan en la magnitud
| | Opus 5 | Fable | Baseline texto |
|---|---|---|---|
| `recall@1` | 0.069 | **0.029** | 0.146 |
| `recall@10` | 0.249 | **0.160** | 0.420 |
**Ambos refutamos la hipótesis.** Pero él midió con **calibración interna**: corrió un tercer brazo contra el texto para comprobar que su instrumento reproducía el baseline antes de reportar nada. Le salió `0.1457 / 0.42` — clavado. Su instrumento dice la verdad, así que su número es el bueno y el mío era **optimista**.
`★ Insight ─────────────────────────────────────`
La diferencia entre ambos viene de un detalle de diseño: yo colapsé resultados a episodio único tomando el primero que aparecía; él probó **dos agregaciones distintas** y añadió un brazo de control. Mi 0.069 salió inflado por la forma de contar, no por el sistema. **Eso es exactamente lo que tu control cruzado tenía que atrapar.**
`─────────────────────────────────────────────────`
## Y encontró la causa que yo no vi
Yo diagnostiqué "desajuste de idioma entre el examen y las preguntas". Fable **midió** algo más grave:
> **5.464 preguntas duplicadas.** La más frecuente aparece **74 veces**, y es literalmente: *"¿qué información hay sobre X en el ecosistema EMBER?"*
Eso es **exactamente el patrón que la doctrina MH-3 de EMBER prohíbe** — la regla dice que las preguntas deben ser específicas y discriminativas, y pone ese ejemplo genérico como lo que no se debe hacer. Huelen a relleno mecánico del backfill de julio, no a autoría real.
Yo medí 19,5% de duplicación literal y lo di por tolerable. Él fue a mirar **cuáles** eran las duplicadas y encontró que las repetidas son justo las inútiles.
**Traducción:** las preguntas sembradas no fallan por el examen. Fallan porque **una parte importante son plantillas que violan su propia norma**.
## Dos hallazgos colaterales que importan más que el experimento
**`puente_flat` está vacío en 1.596 de 1.603 payloads.** La identidad viva es `puente_id`. Yo lo vi como curiosidad; él chocó de frente —su primer intento colapsó la colección en 8 grupos— y le puso un guard. **Mi inventario de los 52 campos tiene ese error**: listé `puente_flat` como el identificador cross-store cuando el poblado es otro.
**La colección creció durante la medición** (1.602 → 1.603). El universo no está congelado mientras se mide.
## Lo honesto sobre mi propia medición