feat(episode): TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en
This commit is contained in:
parent
1cf3867132
commit
00a17647bd
1 changed files with 52 additions and 0 deletions
|
|
@ -0,0 +1,52 @@
|
|||
---
|
||||
episode_id: "30a2fa48-ff2d-44f3-9528-00cb4d4568ff"
|
||||
puente_flat: "TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||
session_code: "S20260808.MEMORIA_SOTA_BRECHA"
|
||||
acto_dialogico: "informar"
|
||||
actor_flujo: "multi_actor"
|
||||
criticidad_aegis: "low"
|
||||
skill_dominante: "NONE"
|
||||
fase_proyecto: "operations"
|
||||
tipo_semantico: "troubleshooting"
|
||||
summary_one_line: "EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en "
|
||||
source_type: "claude_code"
|
||||
trust_boundary: "internal"
|
||||
created_at: "2026-08-12T00:58:17.228670+00:00"
|
||||
relectura_tagged: false
|
||||
forgejo_commit_sha: "pending"
|
||||
---
|
||||
|
||||
Fable devolvió, y **tu idea de la doble medición acaba de justificarse sola**.
|
||||
|
||||
## Las dos mediciones coinciden en el veredicto y discrepan en la magnitud
|
||||
|
||||
| | Opus 5 | Fable | Baseline texto |
|
||||
|---|---|---|---|
|
||||
| `recall@1` | 0.069 | **0.029** | 0.146 |
|
||||
| `recall@10` | 0.249 | **0.160** | 0.420 |
|
||||
|
||||
**Ambos refutamos la hipótesis.** Pero él midió con **calibración interna**: corrió un tercer brazo contra el texto para comprobar que su instrumento reproducía el baseline antes de reportar nada. Le salió `0.1457 / 0.42` — clavado. Su instrumento dice la verdad, así que su número es el bueno y el mío era **optimista**.
|
||||
|
||||
`★ Insight ─────────────────────────────────────`
|
||||
La diferencia entre ambos viene de un detalle de diseño: yo colapsé resultados a episodio único tomando el primero que aparecía; él probó **dos agregaciones distintas** y añadió un brazo de control. Mi 0.069 salió inflado por la forma de contar, no por el sistema. **Eso es exactamente lo que tu control cruzado tenía que atrapar.**
|
||||
`─────────────────────────────────────────────────`
|
||||
|
||||
## Y encontró la causa que yo no vi
|
||||
|
||||
Yo diagnostiqué "desajuste de idioma entre el examen y las preguntas". Fable **midió** algo más grave:
|
||||
|
||||
> **5.464 preguntas duplicadas.** La más frecuente aparece **74 veces**, y es literalmente: *"¿qué información hay sobre X en el ecosistema EMBER?"*
|
||||
|
||||
Eso es **exactamente el patrón que la doctrina MH-3 de EMBER prohíbe** — la regla dice que las preguntas deben ser específicas y discriminativas, y pone ese ejemplo genérico como lo que no se debe hacer. Huelen a relleno mecánico del backfill de julio, no a autoría real.
|
||||
|
||||
Yo medí 19,5% de duplicación literal y lo di por tolerable. Él fue a mirar **cuáles** eran las duplicadas y encontró que las repetidas son justo las inútiles.
|
||||
|
||||
**Traducción:** las preguntas sembradas no fallan por el examen. Fallan porque **una parte importante son plantillas que violan su propia norma**.
|
||||
|
||||
## Dos hallazgos colaterales que importan más que el experimento
|
||||
|
||||
**`puente_flat` está vacío en 1.596 de 1.603 payloads.** La identidad viva es `puente_id`. Yo lo vi como curiosidad; él chocó de frente —su primer intento colapsó la colección en 8 grupos— y le puso un guard. **Mi inventario de los 52 campos tiene ese error**: listé `puente_flat` como el identificador cross-store cuando el poblado es otro.
|
||||
|
||||
**La colección creció durante la medición** (1.602 → 1.603). El universo no está congelado mientras se mide.
|
||||
|
||||
## Lo honesto sobre mi propia medición
|
||||
Loading…
Reference in a new issue