Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en
3.3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 30a2fa48-ff2d-44f3-9528-00cb4d4568ff | TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260808.MEMORIA_SOTA_BRECHA | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en | claude_code | internal | 2026-08-12T00:58:17.228670+00:00 | false | pending |
Fable devolvió, y tu idea de la doble medición acaba de justificarse sola.
Las dos mediciones coinciden en el veredicto y discrepan en la magnitud
| Opus 5 | Fable | Baseline texto | |
|---|---|---|---|
recall@1 |
0.069 | 0.029 | 0.146 |
recall@10 |
0.249 | 0.160 | 0.420 |
Ambos refutamos la hipótesis. Pero él midió con calibración interna: corrió un tercer brazo contra el texto para comprobar que su instrumento reproducía el baseline antes de reportar nada. Le salió 0.1457 / 0.42 — clavado. Su instrumento dice la verdad, así que su número es el bueno y el mío era optimista.
★ Insight ─────────────────────────────────────
La diferencia entre ambos viene de un detalle de diseño: yo colapsé resultados a episodio único tomando el primero que aparecía; él probó dos agregaciones distintas y añadió un brazo de control. Mi 0.069 salió inflado por la forma de contar, no por el sistema. Eso es exactamente lo que tu control cruzado tenía que atrapar.
─────────────────────────────────────────────────
Y encontró la causa que yo no vi
Yo diagnostiqué "desajuste de idioma entre el examen y las preguntas". Fable midió algo más grave:
5.464 preguntas duplicadas. La más frecuente aparece 74 veces, y es literalmente: "¿qué información hay sobre X en el ecosistema EMBER?"
Eso es exactamente el patrón que la doctrina MH-3 de EMBER prohíbe — la regla dice que las preguntas deben ser específicas y discriminativas, y pone ese ejemplo genérico como lo que no se debe hacer. Huelen a relleno mecánico del backfill de julio, no a autoría real.
Yo medí 19,5% de duplicación literal y lo di por tolerable. Él fue a mirar cuáles eran las duplicadas y encontró que las repetidas son justo las inútiles.
Traducción: las preguntas sembradas no fallan por el examen. Fallan porque una parte importante son plantillas que violan su propia norma.
Dos hallazgos colaterales que importan más que el experimento
puente_flat está vacío en 1.596 de 1.603 payloads. La identidad viva es puente_id. Yo lo vi como curiosidad; él chocó de frente —su primer intento colapsó la colección en 8 grupos— y le puso un guard. Mi inventario de los 52 campos tiene ese error: listé puente_flat como el identificador cross-store cuando el poblado es otro.
La colección creció durante la medición (1.602 → 1.603). El universo no está congelado mientras se mide.