ember-memory-test/episodes/TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 00a17647bd feat(episode): TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en
2026-08-12 00:58:30 +00:00

3.3 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
30a2fa48-ff2d-44f3-9528-00cb4d4568ff TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260808.MEMORIA_SOTA_BRECHA informar multi_actor low NONE operations troubleshooting EPISODIO 2 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en claude_code internal 2026-08-12T00:58:17.228670+00:00 false pending

Fable devolvió, y tu idea de la doble medición acaba de justificarse sola.

Las dos mediciones coinciden en el veredicto y discrepan en la magnitud

Opus 5 Fable Baseline texto
recall@1 0.069 0.029 0.146
recall@10 0.249 0.160 0.420

Ambos refutamos la hipótesis. Pero él midió con calibración interna: corrió un tercer brazo contra el texto para comprobar que su instrumento reproducía el baseline antes de reportar nada. Le salió 0.1457 / 0.42 — clavado. Su instrumento dice la verdad, así que su número es el bueno y el mío era optimista.

★ Insight ───────────────────────────────────── La diferencia entre ambos viene de un detalle de diseño: yo colapsé resultados a episodio único tomando el primero que aparecía; él probó dos agregaciones distintas y añadió un brazo de control. Mi 0.069 salió inflado por la forma de contar, no por el sistema. Eso es exactamente lo que tu control cruzado tenía que atrapar. ─────────────────────────────────────────────────

Y encontró la causa que yo no vi

Yo diagnostiqué "desajuste de idioma entre el examen y las preguntas". Fable midió algo más grave:

5.464 preguntas duplicadas. La más frecuente aparece 74 veces, y es literalmente: "¿qué información hay sobre X en el ecosistema EMBER?"

Eso es exactamente el patrón que la doctrina MH-3 de EMBER prohíbe — la regla dice que las preguntas deben ser específicas y discriminativas, y pone ese ejemplo genérico como lo que no se debe hacer. Huelen a relleno mecánico del backfill de julio, no a autoría real.

Yo medí 19,5% de duplicación literal y lo di por tolerable. Él fue a mirar cuáles eran las duplicadas y encontró que las repetidas son justo las inútiles.

Traducción: las preguntas sembradas no fallan por el examen. Fallan porque una parte importante son plantillas que violan su propia norma.

Dos hallazgos colaterales que importan más que el experimento

puente_flat está vacío en 1.596 de 1.603 payloads. La identidad viva es puente_id. Yo lo vi como curiosidad; él chocó de frente —su primer intento colapsó la colección en 8 grupos— y le puso un guard. Mi inventario de los 52 campos tiene ese error: listé puente_flat como el identificador cross-store cuando el poblado es otro.

La colección creció durante la medición (1.602 → 1.603). El universo no está congelado mientras se mide.

Lo honesto sobre mi propia medición