ember-memory-test/episodes/TRAZA_mi-0069-era-optimista-y-no-lo-detect_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember fa13c2486e feat(episode): TRAZA_mi-0069-era-optimista-y-no-lo-detect_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — Ember: Mi `0.069` era optimista y no lo detecté...
2026-08-12 01:44:54 +00:00

3.3 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
6dfab13c-88a9-4cd9-ac0b-e4aa7ccf63f5 TRAZA_mi-0069-era-optimista-y-no-lo-detect_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260808.MEMORIA_SOTA_BRECHA informar multi_actor low NONE operations troubleshooting EPISODIO 2 — Ember: Mi `0.069` era optimista y no lo detecté... claude_code internal 2026-08-12T01:44:39.946981+00:00 false pending

Mi 0.069 era optimista y no lo detecté porque no puse brazo de control. Fable sí. Si hubiéramos medido solo yo, habríamos reportado un número mejor del real y con un diagnóstico incompleto.

Veredicto conjunto: indexar las preguntas sembradas tal como están hoy, NO paga — empeora el recall entre 2 y 5 veces. La rama R1 del plan de Fable queda cerrada en su forma actual.

Pero la idea no está muerta, y ambos coincidimos en el límite: solo probamos sustitución pura. Una fusión de texto más preguntas sigue sin probarse. Y sobre todo: no se refutó que preguntas de calidad real paguen — se refutó que estas paguen, y una parte no cumple su propia norma.

Lo que yo haría ahora, y es más barato que todo lo anterior: auditar la cosecha de preguntas sembradas. Si el 33% son plantillas que violan MH-3, el problema no es la idea sino la calidad del dato — y hay una regla en la casa que ya lo prohíbe y no se está cumpliendo.

Tengo tres cosas que corregir por mi parte: el inventario dice puente_flat donde debería decir puente_id, mi medición necesita la nota de que era optimista, y falta registrar todo esto. ¿Lo hago ahora?

Todo respaldado en los tres remotos.

⚗️ docs/EXPERIMENTO_DUAL_PREGUNTAS_SEMBRADAS_S20260811.md · inventario corregido con aviso.

(El detector señala 5 documentos archivados que mencionan bugs relacionados. Están en archive/, fuera de la lista de monitorización activa — lo dejo anotado, no propago avisos a material archivado sin que lo pidas.)

Lo que quedó registrado

El veredicto: indexar las preguntas sembradas empeora el recall. Refutado con dos mediciones independientes. La rama R1 del plan queda cerrada.

La causa, que es lo valioso: una de cada tres preguntas sembradas es una plantilla. La más repetida aparece 74 veces y dice "¿qué información hay sobre X en el ecosistema EMBER?" — el ejemplo exacto que la norma MH-3 pone como lo que no se debe escribir.

★ Insight ───────────────────────────────────── El problema nunca fue la idea. EMBER tiene una regla que exige preguntas específicas y discriminativas, y esa regla no se está cumpliendo. Una cadena idéntica apuntando a 74 episodios no puede distinguir ninguno: es aritméticamente imposible. Buscábamos un mecanismo de recuperación mejor cuando lo que falla es el dato que se escribe. ─────────────────────────────────────────────────

Sobre mi propia medición