Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — Ember: Mi `0.069` era optimista y no lo detecté...
3.3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 6dfab13c-88a9-4cd9-ac0b-e4aa7ccf63f5 | TRAZA_mi-0069-era-optimista-y-no-lo-detect_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260808.MEMORIA_SOTA_BRECHA | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 2 — Ember: Mi `0.069` era optimista y no lo detecté... | claude_code | internal | 2026-08-12T01:44:39.946981+00:00 | false | pending |
Mi 0.069 era optimista y no lo detecté porque no puse brazo de control. Fable sí. Si hubiéramos medido solo yo, habríamos reportado un número mejor del real y con un diagnóstico incompleto.
Veredicto conjunto: indexar las preguntas sembradas tal como están hoy, NO paga — empeora el recall entre 2 y 5 veces. La rama R1 del plan de Fable queda cerrada en su forma actual.
Pero la idea no está muerta, y ambos coincidimos en el límite: solo probamos sustitución pura. Una fusión de texto más preguntas sigue sin probarse. Y sobre todo: no se refutó que preguntas de calidad real paguen — se refutó que estas paguen, y una parte no cumple su propia norma.
Lo que yo haría ahora, y es más barato que todo lo anterior: auditar la cosecha de preguntas sembradas. Si el 33% son plantillas que violan MH-3, el problema no es la idea sino la calidad del dato — y hay una regla en la casa que ya lo prohíbe y no se está cumpliendo.
Tengo tres cosas que corregir por mi parte: el inventario dice puente_flat donde debería decir puente_id, mi medición necesita la nota de que era optimista, y falta registrar todo esto. ¿Lo hago ahora?
Todo respaldado en los tres remotos.
⚗️ docs/EXPERIMENTO_DUAL_PREGUNTAS_SEMBRADAS_S20260811.md · inventario corregido con aviso.
(El detector señala 5 documentos archivados que mencionan bugs relacionados. Están en archive/, fuera de la lista de monitorización activa — lo dejo anotado, no propago avisos a material archivado sin que lo pidas.)
Lo que quedó registrado
El veredicto: indexar las preguntas sembradas empeora el recall. Refutado con dos mediciones independientes. La rama R1 del plan queda cerrada.
La causa, que es lo valioso: una de cada tres preguntas sembradas es una plantilla. La más repetida aparece 74 veces y dice "¿qué información hay sobre X en el ecosistema EMBER?" — el ejemplo exacto que la norma MH-3 pone como lo que no se debe escribir.
★ Insight ─────────────────────────────────────
El problema nunca fue la idea. EMBER tiene una regla que exige preguntas específicas y discriminativas, y esa regla no se está cumpliendo. Una cadena idéntica apuntando a 74 episodios no puede distinguir ninguno: es aritméticamente imposible. Buscábamos un mecanismo de recuperación mejor cuando lo que falla es el dato que se escribe.
─────────────────────────────────────────────────