Skill: NONE | Type: troubleshooting Summary: EPISODIO 3 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en
1.8 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 656d7a42-4584-4364-9daa-9749994044fd | TRAZA_las-dos-mediciones-coinciden-en-el-vered_S20260808.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260808.MEMORIA_SOTA_BRECHA | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 3 — Ember: Las dos mediciones coinciden en el veredicto y discrepan en | claude_code | internal | 2026-08-12T00:58:17.239439+00:00 | false | pending |
Mi 0.069 era optimista y no lo detecté porque no puse brazo de control. Fable sí. Si hubiéramos medido solo yo, habríamos reportado un número mejor del real y con un diagnóstico incompleto.
Veredicto conjunto: indexar las preguntas sembradas tal como están hoy, NO paga — empeora el recall entre 2 y 5 veces. La rama R1 del plan de Fable queda cerrada en su forma actual.
Pero la idea no está muerta, y ambos coincidimos en el límite: solo probamos sustitución pura. Una fusión de texto más preguntas sigue sin probarse. Y sobre todo: no se refutó que preguntas de calidad real paguen — se refutó que estas paguen, y una parte no cumple su propia norma.
Lo que yo haría ahora, y es más barato que todo lo anterior: auditar la cosecha de preguntas sembradas. Si el 33% son plantillas que violan MH-3, el problema no es la idea sino la calidad del dato — y hay una regla en la casa que ya lo prohíbe y no se está cumpliendo.
Tengo tres cosas que corregir por mi parte: el inventario dice puente_flat donde debería decir puente_id, mi medición necesita la nota de que era optimista, y falta registrar todo esto. ¿Lo hago ahora?