feat(episode): TRAZA_mi-0069-era-optimista-y-no-lo-detect_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — Ember: Mi `0.069` era optimista y no lo detecté...
This commit is contained in:
Ember 2026-08-12 01:44:54 +00:00
parent c7000ceb24
commit fa13c2486e

View file

@ -0,0 +1,45 @@
---
episode_id: "6dfab13c-88a9-4cd9-ac0b-e4aa7ccf63f5"
puente_flat: "TRAZA_mi-0069-era-optimista-y-no-lo-detect_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260808.MEMORIA_SOTA_BRECHA"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 2 — Ember: Mi `0.069` era optimista y no lo detecté..."
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-12T01:44:39.946981+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Mi `0.069` era optimista y no lo detecté porque **no puse brazo de control**. Fable sí. Si hubiéramos medido solo yo, habríamos reportado un número mejor del real y con un diagnóstico incompleto.
**Veredicto conjunto:** indexar las preguntas sembradas **tal como están hoy, NO paga** — empeora el recall entre 2 y 5 veces. La rama R1 del plan de Fable queda cerrada en su forma actual.
**Pero la idea no está muerta**, y ambos coincidimos en el límite: solo probamos **sustitución pura**. Una fusión de texto **más** preguntas sigue sin probarse. Y sobre todo: no se refutó que preguntas de calidad real paguen — se refutó que **estas** paguen, y una parte no cumple su propia norma.
**Lo que yo haría ahora**, y es más barato que todo lo anterior: **auditar la cosecha de preguntas sembradas**. Si el 33% son plantillas que violan MH-3, el problema no es la idea sino la calidad del dato — y hay una regla en la casa que ya lo prohíbe y no se está cumpliendo.
Tengo tres cosas que corregir por mi parte: el inventario dice `puente_flat` donde debería decir `puente_id`, mi medición necesita la nota de que era optimista, y falta registrar todo esto. ¿Lo hago ahora?
Todo respaldado en los tres remotos.
**⚗️ [`docs/EXPERIMENTO_DUAL_PREGUNTAS_SEMBRADAS_S20260811.md`](docs/EXPERIMENTO_DUAL_PREGUNTAS_SEMBRADAS_S20260811.md)** · inventario corregido con aviso.
*(El detector señala 5 documentos archivados que mencionan bugs relacionados. Están en `archive/`, fuera de la lista de monitorización activa — lo dejo anotado, no propago avisos a material archivado sin que lo pidas.)*
## Lo que quedó registrado
**El veredicto:** indexar las preguntas sembradas **empeora** el recall. Refutado con dos mediciones independientes. La rama R1 del plan queda cerrada.
**La causa, que es lo valioso:** una de cada tres preguntas sembradas es una plantilla. La más repetida aparece **74 veces** y dice *"¿qué información hay sobre X en el ecosistema EMBER?"* — el ejemplo exacto que la norma MH-3 pone como lo que **no** se debe escribir.
`★ Insight ─────────────────────────────────────`
El problema nunca fue la idea. EMBER tiene una regla que exige preguntas específicas y discriminativas, **y esa regla no se está cumpliendo**. Una cadena idéntica apuntando a 74 episodios no puede distinguir ninguno: es aritméticamente imposible. Buscábamos un mecanismo de recuperación mejor cuando lo que falla es el dato que se escribe.
`─────────────────────────────────────────────────`
## Sobre mi propia medición