ember-memory-test/episodes/TRAZA_lo-que-se-repar_S20260821.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 22fdf4963e feat(episode): TRAZA_lo-que-se-repar_S20260821.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que se reparó
2026-08-22 03:15:27 +00:00

3.1 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
7c8809cc-5441-4eb6-b624-e228a338f8ae TRAZA_lo-que-se-repar_S20260821.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260821.PIPELINE_MEMORIA_SELFAWARENESS informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que se reparó claude_code internal 2026-08-22T03:15:12.736194+00:00 false pending

Todo en los tres remotos (3165c143). Resumen de las dos horas.

Lo que se reparó

El canario no podía pasar nunca. Su muestra de 15 episodios tenía solo 12 preguntas distintas — una repetida 3 veces, otra 2. Una misma pregunta no puede poner a dos episodios en el puesto 1, así que 3 fallos eran inevitables: techo real 80% contra un umbral de 90%. Era una imposibilidad estructural, no debilidad del retrieval. La lente había estimado 86,7%; medido son 80.

Y algo que importa: el fix no maquilló el número. HIT@1 pasó de 20% a 25% — quité la imposibilidad, no fabriqué un aprobado. La debilidad real sigue a la vista.

El gate de retrieval te daba una cifra al doble de la real. Su oráculo declaraba tres veces medir producción; producción no contiene fusión. Ahora publica los dos caminos:

recall@1 recall@10
Medido (fusión, no desplegada) 0.413 0.648
Desplegado (dense, el que corre) 0.216 0.467

Esto resuelve el conflicto C-02 del escaneo. El 0.216 concuerda con el 25% del canario. Las tres cifras contradictorias eran dos instrumentos midiendo caminos distintos; ahora cada uno declara cuál mide, y coinciden. El canario decía la verdad; el gate medía un fantasma.

★ Insight ───────────────────────────────────── Rompí la cadena mientras la reparaba. Parcheé el oráculo, corrí el gate, y las claves nuevas no aparecieron: retrieval_gate.py armaba su veredicto con una lista fija de campos y los dejaba caer. Es la clase 4.3 del catálogo —cambias el productor, el consumidor queda ciego— cometida en el acto mismo de arreglarla.

Solo se vio porque verifiqué en vez de declarar. Si hubiera reportado "listo, ya publica dense_recall", habría sido literalmente falso, y el error habría sobrevivido en un commit que dice lo contrario.

Y un caveat que dejé anotado en la decisión: aquí la fusión (0.413) supera al dense (0.216), lo cual parece contradecir tu decisión del 14 de agosto. No la contradice: hyde_recall usa las preguntas del propio episodio — el leakage que la auditoría midió inflado ~8x. El lockbox held-out dice lo opuesto. Quien lea "0.413 > 0.216" y concluya que la fusión es mejor repetiría el error que este escaneo ya cazó. ─────────────────────────────────────────────────