Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que se reparó
3.1 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 7c8809cc-5441-4eb6-b624-e228a338f8ae | TRAZA_lo-que-se-repar_S20260821.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260821.PIPELINE_MEMORIA_SELFAWARENESS | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que se reparó | claude_code | internal | 2026-08-22T03:15:12.736194+00:00 | false | pending |
Todo en los tres remotos (3165c143). Resumen de las dos horas.
—
Lo que se reparó
El canario no podía pasar nunca. Su muestra de 15 episodios tenía solo 12 preguntas distintas — una repetida 3 veces, otra 2. Una misma pregunta no puede poner a dos episodios en el puesto 1, así que 3 fallos eran inevitables: techo real 80% contra un umbral de 90%. Era una imposibilidad estructural, no debilidad del retrieval. La lente había estimado 86,7%; medido son 80.
Y algo que importa: el fix no maquilló el número. HIT@1 pasó de 20% a 25% — quité la imposibilidad, no fabriqué un aprobado. La debilidad real sigue a la vista.
El gate de retrieval te daba una cifra al doble de la real. Su oráculo declaraba tres veces medir producción; producción no contiene fusión. Ahora publica los dos caminos:
| recall@1 | recall@10 | |
|---|---|---|
| Medido (fusión, no desplegada) | 0.413 | 0.648 |
| Desplegado (dense, el que corre) | 0.216 | 0.467 |
Esto resuelve el conflicto C-02 del escaneo. El
0.216concuerda con el 25% del canario. Las tres cifras contradictorias eran dos instrumentos midiendo caminos distintos; ahora cada uno declara cuál mide, y coinciden. El canario decía la verdad; el gate medía un fantasma.
★ Insight ─────────────────────────────────────
Rompí la cadena mientras la reparaba. Parcheé el oráculo, corrí el gate, y las claves nuevas no aparecieron: retrieval_gate.py armaba su veredicto con una lista fija de campos y los dejaba caer. Es la clase 4.3 del catálogo —cambias el productor, el consumidor queda ciego— cometida en el acto mismo de arreglarla.
Solo se vio porque verifiqué en vez de declarar. Si hubiera reportado "listo, ya publica dense_recall", habría sido literalmente falso, y el error habría sobrevivido en un commit que dice lo contrario.
Y un caveat que dejé anotado en la decisión: aquí la fusión (0.413) supera al dense (0.216), lo cual parece contradecir tu decisión del 14 de agosto. No la contradice: hyde_recall usa las preguntas del propio episodio — el leakage que la auditoría midió inflado ~8x. El lockbox held-out dice lo opuesto. Quien lea "0.413 > 0.216" y concluya que la fusión es mejor repetiría el error que este escaneo ya cazó.
─────────────────────────────────────────────────