Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: T-25 cerrada: el hallazgo sobrevive, y el mecanis
3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| bb71cf7a-deda-4111-a84e-928d2ad504aa | DEPURA_t-25-cerrada-el-hallazgo-sobrevive-y-el_S20260831.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260831.SID4EC5B030F7F0 | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: T-25 cerrada: el hallazgo sobrevive, y el mecanismo quedó pr | claude_code | internal | 2026-09-02T19:21:22.716988+00:00 | false | pending |
T-25 cerrada: el hallazgo sobrevive, y el mecanismo quedó probado
Las tres lentes adversariales dieron refutado = false — el núcleo aguantó. Y el experimento decisivo del mecanismo confirmó el porqué. Todo en los tres remotos (ed19eedc).
El experimento que lo explica (309 preguntas, 4 brazos pareados, producción intacta)
| Brazo | acierto @1 | vs denso | p |
|---|---|---|---|
| denso (control) | 0,3172 | — | reproduce exacto |
| B · solo título (lo que corre hoy) | 0,1489 | −0,168 | 1,8e-09 |
| C · título + resumen | 0,2686 | −0,049 | 0,137 (ya no distinguible) |
| D · solo resumen | 0,2848 | −0,032 | 0,373 (ya no distinguible) |
Darle más información recupera casi toda la caída (C y D baten a B con p≈3e-06 y 3e-05). El diagnóstico "estaba ciego" es correcto.
★ Insight ─────────────────────────────────────
Pero aquí está lo que cambia la conclusión, y es mejor que la alarma inicial: ni C ni D superan al denso. En el mejor caso lo empatan, pagando 435 tokens por consulta. O sea: el reordenador no está roto — está de más. Curarle la ceguera lo lleva de dañino a inútil, no a útil. Esa es una conclusión mucho más accionable que "hay que arreglarlo".
─────────────────────────────────────────────────
Tres correcciones a lo que te dije, y son mías
La verificación adversarial hizo su trabajo contra mí, y te las paso sin suavizar:
1. "Casi a la mitad" era impreciso — es 0,42× a 0,58× según la profundidad; para K=10 y K=20 es peor que la mitad.
2. "Habría degradado producción" fue una sobre-extrapolación. El daño se concentra en la cabeza del ranking: el conjunto de candidatos dentro de la ventana reordenada no cambia (recall@10 del brazo K=10 es idéntico al denso). Un consumidor que vuelque los diez primeros al contexto sufriría mucho menos de lo que sugerí.
3. Te vendí un control de sanidad más fuerte de lo que es. Dije "dos instrumentos independientes coincidiendo al dígito" — el verificador señaló que ambos comparten la función de normalización, la colección, el K y la ruta de embedding. Comparten linaje: es un buen control interno, no una réplica independiente. Retiro esa palabra.