ember-memory-test/episodes/DEPURA_t-25-cerrada-el-hallazgo-sobrevive-y-el_S20260831.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 1fdb210760 feat(episode): DEPURA_t-25-cerrada-el-hallazgo-sobrevive-y-el_S20260831.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: T-25 cerrada: el hallazgo sobrevive, y el mecanis
2026-09-02 19:21:23 +00:00

3 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
bb71cf7a-deda-4111-a84e-928d2ad504aa DEPURA_t-25-cerrada-el-hallazgo-sobrevive-y-el_S20260831.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260831.SID4EC5B030F7F0 informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: T-25 cerrada: el hallazgo sobrevive, y el mecanismo quedó pr claude_code internal 2026-09-02T19:21:22.716988+00:00 false pending

T-25 cerrada: el hallazgo sobrevive, y el mecanismo quedó probado

Las tres lentes adversariales dieron refutado = false — el núcleo aguantó. Y el experimento decisivo del mecanismo confirmó el porqué. Todo en los tres remotos (ed19eedc).

El experimento que lo explica (309 preguntas, 4 brazos pareados, producción intacta)

Brazo acierto @1 vs denso p
denso (control) 0,3172 — reproduce exacto
B · solo título (lo que corre hoy) 0,1489 −0,168 1,8e-09
C · título + resumen 0,2686 −0,049 0,137 (ya no distinguible)
D · solo resumen 0,2848 −0,032 0,373 (ya no distinguible)

Darle más información recupera casi toda la caída (C y D baten a B con p≈3e-06 y 3e-05). El diagnóstico "estaba ciego" es correcto.

★ Insight ───────────────────────────────────── Pero aquí está lo que cambia la conclusión, y es mejor que la alarma inicial: ni C ni D superan al denso. En el mejor caso lo empatan, pagando 435 tokens por consulta. O sea: el reordenador no está roto — está de más. Curarle la ceguera lo lleva de dañino a inútil, no a útil. Esa es una conclusión mucho más accionable que "hay que arreglarlo". ─────────────────────────────────────────────────

Tres correcciones a lo que te dije, y son mías

La verificación adversarial hizo su trabajo contra mí, y te las paso sin suavizar:

1. "Casi a la mitad" era impreciso — es 0,42× a 0,58× según la profundidad; para K=10 y K=20 es peor que la mitad.

2. "Habría degradado producción" fue una sobre-extrapolación. El daño se concentra en la cabeza del ranking: el conjunto de candidatos dentro de la ventana reordenada no cambia (recall@10 del brazo K=10 es idéntico al denso). Un consumidor que vuelque los diez primeros al contexto sufriría mucho menos de lo que sugerí.

3. Te vendí un control de sanidad más fuerte de lo que es. Dije "dos instrumentos independientes coincidiendo al dígito" — el verificador señaló que ambos comparten la función de normalización, la colección, el K y la ruta de embedding. Comparten linaje: es un buen control interno, no una réplica independiente. Retiro esa palabra.