ember-memory-test/episodes/TRAZA_r39seccion1i1-lo-que-sobrevive-limpio-y_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 99e7ef7917 feat(episode): TRAZA_r39seccion1i1-lo-que-sobrevive-limpio-y_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: [R39.seccion1.I1] Lo que sobrevive limpio, y es r
2026-08-28 02:17:37 +00:00

2.4 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
ba2d1cee-f0e8-428c-a856-a582f771ed73 TRAZA_r39seccion1i1-lo-que-sobrevive-limpio-y_S20260823.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260823.SID4BCC8DB97BCD informar multi_actor low NONE operations troubleshooting EPISODIO 2 — MNEMO_PRE_DIGEST: [R39.seccion1.I1] Lo que sobrevive limpio, y es real claude_code internal 2026-08-28T02:17:31.145180+00:00 false pending

El ataque hizo su trabajo. Una conclusión sobrevive, otra pierde su adjetivo, y la tercera —la que más me convenía— cae entera.

[R39.seccion1.I1] Lo que sobrevive limpio, y es real

El título aporta información de verdad, no un truco geométrico. La prueba es el placebo: un texto idéntico en los 387 documentos, incapaz por construcción de distinguir uno de otro. El título le gana en los tres terciles (13 a 1, 9 a 4, 11 a 1). En el tercio donde la búsqueda actual falla más, la separación es nítida: de 0,041 a 0,098 con el placebo, y a 0,330 con el título. Y hay un dato que no esperaba: los aciertos del título son un superconjunto estricto de los actuales — no cuesta ni un acierto, con un daño total de 45 puestos frente a 3.513 de ganancia.

[R39.seccion2.I2] Lo que cae, y por qué la situación es peor de lo que temía

Escribí que la sospecha de fuga se debilitaba. Es falso, y por cinco razones independientes. La más dura: mi variable no mide fuga. El refutador midió la fuga real —comparando cada pregunta con su propio título en el espacio semántico— y la correlación con mi medida léxica es −0,005. Cero. Estaba estratificando por algo que no tiene relación con lo que decía medir.

Y al re-estratificar por la fuga de verdad, el resultado se da la vuelta: en el tercio más limpio, el título no gana ni un acierto en primera posición (0,0000 → 0,0000). Todo el acierto vive en los estratos contaminados. El motivo de fondo apareció también: el banco de preguntas lo generó un modelo que veía los títulos —gemini-2.5-flash-lite— y el 28 % de las preguntas parafrasean el número del episodio sin compartir una sola palabra. Por eso mi tercil «bajo» resultaba ser el más contaminado, justo al revés de lo que supuse.