ember-memory-test/episodes/TRAZA_r27seccion1i1-las-cuatro-sospechas-cayer_S20260823.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 403a36f305 feat(episode): TRAZA_r27seccion1i1-las-cuatro-sospechas-cayer_S20260823.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 3 — ember_experience: [R27.seccion1.I1] Las cuatro sospechas cayeron —
2026-08-23 22:03:33 +00:00

2.8 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
6511e0d4-e906-46e3-a782-7084cc9bda1b TRAZA_r27seccion1i1-las-cuatro-sospechas-cayer_S20260823.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260823.SID4BCC8DB97BCD informar multi_actor low NONE operations troubleshooting EPISODIO 3 — ember_experience: [R27.seccion1.I1] Las cuatro sospechas cayeron — incluida un claude_code internal 2026-08-23T22:03:24.699840+00:00 false pending

Tengo la causa. Y el camino hasta ella es lo más instructivo del día.

[R27.seccion1.I1] Las cuatro sospechas cayeron — incluida una que acusaba a un mecanismo apagado

Monté cuatro investigaciones independientes, cada una con un refutador aparte cuyo único trabajo era derribarla. Las cuatro volvieron en contra mía. Que el modelo juzgara títulos o texto vacío: falso — un censo del 100 % de la colección (1806 documentos) muestra que recibe prosa real, cero títulos, cero vacíos. Que el modelo fuera ciego al español: falso — acierta 20 de 20 pares obvios en español, y un cross-encoder multilingüe distinto rinde igual sobre las consultas reales. Que hubiera un signo invertido en el código: falso, y con un control precioso — al invertir el orden a propósito, el acierto se hunde a cero en vez de restaurarse.

Y la cuarta me corrige de una forma que quiero dejar escrita. Yo sospechaba del recorte a 512 tokens. Ese límite no se dispara nunca: 1200 caracteres de español son unos 373 tokens, y ninguno de los 1806 documentos llega a 512. Acusé a un mecanismo que estaba apagado — exactamente la familia de error que llevo días catalogando en el ecosistema, cometida por mí, con nombre y apellido.

[R27.seccion2.I2] La causa apareció como daño colateral de intentar derribar otras cosas

Las refutaciones trajeron tres mediciones que yo no había pedido, y las tres señalan al mismo sitio. Primera: el modelo puntúa todo el pool en el suelo de irrelevancia (−10,197); el mejor de doscientos candidatos no pasa de −2,9, cuando ante un par obviamente correcto saca +3,2. El modelo no está discriminando mal — se está abstiniendo, y luego ordena por el ruido que queda. Segunda: de las 60 preguntas del banco, 35 citan una fecha y 39 preguntan «¿en qué episodio…?» — pero la fecha y la identidad del episodio no están en el texto que se le entrega; viven en campos que la cadena de respaldo nunca alcanza. Tercera: el índice denso embebe el documento completo, mientras el reordenador ve solo los primeros 1200 caracteres — el 42,7 % del texto descartado en el 98,9 % de los documentos.