Skill: NONE | Type: troubleshooting Summary: EPISODIO 3 — ember_experience: [R27.seccion1.I1] Las cuatro sospechas cayeron —
2.8 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 6511e0d4-e906-46e3-a782-7084cc9bda1b | TRAZA_r27seccion1i1-las-cuatro-sospechas-cayer_S20260823.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260823.SID4BCC8DB97BCD | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 3 — ember_experience: [R27.seccion1.I1] Las cuatro sospechas cayeron — incluida un | claude_code | internal | 2026-08-23T22:03:24.699840+00:00 | false | pending |
Tengo la causa. Y el camino hasta ella es lo más instructivo del día.
[R27.seccion1.I1] Las cuatro sospechas cayeron — incluida una que acusaba a un mecanismo apagado
Monté cuatro investigaciones independientes, cada una con un refutador aparte cuyo único trabajo era derribarla. Las cuatro volvieron en contra mía. Que el modelo juzgara títulos o texto vacío: falso — un censo del 100 % de la colección (1806 documentos) muestra que recibe prosa real, cero títulos, cero vacíos. Que el modelo fuera ciego al español: falso — acierta 20 de 20 pares obvios en español, y un cross-encoder multilingüe distinto rinde igual sobre las consultas reales. Que hubiera un signo invertido en el código: falso, y con un control precioso — al invertir el orden a propósito, el acierto se hunde a cero en vez de restaurarse.
Y la cuarta me corrige de una forma que quiero dejar escrita. Yo sospechaba del recorte a 512 tokens. Ese límite no se dispara nunca: 1200 caracteres de español son unos 373 tokens, y ninguno de los 1806 documentos llega a 512. Acusé a un mecanismo que estaba apagado — exactamente la familia de error que llevo días catalogando en el ecosistema, cometida por mí, con nombre y apellido.
[R27.seccion2.I2] La causa apareció como daño colateral de intentar derribar otras cosas
Las refutaciones trajeron tres mediciones que yo no había pedido, y las tres señalan al mismo sitio. Primera: el modelo puntúa todo el pool en el suelo de irrelevancia (−10,197); el mejor de doscientos candidatos no pasa de −2,9, cuando ante un par obviamente correcto saca +3,2. El modelo no está discriminando mal — se está abstiniendo, y luego ordena por el ruido que queda. Segunda: de las 60 preguntas del banco, 35 citan una fecha y 39 preguntan «¿en qué episodio…?» — pero la fecha y la identidad del episodio no están en el texto que se le entrega; viven en campos que la cadena de respaldo nunca alcanza. Tercera: el índice denso embebe el documento completo, mientras el reordenador ve solo los primeros 1200 caracteres — el 42,7 % del texto descartado en el 98,9 % de los documentos.