feat(episode): TRAZA_r27seccion1i1-las-cuatro-sospechas-cayer_S20260823.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 3 — ember_experience: [R27.seccion1.I1] Las cuatro sospechas cayeron —
This commit is contained in:
Ember 2026-08-23 22:03:33 +00:00
parent 465011cb33
commit 403a36f305

View file

@ -0,0 +1,29 @@
---
episode_id: "6511e0d4-e906-46e3-a782-7084cc9bda1b"
puente_flat: "TRAZA_r27seccion1i1-las-cuatro-sospechas-cayer_S20260823.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260823.SID4BCC8DB97BCD"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 3 — ember_experience: [R27.seccion1.I1] Las cuatro sospechas cayeron — incluida un"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-23T22:03:24.699840+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Tengo la causa. Y el camino hasta ella es lo más instructivo del día.
## [R27.seccion1.I1] Las cuatro sospechas cayeron — incluida una que acusaba a un mecanismo apagado
Monté cuatro investigaciones independientes, cada una con **un refutador aparte cuyo único trabajo era derribarla**. Las cuatro volvieron en contra mía. Que el modelo juzgara títulos o texto vacío: **falso** — un censo del 100 % de la colección (1806 documentos) muestra que recibe prosa real, cero títulos, cero vacíos. Que el modelo fuera ciego al español: **falso** — acierta 20 de 20 pares obvios en español, y un cross-encoder multilingüe distinto rinde igual sobre las consultas reales. Que hubiera un signo invertido en el código: **falso**, y con un control precioso — al invertir el orden a propósito, el acierto **se hunde a cero** en vez de restaurarse.
Y la cuarta me corrige de una forma que quiero dejar escrita. Yo sospechaba del recorte a 512 tokens. **Ese límite no se dispara nunca**: 1200 caracteres de español son unos 373 tokens, y ninguno de los 1806 documentos llega a 512. **Acusé a un mecanismo que estaba apagado** — exactamente la familia de error que llevo días catalogando en el ecosistema, cometida por mí, con nombre y apellido.
## [R27.seccion2.I2] La causa apareció como daño colateral de intentar derribar otras cosas
Las refutaciones trajeron tres mediciones que yo no había pedido, y las tres señalan al mismo sitio. **Primera:** el modelo puntúa **todo el pool** en el suelo de irrelevancia (−10,197); el mejor de doscientos candidatos no pasa de −2,9, cuando ante un par obviamente correcto saca +3,2. El modelo no está discriminando mal — **se está abstiniendo**, y luego ordena por el ruido que queda. **Segunda:** de las 60 preguntas del banco, **35 citan una fecha** y **39 preguntan «¿en qué episodio…?»** — pero la fecha y la identidad del episodio **no están en el texto que se le entrega**; viven en campos que la cadena de respaldo nunca alcanza. **Tercera:** el índice denso embebe el documento **completo**, mientras el reordenador ve solo los primeros 1200 caracteres — el **42,7 % del texto descartado** en el 98,9 % de los documentos.