feat(episode): TRAZA_r2seccion1i1-lo-que-encontr-el-sistema-b_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 1 — LUMEN-LLM: [R2.seccion1.I1] Lo que encontré: el sistema busca bien
This commit is contained in:
Ember 2026-08-29 00:27:37 +00:00
parent 5a411ff1d1
commit a93d18899c

View file

@ -0,0 +1,45 @@
---
episode_id: "d77f0632-ffa4-4d0d-9fb8-bd94bc255a66"
puente_flat: "TRAZA_r2seccion1i1-lo-que-encontr-el-sistema-b_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260828.SID3E411925EAA3"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "TESSERA"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — LUMEN-LLM: [R2.seccion1.I1] Lo que encontré: el sistema busca bien y en"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-29T00:27:34.741904+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Scan de la fase 1 cerrado con medición propia. Te resumo el hallazgo en llano.
—
## [R2.seccion1.I1] Lo que encontré: el sistema busca bien y entrega mal
Imagina un bibliotecario al que le pides un libro. Va al estante correcto, saca diez libros, y **casi la mitad de las veces el tuyo está entre esos diez** — pero te entrega el de encima, que es el equivocado en 2 de cada 3 ocasiones.
Eso es exactamente lo que mide el retrieval hoy, con banco limpio y sobre el código que de verdad corre:
| | |
|---|---|
| Lo encuentra entre los 10 primeros | **40,7 %** |
| Lo entrega en primer lugar | **14,0 %** |
| **Lo que se pierde solo por orden** | **26,7 puntos** |
Esos 26,7 puntos **no necesitan** mejor búsqueda, ni reindexar, ni cambiar el modelo de embeddings. El recuerdo correcto ya está en la mano. Se cae al ordenar.
—
## [R2.seccion2.L1] Tres cosas que descarté por el camino (dos eran mías)
**1. La "mejora x3 bloqueada por el freeze" no existe.** Te la mencioné hace dos turnos y **estaba equivocado**: la saqué de un documento del 23 de agosto. El código vivo lleva el aviso — ese experimento se declaró *fuga de información* (las preguntas salían del propio episodio que debían encontrar, inflado ~8×). La cifra honesta dice lo contrario: la fusión **resta** 5,7 puntos de acierto. Cuatro jueces externos convergieron en retirarla y tú firmaste esa retirada el 22 de agosto. **Encenderla empeoraría el sistema.**
**2. Mi hipótesis del filtro, refutada por mí mismo.** Vi que el camino desplegado descarta candidatos dentro del motor de búsqueda (corte en 0,45) mientras el camino apagado los miraba todos. Parecía recall perdido. Lo medí aislando esa única variable: **delta exactamente 0,0**. Cero correctos por debajo del corte en 150 consultas. Hipótesis muerta, limpia.
**3. Casi publico un falso hallazgo.** La primera pasada dio 8,3 % y sospeché del sistema. Pero el identificador vive en Qdrant en formato largo y en el banco en formato corto — si mi comparador fallaba, todos los ceros eran mentira. Hice el control antes de escribir: **309 de 309 objetivos existen en la colección, cobertura 100 %**. El instrumento es sano, así que la cifra es real.