feat(episode): TRAZA_r2seccion1i1-lo-que-encontr-el-sistema-b_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: troubleshooting Summary: EPISODIO 1 — LUMEN-LLM: [R2.seccion1.I1] Lo que encontré: el sistema busca bien
This commit is contained in:
parent
5a411ff1d1
commit
a93d18899c
1 changed files with 45 additions and 0 deletions
|
|
@ -0,0 +1,45 @@
|
||||||
|
---
|
||||||
|
episode_id: "d77f0632-ffa4-4d0d-9fb8-bd94bc255a66"
|
||||||
|
puente_flat: "TRAZA_r2seccion1i1-lo-que-encontr-el-sistema-b_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260828.SID3E411925EAA3"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "TESSERA"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 1 — LUMEN-LLM: [R2.seccion1.I1] Lo que encontré: el sistema busca bien y en"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-08-29T00:27:34.741904+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
Scan de la fase 1 cerrado con medición propia. Te resumo el hallazgo en llano.
|
||||||
|
|
||||||
|
—
|
||||||
|
|
||||||
|
## [R2.seccion1.I1] Lo que encontré: el sistema busca bien y entrega mal
|
||||||
|
|
||||||
|
Imagina un bibliotecario al que le pides un libro. Va al estante correcto, saca diez libros, y **casi la mitad de las veces el tuyo está entre esos diez** — pero te entrega el de encima, que es el equivocado en 2 de cada 3 ocasiones.
|
||||||
|
|
||||||
|
Eso es exactamente lo que mide el retrieval hoy, con banco limpio y sobre el código que de verdad corre:
|
||||||
|
|
||||||
|
| | |
|
||||||
|
|---|---|
|
||||||
|
| Lo encuentra entre los 10 primeros | **40,7 %** |
|
||||||
|
| Lo entrega en primer lugar | **14,0 %** |
|
||||||
|
| **Lo que se pierde solo por orden** | **26,7 puntos** |
|
||||||
|
|
||||||
|
Esos 26,7 puntos **no necesitan** mejor búsqueda, ni reindexar, ni cambiar el modelo de embeddings. El recuerdo correcto ya está en la mano. Se cae al ordenar.
|
||||||
|
|
||||||
|
—
|
||||||
|
|
||||||
|
## [R2.seccion2.L1] Tres cosas que descarté por el camino (dos eran mías)
|
||||||
|
|
||||||
|
**1. La "mejora x3 bloqueada por el freeze" no existe.** Te la mencioné hace dos turnos y **estaba equivocado**: la saqué de un documento del 23 de agosto. El código vivo lleva el aviso — ese experimento se declaró *fuga de información* (las preguntas salían del propio episodio que debían encontrar, inflado ~8×). La cifra honesta dice lo contrario: la fusión **resta** 5,7 puntos de acierto. Cuatro jueces externos convergieron en retirarla y tú firmaste esa retirada el 22 de agosto. **Encenderla empeoraría el sistema.**
|
||||||
|
|
||||||
|
**2. Mi hipótesis del filtro, refutada por mí mismo.** Vi que el camino desplegado descarta candidatos dentro del motor de búsqueda (corte en 0,45) mientras el camino apagado los miraba todos. Parecía recall perdido. Lo medí aislando esa única variable: **delta exactamente 0,0**. Cero correctos por debajo del corte en 150 consultas. Hipótesis muerta, limpia.
|
||||||
|
|
||||||
|
**3. Casi publico un falso hallazgo.** La primera pasada dio 8,3 % y sospeché del sistema. Pero el identificador vive en Qdrant en formato largo y en el banco en formato corto — si mi comparador fallaba, todos los ceros eran mentira. Hice el control antes de escribir: **309 de 309 objetivos existen en la colección, cobertura 100 %**. El instrumento es sano, así que la cifra es real.
|
||||||
Loading…
Reference in a new issue