feat(episode): TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: troubleshooting Summary: EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual
This commit is contained in:
parent
b0f5d62b56
commit
0c1164d730
1 changed files with 49 additions and 0 deletions
|
|
@ -0,0 +1,49 @@
|
||||||
|
---
|
||||||
|
episode_id: "353cb8eb-423f-4965-a268-d0d6ceed3928"
|
||||||
|
puente_flat: "TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260828.SID3E411925EAA3"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "TESSERA"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-09-03T00:04:00.773201+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
Los tres remotos verificados por SHA idéntico. Trabajo cerrado.
|
||||||
|
|
||||||
|
—
|
||||||
|
|
||||||
|
## Lo que resultó de medir la ruta factual
|
||||||
|
|
||||||
|
**La mitad no examinada del sistema funciona — y mejor que la que llevamos semanas peleando.**
|
||||||
|
|
||||||
|
| | recall@1 | recall@5 |
|
||||||
|
|---|---|---|
|
||||||
|
| **Ruta factual** (`search_facts`) | **0,450** | **0,700** |
|
||||||
|
| **Ruta narrativa** (camino por defecto) | 0,200 | 0,267 |
|
||||||
|
| **Delta** | **+0,250** · p=0,0015 · 18:3 | **+0,433** |
|
||||||
|
|
||||||
|
Julio midió **+0,259** con otro generador, otro *n* y la fusión aún encendida. Hoy, **+0,250**. Dos mediciones independientes separadas por 45 días y un cambio de configuración coinciden dentro del intervalo de confianza. Eso es replicación de verdad, no un número que se repite.
|
||||||
|
|
||||||
|
**El dato que más importa para el arco:** el techo. Llevamos semanas contra el hallazgo de que en 6 de cada 10 consultas el episodio correcto ni siquiera entra en el top-10 — por eso el reordenador, que solo reordena lo ya recuperado, tiene poco margen. La ruta factual llega a **0,70 en top-5** sobre el mismo banco.
|
||||||
|
|
||||||
|
**No lo vendo sin su contraparte.** La objeción seria es que el brazo factual acierta con *cualquiera* de los ~8 hechos del episodio y el narrativo tiene un solo vector. Lo medí: con episodios de pocos hechos la **razón ×2 se conserva** (0,242 vs 0,121), pero el **delta absoluto cae a la mitad** y con n=33 no hay potencia (p=0,34). Parte de la ventaja es aritmética; toda, no.
|
||||||
|
|
||||||
|
### Y un bug que nadie había visto en 38 días
|
||||||
|
|
||||||
|
Buscando episodios de un solo hecho aparecieron 109 — y **ninguno existe** en la memoria episódica. Mismo `session_code`, `valid_from` idéntico al segundo, sin el sello del camino canónico, y con textos que son código y frontmatter, no hechos de conversación: *"effectivenessresponsibility.py F3: parsea PURPOSE de 176 hooks"*.
|
||||||
|
|
||||||
|
Son residuos de una prueba del 26 de julio que quedaron en la colección **de producción** con estado vigente. `search_facts` puede devolvértelos como hechos tuyos. **No los he borrado**: borrar es escribir, y el lado de escritura sigue congelado.
|
||||||
|
|
||||||
|
También corregí mi propio informe de ayer: escribí que la ruta factual "nunca se midió" y era falso — sí se midió en julio. Lo que faltaba era más estrecho. La corrección queda con el texto original tachado, no borrado.
|
||||||
|
|
||||||
|
—
|
||||||
|
|
||||||
|
> 🎯 **En una frase:** el sistema tiene dos formas de recordar, llevamos semanas arreglando la peor, y la otra acierta más del doble.
|
||||||
Loading…
Reference in a new issue