feat(episode): TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual
This commit is contained in:
Ember 2026-09-03 00:04:02 +00:00
parent b0f5d62b56
commit 0c1164d730

View file

@ -0,0 +1,49 @@
---
episode_id: "353cb8eb-423f-4965-a268-d0d6ceed3928"
puente_flat: "TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260828.SID3E411925EAA3"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "TESSERA"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-09-03T00:04:00.773201+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Los tres remotos verificados por SHA idéntico. Trabajo cerrado.
## Lo que resultó de medir la ruta factual
**La mitad no examinada del sistema funciona — y mejor que la que llevamos semanas peleando.**
| | recall@1 | recall@5 |
|---|---|---|
| **Ruta factual** (`search_facts`) | **0,450** | **0,700** |
| **Ruta narrativa** (camino por defecto) | 0,200 | 0,267 |
| **Delta** | **+0,250** · p=0,0015 · 18:3 | **+0,433** |
Julio midió **+0,259** con otro generador, otro *n* y la fusión aún encendida. Hoy, **+0,250**. Dos mediciones independientes separadas por 45 días y un cambio de configuración coinciden dentro del intervalo de confianza. Eso es replicación de verdad, no un número que se repite.
**El dato que más importa para el arco:** el techo. Llevamos semanas contra el hallazgo de que en 6 de cada 10 consultas el episodio correcto ni siquiera entra en el top-10 — por eso el reordenador, que solo reordena lo ya recuperado, tiene poco margen. La ruta factual llega a **0,70 en top-5** sobre el mismo banco.
**No lo vendo sin su contraparte.** La objeción seria es que el brazo factual acierta con *cualquiera* de los ~8 hechos del episodio y el narrativo tiene un solo vector. Lo medí: con episodios de pocos hechos la **razón ×2 se conserva** (0,242 vs 0,121), pero el **delta absoluto cae a la mitad** y con n=33 no hay potencia (p=0,34). Parte de la ventaja es aritmética; toda, no.
### Y un bug que nadie había visto en 38 días
Buscando episodios de un solo hecho aparecieron 109 — y **ninguno existe** en la memoria episódica. Mismo `session_code`, `valid_from` idéntico al segundo, sin el sello del camino canónico, y con textos que son código y frontmatter, no hechos de conversación: *"effectivenessresponsibility.py F3: parsea PURPOSE de 176 hooks"*.
Son residuos de una prueba del 26 de julio que quedaron en la colección **de producción** con estado vigente. `search_facts` puede devolvértelos como hechos tuyos. **No los he borrado**: borrar es escribir, y el lado de escritura sigue congelado.
También corregí mi propio informe de ayer: escribí que la ruta factual "nunca se midió" y era falso — sí se midió en julio. Lo que faltaba era más estrecho. La corrección queda con el texto original tachado, no borrado.
> 🎯 **En una frase:** el sistema tiene dos formas de recordar, llevamos semanas arreglando la peor, y la otra acierta más del doble.