Skill: TESSERA | Type: troubleshooting Summary: EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual
3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 353cb8eb-423f-4965-a268-d0d6ceed3928 | TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260828.SID3E411925EAA3 | informar | multi_actor | low | TESSERA | operations | troubleshooting | EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual | claude_code | internal | 2026-09-03T00:04:00.773201+00:00 | false | pending |
Los tres remotos verificados por SHA idéntico. Trabajo cerrado.
—
Lo que resultó de medir la ruta factual
La mitad no examinada del sistema funciona — y mejor que la que llevamos semanas peleando.
| recall@1 | recall@5 | |
|---|---|---|
Ruta factual (search_facts) |
0,450 | 0,700 |
| Ruta narrativa (camino por defecto) | 0,200 | 0,267 |
| Delta | +0,250 · p=0,0015 · 18:3 | +0,433 |
Julio midió +0,259 con otro generador, otro n y la fusión aún encendida. Hoy, +0,250. Dos mediciones independientes separadas por 45 días y un cambio de configuración coinciden dentro del intervalo de confianza. Eso es replicación de verdad, no un número que se repite.
El dato que más importa para el arco: el techo. Llevamos semanas contra el hallazgo de que en 6 de cada 10 consultas el episodio correcto ni siquiera entra en el top-10 — por eso el reordenador, que solo reordena lo ya recuperado, tiene poco margen. La ruta factual llega a 0,70 en top-5 sobre el mismo banco.
No lo vendo sin su contraparte. La objeción seria es que el brazo factual acierta con cualquiera de los ~8 hechos del episodio y el narrativo tiene un solo vector. Lo medí: con episodios de pocos hechos la razón ×2 se conserva (0,242 vs 0,121), pero el delta absoluto cae a la mitad y con n=33 no hay potencia (p=0,34). Parte de la ventaja es aritmética; toda, no.
Y un bug que nadie había visto en 38 días
Buscando episodios de un solo hecho aparecieron 109 — y ninguno existe en la memoria episódica. Mismo session_code, valid_from idéntico al segundo, sin el sello del camino canónico, y con textos que son código y frontmatter, no hechos de conversación: "effectivenessresponsibility.py F3: parsea PURPOSE de 176 hooks".
Son residuos de una prueba del 26 de julio que quedaron en la colección de producción con estado vigente. search_facts puede devolvértelos como hechos tuyos. No los he borrado: borrar es escribir, y el lado de escritura sigue congelado.
También corregí mi propio informe de ayer: escribí que la ruta factual "nunca se midió" y era falso — sí se midió en julio. Lo que faltaba era más estrecho. La corrección queda con el texto original tachado, no borrado.
—
🎯 En una frase: el sistema tiene dos formas de recordar, llevamos semanas arreglando la peor, y la otra acierta más del doble.