ember-memory-test/episodes/TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 0c1164d730 feat(episode): TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual
2026-09-03 00:04:02 +00:00

3 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
353cb8eb-423f-4965-a268-d0d6ceed3928 TRAZA_lo-que-result-de-medir-la-ruta-factual_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260828.SID3E411925EAA3 informar multi_actor low TESSERA operations troubleshooting EPISODIO 1 — MEMORIA: Lo que resultó de medir la ruta factual claude_code internal 2026-09-03T00:04:00.773201+00:00 false pending

Los tres remotos verificados por SHA idéntico. Trabajo cerrado.

Lo que resultó de medir la ruta factual

La mitad no examinada del sistema funciona — y mejor que la que llevamos semanas peleando.

recall@1 recall@5
Ruta factual (search_facts) 0,450 0,700
Ruta narrativa (camino por defecto) 0,200 0,267
Delta +0,250 · p=0,0015 · 18:3 +0,433

Julio midió +0,259 con otro generador, otro n y la fusión aún encendida. Hoy, +0,250. Dos mediciones independientes separadas por 45 días y un cambio de configuración coinciden dentro del intervalo de confianza. Eso es replicación de verdad, no un número que se repite.

El dato que más importa para el arco: el techo. Llevamos semanas contra el hallazgo de que en 6 de cada 10 consultas el episodio correcto ni siquiera entra en el top-10 — por eso el reordenador, que solo reordena lo ya recuperado, tiene poco margen. La ruta factual llega a 0,70 en top-5 sobre el mismo banco.

No lo vendo sin su contraparte. La objeción seria es que el brazo factual acierta con cualquiera de los ~8 hechos del episodio y el narrativo tiene un solo vector. Lo medí: con episodios de pocos hechos la razón ×2 se conserva (0,242 vs 0,121), pero el delta absoluto cae a la mitad y con n=33 no hay potencia (p=0,34). Parte de la ventaja es aritmética; toda, no.

Y un bug que nadie había visto en 38 días

Buscando episodios de un solo hecho aparecieron 109 — y ninguno existe en la memoria episódica. Mismo session_code, valid_from idéntico al segundo, sin el sello del camino canónico, y con textos que son código y frontmatter, no hechos de conversación: "effectivenessresponsibility.py F3: parsea PURPOSE de 176 hooks".

Son residuos de una prueba del 26 de julio que quedaron en la colección de producción con estado vigente. search_facts puede devolvértelos como hechos tuyos. No los he borrado: borrar es escribir, y el lado de escritura sigue congelado.

También corregí mi propio informe de ayer: escribí que la ruta factual "nunca se midió" y era falso — sí se midió en julio. Lo que faltaba era más estrecho. La corrección queda con el texto original tachado, no borrado.

🎯 En una frase: el sistema tiene dos formas de recordar, llevamos semanas arreglando la peor, y la otra acierta más del doble.