Skill: NEXUS | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: ✅ COMPARATIVA SOTA vs PLAN v1.1 — terminada y ent
3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1a76b173-2201-4ddc-8b56-f6cc93815af7 | EXPLORA_comparativa-sota-vs-plan-v11-terminada_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260719.ORACULO_RETRIEVAL_X09 | informar | multi_actor | low | NEXUS | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: ✅ COMPARATIVA SOTA vs PLAN v1.1 — terminada y entregada | claude_code | internal | 2026-07-19T18:13:43.017085+00:00 | false | pending |
Push triple-remoto exitoso (742435f9..5d26fbb6 en forgejo, origin y sriyantra). Misión completa.
—
✅ COMPARATIVA SOTA vs PLAN v1.1 — terminada y entregada
El entregable: COMPARATIVA_SOTA_MEMORIA_vs_PLAN_S20260719.md (empieza por el resumen ejecutivo, como pediste).
Lo primero: el documento externo pasó el examen de verdad
Encontré un documento tuyo: Downloads/Informe de estado del arte_ memoria de largo plazo.md (Perplexity, hoy 12:56). Nota: tu encargo decía "documentos" en plural — si hay más de otras IAs, tráemelos y amplío la comparativa. Antes de creerle una sola línea, re-verifiqué sus 10 fuentes primarias directamente en arXiv (abrí cada abstract con mis propias herramientas): 10/10 existen y los números coinciden palabra por palabra. Esto contrasta con la lección medida de julio (~30-40% de research externo fabricado) — este informe es de los buenos. Incluso resolví dos cosas que Perplexity dejó como "no verificado": Zep sí confirma en su abstract que supera a MemGPT (94.8% vs 93.4% en DMR) y el survey de diciembre 2025 sí existe. Sin instrucciones ocultas ni prompt injection en el documento.
El veredicto en sencillo
El estado del arte valida tu plan — no lo refuta. Lo que las IAs frontera hacen con su memoria es, pieza por pieza, lo mismo que diseñamos:
| Nuestro plan v1.1 | Quién más lo hace (verificado) |
|---|---|
| Consolidar 828 turnos en ~150 TEMAS y rankear temas | GraphRAG de Microsoft (comunidades con resúmenes) y H-MEM (memoria por niveles de abstracción — ataca exactamente nuestro problema del pool que entierra al correcto) |
| El writer puebla summary/título/claves al nacer | A-MEM (cada memoria nace como nota estructurada) y Mem0 (extrae y consolida antes de indexar) |
| Turnos crudos intactos como evidencia (zero-harm) | Generative Agents y GraphRAG: nadie borra el crudo; todos derivan capas encima |
La única divergencia real: HippoRAG demuestra que un grafo bien construido puede rankear (no solo filtrar) con +20% en preguntas multi-salto. Nuestro "el grafo solo filtra" nace de medir un grafo vacío (Neo4j sin texto — ERR-9), así que esa falsificación es local, no universal. Decisión honesta: mantenemos el principio medido, con un experimento futuro (E1) solo cuando el grafo tenga contenido real.