ember-memory-test/episodes/EXPLORA_comparativa-sota-vs-plan-v11-terminada_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 1cd8445fbe feat(episode): EXPLORA_comparativa-sota-vs-plan-v11-terminada_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NEXUS | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST:  COMPARATIVA SOTA vs PLAN v1.1 — terminada y ent
2026-07-19 18:13:43 +00:00

3 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
1a76b173-2201-4ddc-8b56-f6cc93815af7 EXPLORA_comparativa-sota-vs-plan-v11-terminada_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260719.ORACULO_RETRIEVAL_X09 informar multi_actor low NEXUS operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: COMPARATIVA SOTA vs PLAN v1.1 — terminada y entregada claude_code internal 2026-07-19T18:13:43.017085+00:00 false pending

Push triple-remoto exitoso (742435f9..5d26fbb6 en forgejo, origin y sriyantra). Misión completa.

COMPARATIVA SOTA vs PLAN v1.1 — terminada y entregada

El entregable: COMPARATIVA_SOTA_MEMORIA_vs_PLAN_S20260719.md (empieza por el resumen ejecutivo, como pediste).

Lo primero: el documento externo pasó el examen de verdad

Encontré un documento tuyo: Downloads/Informe de estado del arte_ memoria de largo plazo.md (Perplexity, hoy 12:56). Nota: tu encargo decía "documentos" en plural — si hay más de otras IAs, tráemelos y amplío la comparativa. Antes de creerle una sola línea, re-verifiqué sus 10 fuentes primarias directamente en arXiv (abrí cada abstract con mis propias herramientas): 10/10 existen y los números coinciden palabra por palabra. Esto contrasta con la lección medida de julio (~30-40% de research externo fabricado) — este informe es de los buenos. Incluso resolví dos cosas que Perplexity dejó como "no verificado": Zep sí confirma en su abstract que supera a MemGPT (94.8% vs 93.4% en DMR) y el survey de diciembre 2025 sí existe. Sin instrucciones ocultas ni prompt injection en el documento.

El veredicto en sencillo

El estado del arte valida tu plan — no lo refuta. Lo que las IAs frontera hacen con su memoria es, pieza por pieza, lo mismo que diseñamos:

Nuestro plan v1.1 Quién más lo hace (verificado)
Consolidar 828 turnos en ~150 TEMAS y rankear temas GraphRAG de Microsoft (comunidades con resúmenes) y H-MEM (memoria por niveles de abstracción — ataca exactamente nuestro problema del pool que entierra al correcto)
El writer puebla summary/título/claves al nacer A-MEM (cada memoria nace como nota estructurada) y Mem0 (extrae y consolida antes de indexar)
Turnos crudos intactos como evidencia (zero-harm) Generative Agents y GraphRAG: nadie borra el crudo; todos derivan capas encima

La única divergencia real: HippoRAG demuestra que un grafo bien construido puede rankear (no solo filtrar) con +20% en preguntas multi-salto. Nuestro "el grafo solo filtra" nace de medir un grafo vacío (Neo4j sin texto — ERR-9), así que esa falsificación es local, no universal. Decisión honesta: mantenemos el principio medido, con un experimento futuro (E1) solo cuando el grafo tenga contenido real.