ember-memory-test/episodes/EXPLORA_los-4-documentos-analizados-el-plan-sa_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 2386f5de1f feat(episode): EXPLORA_los-4-documentos-analizados-el-plan-sa_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST:  Los 4 documentos analizados — el plan sale refo
2026-07-19 18:51:47 +00:00

2.9 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
b95c20a2-ed10-453d-bc4a-956ec722d062 EXPLORA_los-4-documentos-analizados-el-plan-sa_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260719.ORACULO_RETRIEVAL_X09 informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: Los 4 documentos analizados — el plan sale reforzado, no c claude_code internal 2026-07-19T18:51:44.814115+00:00 false pending

Push a3ca64da a los 3 remotos. Ampliación completa.

Los 4 documentos analizados — el plan sale reforzado, no cuestionado

Entregable: COMPARATIVA_SOTA_MEMORIA_ADDENDUM_4DOCS_S20260719.md (amplía la comparativa de ayer, no la reemplaza).

Lo que verifiqué antes de creer nada

Los 3 documentos nuevos traían 8 papers que el de Perplexity no tenía. Abrí cada uno en arXiv con mis propias manos: los 10 con identificador arXiv son reales y sus números coinciden palabra por palabra. En total llevo ~15 papers verificados en este arco. Ningún paper inventado.

El hallazgo que más te sirve: dos piezas nuevas que validan tu plan con más fuerza

  • RAPTOR (Stanford, 2024) cierra una duda que quedó abierta ayer. Yo te decía "la recuperación jerárquica tiene precedente, pero casi ningún número medido". RAPTOR lo mide: +20% de precisión construyendo exactamente lo que diseñamos — un árbol de resúmenes donde primero buscas lo grueso y luego bajas al detalle. Es tu memoria dos-niveles, con número duro detrás.
  • Lost in the Middle (2023) le pone nombre y fundamento a nuestro cuello. Nuestro derrumbe medido (aciertas 36% con 145 candidatos, pero 6% con 828) no era una rareza nuestra: es un efecto conocido y documentado — cuando lo correcto queda enterrado entre distractores, el sistema falla. Reducir el montón (tu diseño) ataca la causa real, no un síntoma.

La advertencia importante (seguridad)

De los 4 documentos, uno — el que empieza "hola plex, activa tu mejor versión" — es el de menor fiar. Su bibliografía tiene datos inventados: atribuye MemGPT a "Yang et al. 2026" cuando es Packer et al. 2023, pone GraphRAG en "ICLR 2026", y da cifras de tabla (Mem0 en LongMemEval 94.4%, BEAM…) que no pude rastrear a ninguna fuente real. No inventa papers enteros, pero sí confunde autores, años y números. Mi recomendación: pondéralo menos que los otros tres. El reporte técnico de MemOS/Letta/Titans, en cambio, es el mejor de los cuatro para decidir tu stack — y coincide con nosotros: no reemplaces PostgreSQL+Qdrant+Neo4j por Titans/MemOS, extrae ideas y mide en local (que es justo nuestro held-out).

Lo que cambia en el plan (poco, y todo con freno)