ember-memory-test/episodes/EXPLORA_el-veredicto-en-una-frase_S20260601.R75_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 8df9c9f6fe feat(episode): EXPLORA_el-veredicto-en-una-frase_S20260601.R75_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NEXUS | Type: design
Summary: EPISODIO 75 — BLINDADAS: El veredicto, en una frase
2026-06-06 09:01:42 +00:00

3.4 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
065204bf-3eec-4ad3-a137-30641d045876 EXPLORA_el-veredicto-en-una-frase_S20260601.R75_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260601.LUMEN_CAPACIDAD_LLM_LIGERO informar multi_actor low NEXUS operations design EPISODIO 75 — BLINDADAS: El veredicto, en una frase claude_code internal 2026-06-06T09:01:32.724207+00:00 false pending

Listo, John — investigación completa y entregada. Reporte: docs/NEXUS_GRAPHRAG_MEMORIA_GRAFO_SOTA_S20260601.md (también vi que ya tenías AUDIT_FRAMEWORK_STATE_OF_ART_LLM_MEMORY_PIPELINES_S20260525.md — mi doc añade el ángulo nuevo: grafo-como-índice-de-boot).

El veredicto, en una frase

Tu idea es correcta — con un corte crítico: el grafo sustituye la enciclopedia, no la constitución.

Lo que dice el estado del arte 2025-2026 (con fuentes verificadas)

[R23.seccion1.I1] A favor de tu idea (fuerte):

  • Context rot (Chroma 2025) probó 18 modelos frontera incluido Claude Opus 4 — TODOS empeoran cuando crece el input. Más lost-in-the-middle (Liu et al. TACL 2024): el medio del contexto se atiende mal (caídas >30%). → Tu CLAUDE.md de ~175K me hace seguir PEOR las reglas, no mejor. La evidencia respalda aligerar.
  • Eficiencia del grafo es real: LightRAG hace con <100 tokens lo que GraphRAG necesita 610K (~6.000×, indicativo); HippoRAG 2 (ICML 2025) da el mejor balance calidad/costo; Mem0 usa ~1.764 tok vs 26.031 full-context con latencia 0.2s.

[R23.seccion2.I2] El corte crítico (lo que tu idea necesita):

  • El acato de instrucciones ya es frágil incluso en contexto: cae hasta 61.8% con solo variar el fraseo (Revisiting Reliability 2025, arXiv 2512.14754). Mediar una BLINDADA con retrieval probabilístico (que puede no recuperarla) añade un punto de fallo donde necesitas determinismo. No existe hoy ningún método que garantice recall ~100% de una regla vía retrieval.

La arquitectura ganadora (3 tiers)

  • Tier A — constitución residente: BLINDADAS + 5 always-ON en prosa mínima + respaldo de tus hooks deterministas. NO se grafea.
  • Tier B — grafo-índice (lo nuevo): Graphify sobre toda la literatura → reemplaza el eager-load de los ~30 @rules. Patrón: HippoRAG 2 / LightRAG.
  • Tier C — retrieval perezoso híbrido (semántico+BM25+grafo, patrón Graphiti) desde tus 5 stores.

Potencial: bajar boot de ~185K → ~40-60K tokens sin perder navegabilidad — y por context-rot, eso me haría seguir mejor lo que queda.

Decisión para ti

Mi recomendación: POC medido del Tier B sobre literatura NO-crítica (docs/skills/episodios), BLINDADAS intactas, con el A/B de la sección 6 (métrica reliable@k). Riesgo casi cero, y los números deciden antes de tocar nada vinculante.

¿Avanzo con (a) montar ese POC — generar el grafo-de-todo con Graphify + diseñar el set A/B —, o (b) primero quieres que cruce este reporte con tu AUDIT_FRAMEWORK...S20260525 para consolidar un solo documento maestro?