--- episode_id: "3c0a5f5f-0863-4a83-82ee-54dc12806f2b" puente_flat: "EXPLORA_el-veredicto-en-una-frase_S20260601.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260601.LUMEN_CAPACIDAD_LLM_LIGERO" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "NEXUS" fase_proyecto: "operations" tipo_semantico: "design" summary_one_line: "EPISODIO 99 — BLINDADAS: El veredicto, en una frase" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-06-06T07:01:33.224150+00:00" relectura_tagged: false forgejo_commit_sha: "pending" --- Listo, John — investigación completa y entregada. **Reporte:** [`docs/NEXUS_GRAPHRAG_MEMORIA_GRAFO_SOTA_S20260601.md`](docs/NEXUS_GRAPHRAG_MEMORIA_GRAFO_SOTA_S20260601.md) (también vi que ya tenías `AUDIT_FRAMEWORK_STATE_OF_ART_LLM_MEMORY_PIPELINES_S20260525.md` — mi doc añade el ángulo nuevo: grafo-como-índice-de-boot). ## El veredicto, en una frase **Tu idea es correcta — con un corte crítico: el grafo sustituye la enciclopedia, no la constitución.** ## Lo que dice el estado del arte 2025-2026 (con fuentes verificadas) `[R23.seccion1.I1]` **A favor de tu idea (fuerte):** - **Context rot** ([Chroma 2025](https://www.trychroma.com/research/context-rot)) probó 18 modelos frontera **incluido Claude Opus 4** — TODOS empeoran cuando crece el input. Más **lost-in-the-middle** ([Liu et al. TACL 2024](https://arxiv.org/abs/2311.07911)): el medio del contexto se atiende mal (caídas >30%). → Tu CLAUDE.md de ~175K **me hace seguir PEOR las reglas, no mejor.** La evidencia respalda aligerar. - **Eficiencia del grafo es real**: LightRAG hace con <100 tokens lo que GraphRAG necesita 610K (~6.000×, indicativo); [HippoRAG 2 (ICML 2025)](https://arxiv.org/abs/2502.14802) da el **mejor balance calidad/costo**; Mem0 usa ~1.764 tok vs 26.031 full-context con latencia 0.2s. `[R23.seccion2.I2]` **El corte crítico (lo que tu idea necesita):** - El acato de instrucciones **ya es frágil incluso en contexto**: cae hasta **61.8%** con solo variar el fraseo ([Revisiting Reliability 2025, arXiv 2512.14754](https://arxiv.org/html/2512.14754v1)). Mediar una BLINDADA con retrieval *probabilístico* (que puede no recuperarla) añade un punto de fallo donde necesitas determinismo. **No existe hoy ningún método que garantice recall ~100% de una regla vía retrieval.** ## La arquitectura ganadora (3 tiers) - **Tier A — constitución residente:** BLINDADAS + 5 always-ON en prosa mínima + respaldo de tus **hooks deterministas**. NO se grafea. - **Tier B — grafo-índice (lo nuevo):** Graphify sobre toda la literatura → reemplaza el eager-load de los ~30 `@rules`. Patrón: HippoRAG 2 / LightRAG. - **Tier C — retrieval perezoso híbrido** (semántico+BM25+grafo, patrón Graphiti) desde tus 5 stores. Potencial: bajar boot de ~185K → **~40-60K tokens** sin perder navegabilidad — y por context-rot, eso me haría seguir **mejor** lo que queda. ## Decisión para ti Mi recomendación: **POC medido del Tier B sobre literatura NO-crítica** (docs/skills/episodios), BLINDADAS intactas, con el A/B de la sección 6 (métrica `reliable@k`). Riesgo casi cero, y los números deciden antes de tocar nada vinculante. ¿Avanzo con **(a)** montar ese POC — generar el grafo-de-todo con Graphify + diseñar el set A/B —, o **(b)** primero quieres que cruce este reporte con tu `AUDIT_FRAMEWORK...S20260525` para consolidar un solo documento maestro?