feat(episode): EXPLORA_el-veredicto-en-una-frase_S20260601.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NEXUS | Type: design
Summary: EPISODIO 99 — BLINDADAS: El veredicto, en una frase
This commit is contained in:
Ember 2026-06-06 07:01:53 +00:00
parent d5d37e96cf
commit 9b246f9ef3

View file

@ -0,0 +1,43 @@
---
episode_id: "3c0a5f5f-0863-4a83-82ee-54dc12806f2b"
puente_flat: "EXPLORA_el-veredicto-en-una-frase_S20260601.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260601.LUMEN_CAPACIDAD_LLM_LIGERO"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NEXUS"
fase_proyecto: "operations"
tipo_semantico: "design"
summary_one_line: "EPISODIO 99 — BLINDADAS: El veredicto, en una frase"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-06-06T07:01:33.224150+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Listo, John — investigación completa y entregada. **Reporte:** [`docs/NEXUS_GRAPHRAG_MEMORIA_GRAFO_SOTA_S20260601.md`](docs/NEXUS_GRAPHRAG_MEMORIA_GRAFO_SOTA_S20260601.md) (también vi que ya tenías `AUDIT_FRAMEWORK_STATE_OF_ART_LLM_MEMORY_PIPELINES_S20260525.md` — mi doc añade el ángulo nuevo: grafo-como-índice-de-boot).
## El veredicto, en una frase
**Tu idea es correcta — con un corte crítico: el grafo sustituye la enciclopedia, no la constitución.**
## Lo que dice el estado del arte 2025-2026 (con fuentes verificadas)
`[R23.seccion1.I1]` **A favor de tu idea (fuerte):**
- **Context rot** ([Chroma 2025](https://www.trychroma.com/research/context-rot)) probó 18 modelos frontera **incluido Claude Opus 4** — TODOS empeoran cuando crece el input. Más **lost-in-the-middle** ([Liu et al. TACL 2024](https://arxiv.org/abs/2311.07911)): el medio del contexto se atiende mal (caídas >30%). → Tu CLAUDE.md de ~175K **me hace seguir PEOR las reglas, no mejor.** La evidencia respalda aligerar.
- **Eficiencia del grafo es real**: LightRAG hace con <100 tokens lo que GraphRAG necesita 610K (~6.000×, indicativo); [HippoRAG 2 (ICML 2025)](https://arxiv.org/abs/2502.14802) da el **mejor balance calidad/costo**; Mem0 usa ~1.764 tok vs 26.031 full-context con latencia 0.2s.
`[R23.seccion2.I2]` **El corte crítico (lo que tu idea necesita):**
- El acato de instrucciones **ya es frágil incluso en contexto**: cae hasta **61.8%** con solo variar el fraseo ([Revisiting Reliability 2025, arXiv 2512.14754](https://arxiv.org/html/2512.14754v1)). Mediar una BLINDADA con retrieval *probabilístico* (que puede no recuperarla) añade un punto de fallo donde necesitas determinismo. **No existe hoy ningún método que garantice recall ~100% de una regla vía retrieval.**
## La arquitectura ganadora (3 tiers)
- **Tier A — constitución residente:** BLINDADAS + 5 always-ON en prosa mínima + respaldo de tus **hooks deterministas**. NO se grafea.
- **Tier B — grafo-índice (lo nuevo):** Graphify sobre toda la literatura → reemplaza el eager-load de los ~30 `@rules`. Patrón: HippoRAG 2 / LightRAG.
- **Tier C — retrieval perezoso híbrido** (semántico+BM25+grafo, patrón Graphiti) desde tus 5 stores.
Potencial: bajar boot de ~185K → **~40-60K tokens** sin perder navegabilidad — y por context-rot, eso me haría seguir **mejor** lo que queda.
## Decisión para ti
Mi recomendación: **POC medido del Tier B sobre literatura NO-crítica** (docs/skills/episodios), BLINDADAS intactas, con el A/B de la sección 6 (métrica `reliable@k`). Riesgo casi cero, y los números deciden antes de tocar nada vinculante.
¿Avanzo con **(a)** montar ese POC — generar el grafo-de-todo con Graphify + diseñar el set A/B —, o **(b)** primero quieres que cruce este reporte con tu `AUDIT_FRAMEWORK...S20260525` para consolidar un solo documento maestro?