3.4 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 8e9b6b90-0f66-4197-8b89-e8ec7a9237bb | EXPLORA_el-veredicto-en-una-frase_S20260601.R85_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260601.LUMEN_CAPACIDAD_LLM_LIGERO | informar | multi_actor | low | NEXUS | operations | design | EPISODIO 85 — BLINDADAS: El veredicto, en una frase | claude_code | internal | 2026-06-06T14:01:29.745971+00:00 | false | pending |
Listo, John — investigación completa y entregada. Reporte: docs/NEXUS_GRAPHRAG_MEMORIA_GRAFO_SOTA_S20260601.md (también vi que ya tenías AUDIT_FRAMEWORK_STATE_OF_ART_LLM_MEMORY_PIPELINES_S20260525.md — mi doc añade el ángulo nuevo: grafo-como-índice-de-boot).
El veredicto, en una frase
Tu idea es correcta — con un corte crítico: el grafo sustituye la enciclopedia, no la constitución.
Lo que dice el estado del arte 2025-2026 (con fuentes verificadas)
[R23.seccion1.I1] A favor de tu idea (fuerte):
- Context rot (Chroma 2025) probó 18 modelos frontera incluido Claude Opus 4 — TODOS empeoran cuando crece el input. Más lost-in-the-middle (Liu et al. TACL 2024): el medio del contexto se atiende mal (caídas >30%). → Tu CLAUDE.md de ~175K me hace seguir PEOR las reglas, no mejor. La evidencia respalda aligerar.
- Eficiencia del grafo es real: LightRAG hace con <100 tokens lo que GraphRAG necesita 610K (~6.000×, indicativo); HippoRAG 2 (ICML 2025) da el mejor balance calidad/costo; Mem0 usa ~1.764 tok vs 26.031 full-context con latencia 0.2s.
[R23.seccion2.I2] El corte crítico (lo que tu idea necesita):
- El acato de instrucciones ya es frágil incluso en contexto: cae hasta 61.8% con solo variar el fraseo (Revisiting Reliability 2025, arXiv 2512.14754). Mediar una BLINDADA con retrieval probabilístico (que puede no recuperarla) añade un punto de fallo donde necesitas determinismo. No existe hoy ningún método que garantice recall ~100% de una regla vía retrieval.
La arquitectura ganadora (3 tiers)
- Tier A — constitución residente: BLINDADAS + 5 always-ON en prosa mínima + respaldo de tus hooks deterministas. NO se grafea.
- Tier B — grafo-índice (lo nuevo): Graphify sobre toda la literatura → reemplaza el eager-load de los ~30
@rules. Patrón: HippoRAG 2 / LightRAG. - Tier C — retrieval perezoso híbrido (semántico+BM25+grafo, patrón Graphiti) desde tus 5 stores.
Potencial: bajar boot de ~185K → ~40-60K tokens sin perder navegabilidad — y por context-rot, eso me haría seguir mejor lo que queda.
Decisión para ti
Mi recomendación: POC medido del Tier B sobre literatura NO-crítica (docs/skills/episodios), BLINDADAS intactas, con el A/B de la sección 6 (métrica reliable@k). Riesgo casi cero, y los números deciden antes de tocar nada vinculante.
¿Avanzo con (a) montar ese POC — generar el grafo-de-todo con Graphify + diseñar el set A/B —, o (b) primero quieres que cruce este reporte con tu AUDIT_FRAMEWORK...S20260525 para consolidar un solo documento maestro?