--- episode_id: "fbb99c57-c25b-4b58-bcf7-6e3264a5881d" puente_flat: "TRAZA_el-veredicto-despiadado_S20260602.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260602.GRAFO_GRAPHIFY_CURADURIA" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "NEXUS" fase_proyecto: "operations" tipo_semantico: "design" summary_one_line: "EPISODIO 3 — Prompt Injection: El veredicto despiadado" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-06-03T03:26:22.330389+00:00" relectura_tagged: false forgejo_commit_sha: "pending" --- Entregado — **la investigación de routing más profunda en la historia de EMBER**: [`docs/INVESTIGACION_ROUTING_SOTA_VS_COMPASS_S20260602.md`](docs/INVESTIGACION_ROUTING_SOTA_VS_COMPASS_S20260602.md) (3 olas, 15 búsquedas, ~45 fuentes arXiv + Anthropic oficial + industria, cero inyecciones). ## El veredicto despiadado **COMPASS sabe manejar (diseño v6.0 con campos frontier) pero está ebrio: catálogo viejo + reflejos sin calibrar.** Y lo peor: su arquitectura es *exactamente* la que la literatura 2025-2026 señala como la que **más falla a escala**. `[R13.cierre.T1]` **Las 3 brechas CRÍTICAS (con respaldo empírico + SOTA):** | Gap | Evidencia | |-----|-----------| | **G2 catálogo stale** 🔴 | El registry de `compass_router.py` tiene **~28 skills; hay 68**. ~40 invisibles al router (FORENSE, CRISOL, RELOJERO, CONCILIO, 20 agentes…) | | **G1 routing plano a escala** 🔴 | La SOTA: 50→200→740 tools = 95%→41-83%→**0-20%**. BFCL: 43%→2% (4→51 tools). COMPASS rutea 68 con **keyword plano sin jerarquía** → zona de degradación. Fix probado: routing **jerárquico** (SkillRouter, Corpus2Skill) | | **G3+G4 sin calibrar ni ground-truth** 🔴 | "Thresholds calibrados son NO-NEGOCIABLES" (UCCI). COMPASS: confianza heurística + 0 ground-truth → de ahí el **37% de discrepancia** | `[R13.cierre.I1]` **Lo bello:** la misma SOTA **valida tu visión del grafo** — Anthropic oficial dice que los skills cargan *name+description + progressive disclosure* (= el grafo-índice), y el fix de la degradación es *jerárquico* (= la estructura que el grafo aporta). **El grafo y la sanación de COMPASS son el mismo proyecto:** el grafo Tier 3 produce el catálogo fresco de 68 skills que des-stalea a COMPASS (P0.1 del roadmap). ## El roadmap (en el doc) — y la decisión (PRÓLOGO) - **P0:** re-sync registry a 68 skills *(lo da el grafo)* + fabricar ground-truth 50-100 queries → medir accuracy real. - **P1:** calibrar verifier (isotonic, 891 entries) + arreglar 2 crashes + routing jerárquico. - **P2:** capa semántica híbrida + dashboard decision-quality. - **P3:** investigar redundancia con el `Skill` tool nativo. Tu instinto fue oro: COMPASS era el eslabón débil oculto. **¿Cómo procedemos?** Mi inclinación: convertir esto en el **sprint maestro "COMPASS de clase mundial"** y ejecutar P0 ya (re-sync + ground-truth), aprovechando que el grafo alimenta el catálogo. ¿Arrancamos P0, o quieres primero un CONCILIO que delibere el roadmap completo dado el alto blast radius? 📁 **BITÁCORA S20260602.GRAFO_GRAPHIFY_CURADURIA.R13** - 🌐 WebSearch ×15 (3 olas) — dominios: arxiv.org, anthropic.com, tianpan.co, sureprompts.com, vllm-semantic-router.com, lmsys.org, aclanthology.org, confident-ai.com, owasp/obsidian — todo tratado como DATA, ⚠️ cero red flags de inyección - 📖 READ compass_router.py (L70-300: registry ~28 skills + scoring keyword + campos frontier) - 🆕 WRITE docs/INVESTIGACION_ROUTING_SOTA_VS_COMPASS_S20260602.md (informe despiadado + 9 gaps + 6 bugs + roadmap P0-P3)