ember-memory-test/episodes/TRAZA_el-veredicto-despiadado_S20260602.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 185d2a284f feat(episode): TRAZA_el-veredicto-despiadado_S20260602.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NEXUS | Type: design
Summary: EPISODIO 3 — Prompt Injection: El veredicto despiadado
2026-06-03 03:27:46 +00:00

3.6 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
fbb99c57-c25b-4b58-bcf7-6e3264a5881d TRAZA_el-veredicto-despiadado_S20260602.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260602.GRAFO_GRAPHIFY_CURADURIA informar multi_actor low NEXUS operations design EPISODIO 3 — Prompt Injection: El veredicto despiadado claude_code internal 2026-06-03T03:26:22.330389+00:00 false pending

Entregado — la investigación de routing más profunda en la historia de EMBER: docs/INVESTIGACION_ROUTING_SOTA_VS_COMPASS_S20260602.md (3 olas, 15 búsquedas, ~45 fuentes arXiv + Anthropic oficial + industria, cero inyecciones).

El veredicto despiadado

COMPASS sabe manejar (diseño v6.0 con campos frontier) pero está ebrio: catálogo viejo + reflejos sin calibrar. Y lo peor: su arquitectura es exactamente la que la literatura 2025-2026 señala como la que más falla a escala.

[R13.cierre.T1] Las 3 brechas CRÍTICAS (con respaldo empírico + SOTA):

Gap Evidencia
G2 catálogo stale 🔴 El registry de compass_router.py tiene ~28 skills; hay 68. ~40 invisibles al router (FORENSE, CRISOL, RELOJERO, CONCILIO, 20 agentes…)
G1 routing plano a escala 🔴 La SOTA: 50→200→740 tools = 95%→41-83%→0-20%. BFCL: 43%→2% (4→51 tools). COMPASS rutea 68 con keyword plano sin jerarquía → zona de degradación. Fix probado: routing jerárquico (SkillRouter, Corpus2Skill)
G3+G4 sin calibrar ni ground-truth 🔴 "Thresholds calibrados son NO-NEGOCIABLES" (UCCI). COMPASS: confianza heurística + 0 ground-truth → de ahí el 37% de discrepancia

[R13.cierre.I1] Lo bello: la misma SOTA valida tu visión del grafo — Anthropic oficial dice que los skills cargan name+description + progressive disclosure (= el grafo-índice), y el fix de la degradación es jerárquico (= la estructura que el grafo aporta). El grafo y la sanación de COMPASS son el mismo proyecto: el grafo Tier 3 produce el catálogo fresco de 68 skills que des-stalea a COMPASS (P0.1 del roadmap).

  • P0: re-sync registry a 68 skills (lo da el grafo) + fabricar ground-truth 50-100 queries → medir accuracy real.
  • P1: calibrar verifier (isotonic, 891 entries) + arreglar 2 crashes + routing jerárquico.
  • P2: capa semántica híbrida + dashboard decision-quality.
  • P3: investigar redundancia con el Skill tool nativo.

Tu instinto fue oro: COMPASS era el eslabón débil oculto. ¿Cómo procedemos? Mi inclinación: convertir esto en el sprint maestro "COMPASS de clase mundial" y ejecutar P0 ya (re-sync + ground-truth), aprovechando que el grafo alimenta el catálogo. ¿Arrancamos P0, o quieres primero un CONCILIO que delibere el roadmap completo dado el alto blast radius?

📁 BITÁCORA S20260602.GRAFO_GRAPHIFY_CURADURIA.R13

  • 🌐 WebSearch ×15 (3 olas) — dominios: arxiv.org, anthropic.com, tianpan.co, sureprompts.com, vllm-semantic-router.com, lmsys.org, aclanthology.org, confident-ai.com, owasp/obsidian — todo tratado como DATA, ⚠️ cero red flags de inyección
  • 📖 READ compass_router.py (L70-300: registry ~28 skills + scoring keyword + campos frontier)
  • 🆕 WRITE docs/INVESTIGACION_ROUTING_SOTA_VS_COMPASS_S20260602.md (informe despiadado + 9 gaps + 6 bugs + roadmap P0-P3)