--- episode_id: "aee01a9d-02e9-4b82-a281-ff00a9771148" puente_flat: "TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260815.COMPASS_CURE_AUDITORIA" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "COMPASS" fase_proyecto: "operations" tipo_semantico: "troubleshooting" summary_one_line: "EPISODIO 1 — MEMORIA: El resultado" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-08-21T16:54:26.748527+00:00" relectura_tagged: false forgejo_commit_sha: "pending" --- **Medición hecha, `CLAUDE.md` intacto** (commit `e157396b`, 3/3 remotos). ## El resultado | Condición | tokens | techo de routing | |---|---:|---:| | Doctrina completa (hoy) | 8.145 | 97,4% | | Puntero con catálogo | 1.287 | 97,6% | | **Puntero mínimo** | **909** | **97,8%** | | Solo nombres (control −) | 381 | 37,9% | Sobre **494 turnos reales**, con criterio pre-registrado antes de correr. **Comprimir la doctrina un 88,8% no cuesta capacidad de nombrar el destino correcto** — las tres condiciones con doctrina son indistinguibles (±0,4pp = 2 casos de 494), mientras el control negativo se hunde a 37,9%, que es la prueba de que el instrumento discrimina en vez de complacer. Y el presupuesto de <900 tokens que T-30 declaró en julio resultó alcanzable: 909, agrupando el catálogo por familias. ## Tres cosas que debo decirte con claridad **Esto mide el techo, no el juicio.** Mide qué decisiones siguen siendo *expresables*; no si el modelo, pudiendo nombrar el skill, lo *elegiría* igual de bien. Esa mitad la intenté y no pude: los subagentes de Claude Code arrancan con `CLAUDE.md` cargado —lo verifiqué, uno citó `PF-19` literal sin abrir un archivo— así que las cuatro condiciones habrían sido la misma; LiteLLM no responde (el servidor MEMORIA lleva 111h caído) y no hay credencial local. Preferí decírtelo a fabricar el número. **Cacé un hallazgo falso antes de enseñártelo.** La primera corrida decía que el puntero cubría *más* que la doctrina completa. Era mi propio matcher: `CLAUDE.md` escribe `REPO_KEEPER` y el corpus dice `REPO-KEEPER`, y yo los contaba como skills distintos. Corregido con su test de regresión; el "puntero mejor que la doctrina" se disolvió en empate técnico. **La doctrina de 8.145 tokens ya tiene huecos hoy:** no nombra `FRAGUA` (10 casos reales), `RELOJERO-V2` ni `LOOP-AUDITOR`. Es deuda de catálogo que existe con la doctrina puesta, independiente de T-30. **Hice:** medí las 4 condiciones con instrumento nuevo (14/14 tests, incluido control por neutralización), cacé y corregí un falso hallazgo, y dejé todo en staging sin tocar `CLAUDE.md`. **Falta:** la mitad conductual — agendada en un chip, bloqueada hasta que vuelva el servidor MEMORIA. **Mi consejo:** el riesgo más obvio de T-30 ("el puntero deja skills fuera de alcance") queda descartado con datos. Yo esperaría la mitad conductual antes de aplicar, salvo que quieras el ahorro ya: son ~7.200 tokens en cada sesión que abres, y es reversible con un `git revert`. **Para avanzar, elige:** - 🟢 **A** *(recomendado)*: esperamos la medición conductual (chip listo) y decides con las dos mitades - 🟡 **B**: aplicar T-30 ya con el puntero de 909 + la verificación post que el plan diseñaba - ⚪ **C**: cerrar por hoy; el servidor caído es más urgente que el ahorro