feat(episode): TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: COMPASS | Type: troubleshooting
Summary: EPISODIO 1 — MEMORIA: El resultado
This commit is contained in:
Ember 2026-08-21 16:54:28 +00:00
parent 5c29807bc2
commit 36a96e28d4

View file

@ -0,0 +1,46 @@
---
episode_id: "aee01a9d-02e9-4b82-a281-ff00a9771148"
puente_flat: "TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260815.COMPASS_CURE_AUDITORIA"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "COMPASS"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — MEMORIA: El resultado"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-21T16:54:26.748527+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
**Medición hecha, `CLAUDE.md` intacto** (commit `e157396b`, 3/3 remotos).
## El resultado
| Condición | tokens | techo de routing |
|---|---:|---:|
| Doctrina completa (hoy) | 8.145 | 97,4% |
| Puntero con catálogo | 1.287 | 97,6% |
| **Puntero mínimo** | **909** | **97,8%** |
| Solo nombres (control −) | 381 | 37,9% |
Sobre **494 turnos reales**, con criterio pre-registrado antes de correr. **Comprimir la doctrina un 88,8% no cuesta capacidad de nombrar el destino correcto** — las tres condiciones con doctrina son indistinguibles (±0,4pp = 2 casos de 494), mientras el control negativo se hunde a 37,9%, que es la prueba de que el instrumento discrimina en vez de complacer. Y el presupuesto de <900 tokens que T-30 declaró en julio resultó alcanzable: 909, agrupando el catálogo por familias.
## Tres cosas que debo decirte con claridad
**Esto mide el techo, no el juicio.** Mide qué decisiones siguen siendo *expresables*; no si el modelo, pudiendo nombrar el skill, lo *elegiría* igual de bien. Esa mitad la intenté y no pude: los subagentes de Claude Code arrancan con `CLAUDE.md` cargado —lo verifiqué, uno citó `PF-19` literal sin abrir un archivo— así que las cuatro condiciones habrían sido la misma; LiteLLM no responde (el servidor MEMORIA lleva 111h caído) y no hay credencial local. Preferí decírtelo a fabricar el número.
**Cacé un hallazgo falso antes de enseñártelo.** La primera corrida decía que el puntero cubría *más* que la doctrina completa. Era mi propio matcher: `CLAUDE.md` escribe `REPO_KEEPER` y el corpus dice `REPO-KEEPER`, y yo los contaba como skills distintos. Corregido con su test de regresión; el "puntero mejor que la doctrina" se disolvió en empate técnico.
**La doctrina de 8.145 tokens ya tiene huecos hoy:** no nombra `FRAGUA` (10 casos reales), `RELOJERO-V2` ni `LOOP-AUDITOR`. Es deuda de catálogo que existe con la doctrina puesta, independiente de T-30.
**Hice:** medí las 4 condiciones con instrumento nuevo (14/14 tests, incluido control por neutralización), cacé y corregí un falso hallazgo, y dejé todo en staging sin tocar `CLAUDE.md`.
**Falta:** la mitad conductual — agendada en un chip, bloqueada hasta que vuelva el servidor MEMORIA.
**Mi consejo:** el riesgo más obvio de T-30 ("el puntero deja skills fuera de alcance") queda descartado con datos. Yo esperaría la mitad conductual antes de aplicar, salvo que quieras el ahorro ya: son ~7.200 tokens en cada sesión que abres, y es reversible con un `git revert`.
**Para avanzar, elige:**
- 🟢 **A** *(recomendado)*: esperamos la medición conductual (chip listo) y decides con las dos mitades
- 🟡 **B**: aplicar T-30 ya con el puntero de 909 + la verificación post que el plan diseñaba
- ⚪ **C**: cerrar por hoy; el servidor caído es más urgente que el ahorro