3.3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| aee01a9d-02e9-4b82-a281-ff00a9771148 | TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260815.COMPASS_CURE_AUDITORIA | informar | multi_actor | low | COMPASS | operations | troubleshooting | EPISODIO 1 — MEMORIA: El resultado | claude_code | internal | 2026-08-21T16:54:26.748527+00:00 | false | pending |
Medición hecha, CLAUDE.md intacto (commit e157396b, 3/3 remotos).
El resultado
| Condición | tokens | techo de routing |
|---|---|---|
| Doctrina completa (hoy) | 8.145 | 97,4% |
| Puntero con catálogo | 1.287 | 97,6% |
| Puntero mínimo | 909 | 97,8% |
| Solo nombres (control −) | 381 | 37,9% |
Sobre 494 turnos reales, con criterio pre-registrado antes de correr. Comprimir la doctrina un 88,8% no cuesta capacidad de nombrar el destino correcto — las tres condiciones con doctrina son indistinguibles (±0,4pp = 2 casos de 494), mientras el control negativo se hunde a 37,9%, que es la prueba de que el instrumento discrimina en vez de complacer. Y el presupuesto de <900 tokens que T-30 declaró en julio resultó alcanzable: 909, agrupando el catálogo por familias.
Tres cosas que debo decirte con claridad
Esto mide el techo, no el juicio. Mide qué decisiones siguen siendo expresables; no si el modelo, pudiendo nombrar el skill, lo elegiría igual de bien. Esa mitad la intenté y no pude: los subagentes de Claude Code arrancan con CLAUDE.md cargado —lo verifiqué, uno citó PF-19 literal sin abrir un archivo— así que las cuatro condiciones habrían sido la misma; LiteLLM no responde (el servidor MEMORIA lleva 111h caído) y no hay credencial local. Preferí decírtelo a fabricar el número.
Cacé un hallazgo falso antes de enseñártelo. La primera corrida decía que el puntero cubría más que la doctrina completa. Era mi propio matcher: CLAUDE.md escribe REPO_KEEPER y el corpus dice REPO-KEEPER, y yo los contaba como skills distintos. Corregido con su test de regresión; el "puntero mejor que la doctrina" se disolvió en empate técnico.
La doctrina de 8.145 tokens ya tiene huecos hoy: no nombra FRAGUA (10 casos reales), RELOJERO-V2 ni LOOP-AUDITOR. Es deuda de catálogo que existe con la doctrina puesta, independiente de T-30.
Hice: medí las 4 condiciones con instrumento nuevo (14/14 tests, incluido control por neutralización), cacé y corregí un falso hallazgo, y dejé todo en staging sin tocar CLAUDE.md.
Falta: la mitad conductual — agendada en un chip, bloqueada hasta que vuelva el servidor MEMORIA.
Mi consejo: el riesgo más obvio de T-30 ("el puntero deja skills fuera de alcance") queda descartado con datos. Yo esperaría la mitad conductual antes de aplicar, salvo que quieras el ahorro ya: son ~7.200 tokens en cada sesión que abres, y es reversible con un git revert.
Para avanzar, elige:
- 🟢 A (recomendado): esperamos la medición conductual (chip listo) y decides con las dos mitades
- 🟡 B: aplicar T-30 ya con el puntero de 909 + la verificación post que el plan diseñaba
- ⚪ C: cerrar por hoy; el servidor caído es más urgente que el ahorro