ember-memory-test/episodes/TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 36a96e28d4 feat(episode): TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: COMPASS | Type: troubleshooting
Summary: EPISODIO 1 — MEMORIA: El resultado
2026-08-21 16:54:28 +00:00

3.3 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
aee01a9d-02e9-4b82-a281-ff00a9771148 TRAZA_el-resultado_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260815.COMPASS_CURE_AUDITORIA informar multi_actor low COMPASS operations troubleshooting EPISODIO 1 — MEMORIA: El resultado claude_code internal 2026-08-21T16:54:26.748527+00:00 false pending

Medición hecha, CLAUDE.md intacto (commit e157396b, 3/3 remotos).

El resultado

Condición tokens techo de routing
Doctrina completa (hoy) 8.145 97,4%
Puntero con catálogo 1.287 97,6%
Puntero mínimo 909 97,8%
Solo nombres (control ) 381 37,9%

Sobre 494 turnos reales, con criterio pre-registrado antes de correr. Comprimir la doctrina un 88,8% no cuesta capacidad de nombrar el destino correcto — las tres condiciones con doctrina son indistinguibles (±0,4pp = 2 casos de 494), mientras el control negativo se hunde a 37,9%, que es la prueba de que el instrumento discrimina en vez de complacer. Y el presupuesto de <900 tokens que T-30 declaró en julio resultó alcanzable: 909, agrupando el catálogo por familias.

Tres cosas que debo decirte con claridad

Esto mide el techo, no el juicio. Mide qué decisiones siguen siendo expresables; no si el modelo, pudiendo nombrar el skill, lo elegiría igual de bien. Esa mitad la intenté y no pude: los subagentes de Claude Code arrancan con CLAUDE.md cargado —lo verifiqué, uno citó PF-19 literal sin abrir un archivo— así que las cuatro condiciones habrían sido la misma; LiteLLM no responde (el servidor MEMORIA lleva 111h caído) y no hay credencial local. Preferí decírtelo a fabricar el número.

Cacé un hallazgo falso antes de enseñártelo. La primera corrida decía que el puntero cubría más que la doctrina completa. Era mi propio matcher: CLAUDE.md escribe REPO_KEEPER y el corpus dice REPO-KEEPER, y yo los contaba como skills distintos. Corregido con su test de regresión; el "puntero mejor que la doctrina" se disolvió en empate técnico.

La doctrina de 8.145 tokens ya tiene huecos hoy: no nombra FRAGUA (10 casos reales), RELOJERO-V2 ni LOOP-AUDITOR. Es deuda de catálogo que existe con la doctrina puesta, independiente de T-30.

Hice: medí las 4 condiciones con instrumento nuevo (14/14 tests, incluido control por neutralización), cacé y corregí un falso hallazgo, y dejé todo en staging sin tocar CLAUDE.md. Falta: la mitad conductual — agendada en un chip, bloqueada hasta que vuelva el servidor MEMORIA. Mi consejo: el riesgo más obvio de T-30 ("el puntero deja skills fuera de alcance") queda descartado con datos. Yo esperaría la mitad conductual antes de aplicar, salvo que quieras el ahorro ya: son ~7.200 tokens en cada sesión que abres, y es reversible con un git revert. Para avanzar, elige:

  • 🟢 A (recomendado): esperamos la medición conductual (chip listo) y decides con las dos mitades
  • 🟡 B: aplicar T-30 ya con el puntero de 909 + la verificación post que el plan diseñaba
  • C: cerrar por hoy; el servidor caído es más urgente que el ahorro