Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MEMORIA: 📖 Lo que de verdad se decide
3.5 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 7aa5cdfd-c11a-412b-83d7-a8c6601c7049 | TRAZA_lo-que-de-verdad-se-decide_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260815.COMPASS_CURE_AUDITORIA | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MEMORIA: 📖 Lo que de verdad se decide | claude_code | internal | 2026-08-21T18:05:12.745064+00:00 | false | pending |
Tienes razón, el hook: te puse un menú al final de una explicación sin contarte qué está realmente en juego. Lo enmiendo, con una sola decisión y su historia.
📖 Lo que de verdad se decide
No es "¿corro otro experimento?". Es: ¿cuánta evidencia quieres tener antes de tocar el órgano que decide a quién llamo en cada mensaje tuyo?
De dónde viene. En julio se midió que el manual de COMPASS funciona de verdad — a un modelo pequeño le sube el acierto de 0,54 a 0,68 — pero cuesta 8.000 tokens residentes, ocho veces más que cualquier otro. De ahí salió la propuesta de recortarlo, que lleva 33 días esperando tu visto bueno. Hoy medí la primera mitad: recortarlo un 89% no le quita capacidad de nombrar al especialista correcto (97,4% → 97,8%). Falta la segunda mitad: si además elige igual de bien. Esa medición estuvo bloqueada cinco días porque el servidor de modelos estaba caído; hace un momento verifiqué que el servidor volvió por SSH, pero su puerta pública de modelos sigue muda.
Qué pasa por cada camino.
Si mido ahora, gasto alrededor de una sesión y hay un riesgo concreto que no te puedo ocultar: como la puerta pública no responde, tendría que entrar por SSH y usar los modelos desde dentro del servidor. Puede que funcione en diez minutos o puede que no funcione y haya gastado la sesión sin traerte un número.
Si aplicamos el recorte ya, recuperas ~7.200 tokens en cada sesión que abras, desde hoy. El riesgo que quedaría sin medir es el peor de detectar: no daría error, simplemente rutearía un poco peor — no convocaría un comité cuando tocaba, o resolvería directo algo que merecía un especialista. Se deshace con un comando, pero mientras tanto el daño sería silencioso.
Si paramos, no pasa nada malo hoy. Solo que el manual sigue engordando: creció ~900 tokens en un mes, porque cada especialista nuevo lo agranda.
Mi inclinación y qué la cambiaría. Medir ahora, con un compromiso: si en los primeros minutos el canal no da, aborto y te lo digo en vez de quemar la sesión persiguiéndolo. Cambiaría de opinión si las sesiones se te están quedando cortas de contexto — ahí el ahorro inmediato pesa más que la evidencia completa, y como es reversible, aplicar y observar es defendible.
La pregunta, sola: ¿prefieres que gaste una sesión en conseguir la otra mitad de la evidencia, o que apliquemos el recorte ya y vigilemos?
Hice: enmarcar la decisión que te había presentado sin contexto suficiente. No ejecuté nada en este turno. Falta: tu respuesta; nada más está bloqueado. Mi consejo: medir, con la cláusula de abortar rápido si el canal no coopera. Para avanzar, elige:
- 🟢 A (recomendado): intento la medición conductual ahora, y aborto pronto si el canal falla
- 🟡 B: aplicamos el recorte ya (~7.200 tokens/sesión, reversible) y vigilamos
- ⚪ C: lo dejamos quieto y miramos otra cosa