feat(episode): TRAZA_fase-m1-completa-lectura-honesta-no-aut_S20260718.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: COMPASS | Type: troubleshooting Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Fase M1 completa — lectura honesta (no auto-repor
This commit is contained in:
parent
3b7b0ad33d
commit
65770de1b6
1 changed files with 43 additions and 0 deletions
|
|
@ -0,0 +1,43 @@
|
||||||
|
---
|
||||||
|
episode_id: "2e282aee-b383-4b65-a625-e5370a0c25a8"
|
||||||
|
puente_flat: "TRAZA_fase-m1-completa-lectura-honesta-no-aut_S20260718.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260718.ECC_TOOLBOX_SURFACER"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "COMPASS"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 1 — MNEMO_PRE_DIGEST: Fase M1 completa — lectura honesta (no auto-reporte)"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-07-19T04:02:57.040693+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
✅ **Push OK** — `f5ddafd8` triple-remoto. M1 respaldado.
|
||||||
|
|
||||||
|
## Fase M1 completa — lectura honesta (no auto-reporte)
|
||||||
|
|
||||||
|
| Protocolo | Métrica M1 | Veredicto de la medición |
|
||||||
|
|---|---|---|
|
||||||
|
| **COMPASS** T-10 | drift router-vs-log **0.99**, none_rate 0.29 | ⚠️ **contaminado** por el spy-bug `skill_primary=None` (la propia doc de CURE lo declara). No es drift real → **la telemetría de routing está rota**. Hallazgo, no número limpio. |
|
||||||
|
| **PROCEDENCIA** T-20 | cite_resolve **0.555**, 33% docs con confidence | ✅ limpio. Solo 55% de citas resuelven, 33% usan tags — doctrina seguida a medias. |
|
||||||
|
| **ALQUIMIA** T-30 | 5 suites OK, **AQ-5 intent PASS**; no_op UNRELIABLE | ✅ mecanismo vivo; no_op no medible (fire-log sin campo `transformed`). |
|
||||||
|
| **TESSERA** T-40 | anáforas **0.062/100w** (bajo=bueno), TEST_QUERIES **3.3%** | ✅ limpio. TP-2 se cumple; TP-8 casi no. |
|
||||||
|
| **GAUGE** T-45 | MAE **372K** > naive-constante **178K** | ⚠️ adverso preliminar (GAUGE peor que una constante), proxy a validar antes de RETIRAR. |
|
||||||
|
|
||||||
|
**El meta-hallazgo es el más valioso:** de 5 instrumentos M1, **2 mentían** (pasaban el oráculo de conteo con valores basura — los cacé y arreglé) y **2 quedan con caveats**. Esto **confirma en vivo** el hallazgo raíz del ecosistema: fuerte en mecanismo, **débil en observabilidad de outcome**. Auditar es difícil *porque la telemetría nunca se diseñó para medir efectividad* — que es exactamente lo que el arco viene diciendo.
|
||||||
|
|
||||||
|
## Checkpoint honesto antes del M2 (267K)
|
||||||
|
|
||||||
|
Elegiste "de una" (M2 completo). Pero M1 cambió el cuadro y te lo debo antes de gastar 267K — sería abdicación callarlo (PRÓLOGO):
|
||||||
|
|
||||||
|
**La ironía que no puedo ignorar:** el arco entero enseña *"control-positivo primero; el proceso elaborado rara vez gana su costo; el valor está en la medición barata, no en la ceremonia"*. M1 (barato) **ya apuntó la dirección**: shrink-leaning + observabilidad rota. Gastar 267K en confirmar rigurosamente lo que el prior (4/4 encogieron) + M1 ya sugieren… **es justo el tipo de proceso caro que estamos auditando**. Auditar con rigor si los protocolos ganan su costo, con un M2 que quizá no gana el suyo.
|
||||||
|
|
||||||
|
**Qué compra cada nivel de M2:**
|
||||||
|
- **PROCEDENCIA + TESSERA**: M2 robusto (plantan ground-truth fresco) — rigor limpio, ~145K.
|
||||||
|
- **COMPASS** (concordancia, corpus circular) · **ALQUIMIA** (routing circular + retrieval fresco) · **GAUGE** (hereda el proxy shaky): M2 con caveats — ~122K por números ya sesgados.
|
||||||
|
|
||||||
|
Recomiendo **B** (targeted). Pero es tu presupuesto y tu ecosistema — dime **A / B / C**.
|
||||||
Loading…
Reference in a new issue