Skill: NONE | Type: troubleshooting Summary: EPISODIO 132 — MNEMO_PRE_DIGEST: Tienes toda la razón — y ya hay evidencia de qu
3.1 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 29125f20-2994-480c-a908-29cf64482daa | DEPURA_tienes-toda-la-razn-y-ya-hay-evidencia_S20260704.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260704.ANTI_OLVIDO_ESTADO_VIVO | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 132 — MNEMO_PRE_DIGEST: Tienes toda la razón — y ya hay evidencia de que parte ES bu | claude_code | internal | 2026-07-12T16:18:09.126543+00:00 | false | pending |
Documento completo: docs/PROPUESTA_EVALUACION_UNIVERSAL_PROTOCOLOS_S20260705.md. Mi respuesta directa:
Tienes toda la razón — y ya hay evidencia de que parte ES buche y plumas
No estás especulando. Esta sesión ya destapó ruido medido: CONCILIO (el protocolo más pesado, 13 lentes) no supera el azar; MNEMO_HYDE estaba 92.7% estrangulado; el routing-verifier al 61.8% de concordancia me alertó en falso todo el chat. El problema es que hoy tenemos el costo medido y el beneficio en blanco: cientos de inyecciones de hooks por sesión, ~13 forks de Python/turno, ~10s de impuesto por turno. Numerador conocido, denominador desconocido — por eso tu pregunta es urgente.
Pero el método NO son 50 experimentos A/B
Ese es el error que mataría el proyecto. El A/B de RELOJERO (600 runs, $400) no se hizo en 3 meses; multiplicarlo por 50 es garantía de que no pasa nada. El método correcto es ABLATION, no A/B:
- A/B pregunta "¿cuánto ayuda?" → caro, control cuidado.
- Ablation pregunta "¿ayuda algo?" → apagas el protocolo, corres el golden set, ¿el score baja? No baja = era ruido. Directo a "buche y plumas", 10× más barato.
Tres verdades que un "midamos todo" ingenuo ignora
-
El prerequisito es el instrumento, no la medición. Ablation necesita una métrica de outcome — y esa pieza (el harness de evals) apenas nació este sprint. El siguiente salto no es medir, es construir el termómetro. Medir viene después, casi gratis.
-
No todos son medibles — y está bien. RELOJERO/CRISOL/routing/retrieval sí (ablation o telemetría). Pero PRÓLOGO, NARRATE, PROCEDENCIA, CIERRE-PARA-JOHN tienen un solo evaluador válido: tú. Su outcome es tu comprensión y tu confianza. Pretender medirlos con un score sería su propio teatro. Para esos, tu juicio directo es la evaluación honesta — hay que declararlo, no fingir un número.
-
La trampa suprema: el programa se mide por lo que MATA. Este programa de evaluación es, él mismo, un protocolo. Si corre 3 meses y no retira ni uno, es sospechoso (o el ecosistema era perfecto —improbable— o hay sesgo de confirmación justificando el trabajo hecho). Skin in the game: el éxito se cuenta en muertes y podas, no en documentos de validación. Meta pre-declarada: si de ~50 ninguno cae, el programa falló como instrumento.