Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: [R4.seccion1.I1] Lo que cambió hoy: la báscula ya
3.2 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2aea2fe9-914b-4ed4-863e-3331ba4db5ee | TRAZA_r4seccion1i1-lo-que-cambi-hoy-la-bscula_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260828.SID3E411925EAA3 | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: [R4.seccion1.I1] Lo que cambió hoy: la báscula ya pesa a la | claude_code | internal | 2026-08-29T01:07:31.426721+00:00 | false | pending |
—
[R4.seccion1.I1] Lo que cambió hoy: la báscula ya pesa a la persona correcta
Durante meses el ecosistema se pesaba con una báscula que medía a otra persona (un motor apagado) con las respuestas del examen escritas por el propio examinado. Ahora hay una que pesa a quien debe, y —esto es lo nuevo— trae un test que verifica que la báscula no miente: si le pones un peso conocido, tiene que marcar ese peso.
Los cuatro controles que más me importan del test, en llano:
| Le doy... | Debe decir | Dijo |
|---|---|---|
| Ningún acierto | FAIL | ✅ FAIL |
| Acierto por debajo de la base | FAIL | ✅ FAIL |
| Acierto igual a la base | PASS | ✅ PASS |
| Acierto muy superior | MEJORA | ✅ MEJORA |
Un instrumento que firma PASS con datos degradados es peor que no tener instrumento, porque produce confianza falsa. Este no puede.
Cambio de diseño que vale la pena que sepas: el umbral viejo exigía 70 % y era inalcanzable, así que llevaba meses gritando FAIL — y una alarma que nunca se apaga deja de ser una alarma. El nuevo compara contra la línea base real medida: avisa si empeoramos, confirma si nos mantenemos, y celebra si mejoramos. El 70 % sigue ahí, pero como distancia al objetivo (hoy: 0,259), sin contaminar el veredicto.
★ Insight ─────────────────────────────────────
Un gate aspiracional y uno de regresión responden preguntas distintas: "¿llegamos a donde queremos?" vs "¿rompimos algo?". Confundirlos convierte el segundo —el único que sirve a diario— en ruido permanente.
La replicación cruzada vale más que aumentar n: dos instrumentos con implementaciones distintas dando 0,140 y 0,148 es mucha más evidencia que un solo instrumento con n=1000.
─────────────────────────────────────────────────
Hallazgo colateral que reparé de paso. El guardián que exige tests para instrumentos nuevos me bloqueó — correctamente en intención, pero por un defecto real: buscaba el test con una búsqueda no recursiva, así que a los instrumentos que viven en subcarpetas los rechazaba aunque trajeran su test al lado. El propio código ya documentaba esta misma clase de fallo ocurrida en agosto ("el guardián castigando a quien le obedece") y había reincidido un nivel más abajo. Lo arreglé con control negativo: ahora reconoce el test legítimo y sigue rechazando lo que no lo tiene (3/3).
—