ember-memory-test/episodes/TRAZA_r4seccion1i1-lo-que-cambi-hoy-la-bscula_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 267fe8cbe2 feat(episode): TRAZA_r4seccion1i1-lo-que-cambi-hoy-la-bscula_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: [R4.seccion1.I1] Lo que cambió hoy: la báscula ya
2026-08-29 01:07:31 +00:00

3.2 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
2aea2fe9-914b-4ed4-863e-3331ba4db5ee TRAZA_r4seccion1i1-lo-que-cambi-hoy-la-bscula_S20260828.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260828.SID3E411925EAA3 informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: [R4.seccion1.I1] Lo que cambió hoy: la báscula ya pesa a la claude_code internal 2026-08-29T01:07:31.426721+00:00 false pending

[R4.seccion1.I1] Lo que cambió hoy: la báscula ya pesa a la persona correcta

Durante meses el ecosistema se pesaba con una báscula que medía a otra persona (un motor apagado) con las respuestas del examen escritas por el propio examinado. Ahora hay una que pesa a quien debe, y —esto es lo nuevo— trae un test que verifica que la báscula no miente: si le pones un peso conocido, tiene que marcar ese peso.

Los cuatro controles que más me importan del test, en llano:

Le doy... Debe decir Dijo
Ningún acierto FAIL FAIL
Acierto por debajo de la base FAIL FAIL
Acierto igual a la base PASS PASS
Acierto muy superior MEJORA MEJORA

Un instrumento que firma PASS con datos degradados es peor que no tener instrumento, porque produce confianza falsa. Este no puede.

Cambio de diseño que vale la pena que sepas: el umbral viejo exigía 70 % y era inalcanzable, así que llevaba meses gritando FAIL — y una alarma que nunca se apaga deja de ser una alarma. El nuevo compara contra la línea base real medida: avisa si empeoramos, confirma si nos mantenemos, y celebra si mejoramos. El 70 % sigue ahí, pero como distancia al objetivo (hoy: 0,259), sin contaminar el veredicto.

★ Insight ───────────────────────────────────── Un gate aspiracional y uno de regresión responden preguntas distintas: "¿llegamos a donde queremos?" vs "¿rompimos algo?". Confundirlos convierte el segundo —el único que sirve a diario— en ruido permanente. La replicación cruzada vale más que aumentar n: dos instrumentos con implementaciones distintas dando 0,140 y 0,148 es mucha más evidencia que un solo instrumento con n=1000. ─────────────────────────────────────────────────

Hallazgo colateral que reparé de paso. El guardián que exige tests para instrumentos nuevos me bloqueó — correctamente en intención, pero por un defecto real: buscaba el test con una búsqueda no recursiva, así que a los instrumentos que viven en subcarpetas los rechazaba aunque trajeran su test al lado. El propio código ya documentaba esta misma clase de fallo ocurrida en agosto ("el guardián castigando a quien le obedece") y había reincidido un nivel más abajo. Lo arreglé con control negativo: ahora reconoce el test legítimo y sigue rechazando lo que no lo tiene (3/3).