ember-memory-test/episodes/DEPURA_cerrado-29-tests-verdes-commit-6d4bdfc5_S20260807.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 77271ac8dd feat(episode): DEPURA_cerrado-29-tests-verdes-commit-6d4bdfc5_S20260807.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: ATLAS | Type: advisory
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Cerrado. **29 tests verdes**, commit `6d4bdfc5`.
2026-08-08 01:05:23 +00:00

3.5 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
384e7102-b5a6-4620-9aed-f626c7cbe394 DEPURA_cerrado-29-tests-verdes-commit-6d4bdfc5_S20260807.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260807.DOCS_MNEMO_FUENTE_VIVA informar multi_actor low ATLAS operations advisory EPISODIO 1 — MNEMO_PRE_DIGEST: Cerrado. **29 tests verdes**, commit `6d4bdfc5`. claude_code internal 2026-08-08T01:05:19.228742+00:00 false pending

Cerrado. 29 tests verdes, commit 6d4bdfc5.

El reporte que disparó el cierre resultó tener el defecto que este chat lleva persiguiendo: publicaba «0%» y «100%» sobre un solo caso. En una tabla, esas cifras son indistinguibles de una métrica sólida.

Y no era un hallazgo nuevo: es SA-4-3, la tarea que marqué bloqueada hace un rato. Pero su nota ya prescribía qué hacer mientras tanto —«UNRELIABLE con su n, jamás métricas a secas»— y esa parte no dependía de lo que la bloqueaba. Así que se cierra.

Un detalle que importa: cada métrica tiene su propio denominador (precisión sobre TP+FP, recall sobre TP+FN, cumplimiento sobre los disparos). Si compartieran uno, dos de las tres mentirían. Hay un test que lo fija con un caso donde la precisión es fiable y el recall no.

Los 10 hooks pasaron de aparentar precisión a declarar su incertidumbre. Es lo honesto con una muestra de uno o dos.

Hice — el reporte de efectividad ya no publica porcentajes que su muestra no aguanta. Cerré la parte de SA-4-3 que no dependía de nada.

Falta — lo mismo que te dije: las 3 SA restantes dependen de ti o de un dato que no existe, y las decisiones abiertas siguen abiertas.

Mi consejo — nada nuevo por mi parte. El turno cierra aquí salvo que quieras que siga.

Y una observación sobre el conjunto, ahora que veo el patrón completo: cada instrumento que toqué hoy tenía la misma enfermedad. El detector de reglas fantasma castigaba a las honestas. El tablero declaraba pendiente lo hecho. El STALE gritaba sobre lo recién verificado. El vigilante que fabriqué acusaba al documento que arreglaba el problema. Y el reporte de efectividad publicaba certezas sobre un caso.

No es casualidad ni descuido: es más fácil construir algo que parezca medir que algo que mida. Por eso el control positivo —romper la herramienta a propósito y comprobar que lo nota— no es ceremonia; es lo único que separa un sensor de un adorno.

PREGUNTAS-JOHN · Q-007 manifiesto 174→204 · Q-008 conectar el escalador · Q-002 sustituto AST · Q-003/Q-004 los 2 gaps (vencen 2026-09-07) 🟠 HIGH · PP-013 el emisor de directivas por turno — desbloquea 5 SA de golpe 🟡 MEDIUM · SA-3-5 · SA-3-8 · SA-3-9 (conexión) RESUELTAS · SA-4-3 en su parte no bloqueada: el reporte JAE ya declara su n

la fragilidad de su muestra | precision recall y compliance --TIENEN--> denominadores DISTINTOS | control positivo --SEPARA--> sensor de adorno negated_concepts: 0% y 100% sobre n=1 NO son metricas; el cambio NO rompe compatibilidad; SA-4-3 NO estaba bloqueada entera epistemic_summary: hard_fact = el defecto medido en el reporte del 2026-08-08, el fix con sus 29 tests verdes y el efecto verificado sobre los 10 hooks | inference = que la patologia comun de todos los instrumentos del chat sea estructural y no casual -->