Skill: ATLAS | Type: advisory Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Cerrado. **29 tests verdes**, commit `6d4bdfc5`.
3.5 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 384e7102-b5a6-4620-9aed-f626c7cbe394 | DEPURA_cerrado-29-tests-verdes-commit-6d4bdfc5_S20260807.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260807.DOCS_MNEMO_FUENTE_VIVA | informar | multi_actor | low | ATLAS | operations | advisory | EPISODIO 1 — MNEMO_PRE_DIGEST: Cerrado. **29 tests verdes**, commit `6d4bdfc5`. | claude_code | internal | 2026-08-08T01:05:19.228742+00:00 | false | pending |
Cerrado. 29 tests verdes, commit 6d4bdfc5.
El reporte que disparó el cierre resultó tener el defecto que este chat lleva persiguiendo: publicaba «0%» y «100%» sobre un solo caso. En una tabla, esas cifras son indistinguibles de una métrica sólida.
Y no era un hallazgo nuevo: es SA-4-3, la tarea que marqué bloqueada hace un rato. Pero su nota ya prescribía qué hacer mientras tanto —«UNRELIABLE con su n, jamás métricas a secas»— y esa parte no dependía de lo que la bloqueaba. Así que se cierra.
Un detalle que importa: cada métrica tiene su propio denominador (precisión sobre TP+FP, recall sobre TP+FN, cumplimiento sobre los disparos). Si compartieran uno, dos de las tres mentirían. Hay un test que lo fija con un caso donde la precisión es fiable y el recall no.
Los 10 hooks pasaron de aparentar precisión a declarar su incertidumbre. Es lo honesto con una muestra de uno o dos.
Hice — el reporte de efectividad ya no publica porcentajes que su muestra no aguanta. Cerré la parte de SA-4-3 que no dependía de nada.
Falta — lo mismo que te dije: las 3 SA restantes dependen de ti o de un dato que no existe, y las decisiones abiertas siguen abiertas.
Mi consejo — nada nuevo por mi parte. El turno cierra aquí salvo que quieras que siga.
Y una observación sobre el conjunto, ahora que veo el patrón completo: cada instrumento que toqué hoy tenía la misma enfermedad. El detector de reglas fantasma castigaba a las honestas. El tablero declaraba pendiente lo hecho. El STALE gritaba sobre lo recién verificado. El vigilante que fabriqué acusaba al documento que arreglaba el problema. Y el reporte de efectividad publicaba certezas sobre un caso.
No es casualidad ni descuido: es más fácil construir algo que parezca medir que algo que mida. Por eso el control positivo —romper la herramienta a propósito y comprobar que lo nota— no es ceremonia; es lo único que separa un sensor de un adorno.
❓ PREGUNTAS-JOHN · Q-007 manifiesto 174→204 · Q-008 conectar el escalador · Q-002 sustituto AST · Q-003/Q-004 los 2 gaps (vencen 2026-09-07)
🟠 HIGH · PP-013 el emisor de directivas por turno — desbloquea 5 SA de golpe
🟡 MEDIUM · SA-3-5 · SA-3-8 · SA-3-9 (conexión)
✅ RESUELTAS · SA-4-3 en su parte no bloqueada: el reporte JAE ya declara su n
la fragilidad de su muestra | precision recall y compliance --TIENEN--> denominadores DISTINTOS | control positivo --SEPARA--> sensor de adorno negated_concepts: 0% y 100% sobre n=1 NO son metricas; el cambio NO rompe compatibilidad; SA-4-3 NO estaba bloqueada entera epistemic_summary: hard_fact = el defecto medido en el reporte del 2026-08-08, el fix con sus 29 tests verdes y el efecto verificado sobre los 10 hooks | inference = que la patologia comun de todos los instrumentos del chat sea estructural y no casual -->