feat(episode): TRAZA_y-la-verificacin-previa-dio-21-de-21_S20260823.R4_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 4 — MEMORIA: Y la verificación previa dio **21 de 21**,...
This commit is contained in:
Ember 2026-08-23 22:53:17 +00:00
parent e1b45c3dec
commit d246e038d4

View file

@ -0,0 +1,47 @@
---
episode_id: "6dd40d1c-b22a-4018-9a79-26858b4c5db1"
puente_flat: "TRAZA_y-la-verificacin-previa-dio-21-de-21_S20260823.R4_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260823.SID4BCC8DB97BCD"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 4 — MEMORIA: Y la verificación previa dio **21 de 21**,..."
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-23T22:53:03.804418+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Y la verificación previa dio **21 de 21**, con un detalle que vale doble: tres de los valores esperados son los p-valores de McNemar que **otro script calculó hoy** sobre los datos reales. Dos instrumentos escritos por separado coinciden hasta el cuarto decimal — si no lo hicieran, uno de los dos mentiría y habría que averiguar cuál antes de usar ninguno.
🟠 **HIGH** · `R2.4` prueba A/B/C **corriendo** en el servidor MEMORIA (~1,5-2 h, vigía puesto) · **Ember · hoy**
🟡 **MEDIUM** · `D-CFG` recorte a 1200 más estrecho que el presupuesto del modelo **2026-08-30** · `E3` enjambre en `PENDIENTE_AUDITORIA` (EO-1) **2026-09-05** · `R2.3` salto no monótono K=100→200 **2026-09-05**
**PREGUNTAS-JOHN** · `E1` GO/NO-GO DC-04 **2026-08-30** · `Q-SEC` clave Anthropic + cuota Gemini (CA-3) **2026-08-29** · `Q-DRIFT` 15 fugas de julio **2026-08-30**
**RESUELTAS (R28)** · experimento diseñado con desenlace continuo · oráculo 21/21 con control cruzado · bloqueo AEGIS resuelto **sin excepción** · commit + push 3/3
> 🎯 **En una frase:** la prueba que decide está corriendo, y en el camino un guardián me frenó — no lo salté, le quité la razón para frenarme.
**✅ Hice.** Diseñé el experimento para que mida algo **continuo** (la puntuación) en vez de algo binario (el acierto): con pocas consultas, una medida continua ve lo que una binaria no. Lo verifiqué antes de lanzarlo con 21 comprobaciones, tres de ellas contrastadas contra un script distinto que ya había calculado los mismos números hoy.
**⏳ Falta.** El resultado, en hora y media o dos. Depende solo de la máquina: pasa unas 4.500 comparaciones por el modelo, en procesador, sin tarjeta gráfica.
**💡 Mi consejo.** Quédate con lo del guardián, porque es más importante que el experimento. Me bloqueó, tenía la puerta de escape a mano y documentada, y **la puerta de escape era la respuesta fácil y equivocada**. Un guardián al que se le concede la excepción cada vez que estorba deja de ser un guardián en dos semanas. Lo que hace que sigan funcionando es que quien los encuentra prefiera cambiar su propio trabajo antes que pedirles permiso.
**Para avanzar, elige:**
- 🟢 **A** *(recomendado)***Esperamos el resultado** y cierro el arco con el número. Es la última pieza.
- 🟡 **B** — Mientras corre, arreglo el defecto gratuito de configuración (el recorte más estrecho que el presupuesto del modelo).
- ⚪ **C** — Cerramos por hoy; el vigía y el relevo garantizan que el resultado no se pierda.
saturación de logits (conf 0.5, hipótesis en prueba); AEGIS --BLOQUEA--> lectura de secretos en scripts nuevos (conf 1.0, medido); delegación en get_client --ELIMINA--> necesidad de excepción (conf 1.0)
negated_concepts: NO se creó bandera de excepción de AEGIS; el desenlace NO es binario; el experimento NO toca producción ni el FREEZE
epistemic_summary: hard_facts = 21/21 del oráculo, md5 idéntico, bloqueo de AEGIS y su resolución, proceso lanzado y vivo; pendiente de dato = si la cabecera levanta la abstención; decisión metodológica = desenlace continuo por potencia estadística
-->