ember-memory-test/episodes/DEPURA_las-dos-cosas-en-marcha-pepita-cerrada_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 069a7afff5 feat(episode): DEPURA_las-dos-cosas-en-marcha-pepita-cerrada_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: ✅ Las dos cosas en marcha: pepita cerrada y el A/
2026-07-26 01:28:25 +00:00

3.2 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
7c4e7502-95c4-4082-ade1-7332f7d2f6dc DEPURA_las-dos-cosas-en-marcha-pepita-cerrada_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260725.SHERPA_FABLE_AUTOMEJORA informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: ✅ Las dos cosas en marcha: pepita cerrada y el A/B corriendo claude_code internal 2026-07-26T01:28:24.451791+00:00 false pending

✅ Las dos cosas en marcha: pepita cerrada y el A/B corriendo

1. La pepita quedó arreglada (con test contra oráculo)

El ecosistema ya registra quién lo opera. La nueva lib guarda el modelo activo en el estado de sesión con su fuente literal (el output del comando /model, no una suposición) y mantiene un rastro append-only. Cinco tests en verde, incluyendo el que más importa: sin registro, responde "unknown" declarado — jamás adivina. Registré las tres transiciones reales de hoy: Fable al arrancar → Opus 5 para el ciclo 2 → Fable 5 ahora (tu cambio para este experimento). Y quedó merge aditivo: no pisa los campos que ya vivían en el archivo. Commit b5ed1087, push 3/3.

2. El experimento: hice algo antes de lanzarlo que quiero que sepas

Congelé las reglas del juego ANTES de ver un solo resultado — PREREGISTRO_AB_FABLE_VS_OPUS_S20260726.md. Si definiera las varas después, podría (sin querer) acomodarlas para favorecer a cualquiera de los dos. Las siete dimensiones selladas: mismo veredicto o no · cuántos de los 9 bloqueos redescubre Fable solo · hallazgos nuevos reales (re-verificados) · falsos hallazgos · accionabilidad · contaminación · costo y tiempo.

Sobre la contaminación — el detalle técnico que hace válido el examen: desde que corrió el brazo A, el repo ya contiene las respuestas (el veredicto, los 9 bloqueos, el diseño de Fable). Si los agentes del brazo B los leyeran, sería copiarse del rival. Por eso su guion lleva una lista de artefactos vedados que restaura la equivalencia de información, y la fuga residual (mensajes de commits) se auditará en su registro, no se supondrá ausente.

El brazo B está corriendo: 8 agentes Fable 5, guion idéntico, en background (wz1w80k34). El brazo A tomó ~29 minutos; este puede tomar más. Costo declarado: magnitud comparable a los 1,58M del brazo A, en tokens Fable — lo pediste dos veces, así que se ejecuta con el precio a la vista.

Cuando termine te entrego la comparación contra los criterios congelados — incluyendo la posibilidad incómoda de que Fable encuentre errores en el trabajo del brazo A: eso también contaría, para ambos lados del marcador.

📌 PILA (R14): 🔵 EN CURSO: brazo B del A/B (wz1w80k34, 8 agentes Fable) · ✅ este turno: pepita modelo-operante (5 tests) + pre-registro D1-D7 sellado + commit b5ed1087 push 3/3 · ❓JOHN: 3 llaves ciclo 3 + 9 del brief · 🟡 futuro: wiring del registro de modelo al boot panel (seguimiento menor).