ember-memory-test/episodes/TRAZA_lo-que-cada-uno-vio-y-no-vio_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 4a6876e567 feat(episode): TRAZA_lo-que-cada-uno-vio-y-no-vio_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: design
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que cada uno vio (y no vio)
2026-07-26 01:54:03 +00:00

3.2 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
ddba1ec7-5f57-40d2-9967-3c8ee825c998 TRAZA_lo-que-cada-uno-vio-y-no-vio_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260725.SHERPA_FABLE_AUTOMEJORA informar multi_actor low NONE operations design EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que cada uno vio (y no vio) claude_code internal 2026-07-26T01:53:56.295688+00:00 false pending

El titular: los dos modelos, en frío y por separado, llegaron al mismo veredicto (NO desplegar el writer v1.2) — tu decisión queda doblemente blindada. Pero al mirar bajo el capó, Opus 5 ganó donde más importa: encontró los tres hallazgos que evitaban daño real, y Fable 5 los falló los tres.

Lo que cada uno vio (y no vio)

Opus 5 (brazo A) Fable 5 (brazo B)
Veredicto NO desplegar NO desplegar ✓ igual
El upsert que destruiría 242 hechos lo encontró lo falló
El gate que mentiría PASS tras el deploy lo encontró lo falló — y hasta usó ese gate como precondición de su plan
La contradicción que hacía inimplementable el diseño la encontró la falló
Datos frescos verificados (gate ahora 139/139, health endpoint) los trajo (los verifiqué en vivo: ciertos)
Plan ejecutable HOY, prudente runbook completo futuro 5 pasos read-only con criterio <5 min
Tokens / llamadas / tiempo 1,58M / 150 / 29 min 1,47M / 117 / 20,5 min
Costo económico base varias veces mayor con ~los mismos tokens

Honestidad del examen: un agente de Fable, al grepear "sin confiar", vio fragmentos de dos documentos vedados del rival — lo declaró él mismo sin que nadie lo pillara. Por la regla pre-registrada, ese hallazgo suyo (B5) queda descontado como redescubrimiento. Los tres fallos grandes son fallos genuinos: la contaminación lo habría ayudado, no perjudicado.

La lectura que te llevas

Tu doctrina acaba de ser confirmada por su propio experimento. En tarea mecánico-forense (excavar código, cazar trampas), Opus rindió igual o mejor que Fable a fracción del precio — Opus hizo 150 excavaciones contra 117; llegó más hondo. Donde Fable sí brilló hoy fue en lo suyo: el diseño del ciclo 3 (los 9 bloqueos cerrados, la fórmula v2, el dictamen consumo-primero) es trabajo que Opus no habría hecho con esa finura. Fable diseña, Opus excava. Con n=1 y sus límites declarados — pero es exactamente lo que intuías cuando montaste el sándwich.

Todo sellado: pre-registro b5ed1087 → veredicto 4eebc8f4, push 3/3, evidencia cruda en los dos journals.

📌 PILA (R15): este turno: veredicto A/B sellado (4eebc8f4) con D1-D7 + contaminación auditada + 2 claims verificados en vivo · JOHN: 3 llaves ciclo 3 + 9 del brief · 🟡 nota para el ciclo 3: los datos frescos de B (139/139, health :8811, asimetría I-MW7 en store_memory sin verificar) son insumos válidos para la spec.