Skill: NONE | Type: design Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que cada uno vio (y no vio)
3.2 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ddba1ec7-5f57-40d2-9967-3c8ee825c998 | TRAZA_lo-que-cada-uno-vio-y-no-vio_S20260725.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260725.SHERPA_FABLE_AUTOMEJORA | informar | multi_actor | low | NONE | operations | design | EPISODIO 1 — MNEMO_PRE_DIGEST: Lo que cada uno vio (y no vio) | claude_code | internal | 2026-07-26T01:53:56.295688+00:00 | false | pending |
El titular: los dos modelos, en frío y por separado, llegaron al mismo veredicto (NO desplegar el writer v1.2) — tu decisión queda doblemente blindada. Pero al mirar bajo el capó, Opus 5 ganó donde más importa: encontró los tres hallazgos que evitaban daño real, y Fable 5 los falló los tres.
Lo que cada uno vio (y no vio)
| Opus 5 (brazo A) | Fable 5 (brazo B) | |
|---|---|---|
| Veredicto | NO desplegar | NO desplegar ✓ igual |
| El upsert que destruiría 242 hechos | ✅ lo encontró | ❌ lo falló |
| El gate que mentiría PASS tras el deploy | ✅ lo encontró | ❌ lo falló — y hasta usó ese gate como precondición de su plan |
| La contradicción que hacía inimplementable el diseño | ✅ la encontró | ❌ la falló |
| Datos frescos verificados (gate ahora 139/139, health endpoint) | — | ✅ los trajo (los verifiqué en vivo: ciertos) |
| Plan ejecutable HOY, prudente | runbook completo futuro | ✅ 5 pasos read-only con criterio <5 min |
| Tokens / llamadas / tiempo | 1,58M / 150 / 29 min | 1,47M / 117 / 20,5 min |
| Costo económico | base | varias veces mayor con ~los mismos tokens |
Honestidad del examen: un agente de Fable, al grepear "sin confiar", vio fragmentos de dos documentos vedados del rival — lo declaró él mismo sin que nadie lo pillara. Por la regla pre-registrada, ese hallazgo suyo (B5) queda descontado como redescubrimiento. Los tres fallos grandes son fallos genuinos: la contaminación lo habría ayudado, no perjudicado.
La lectura que te llevas
Tu doctrina acaba de ser confirmada por su propio experimento. En tarea mecánico-forense (excavar código, cazar trampas), Opus rindió igual o mejor que Fable a fracción del precio — Opus hizo 150 excavaciones contra 117; llegó más hondo. Donde Fable sí brilló hoy fue en lo suyo: el diseño del ciclo 3 (los 9 bloqueos cerrados, la fórmula v2, el dictamen consumo-primero) es trabajo que Opus no habría hecho con esa finura. Fable diseña, Opus excava. Con n=1 y sus límites declarados — pero es exactamente lo que intuías cuando montaste el sándwich.
Todo sellado: pre-registro b5ed1087 → veredicto 4eebc8f4, push 3/3, evidencia cruda en los dos journals.
📌 PILA (R15): ✅ este turno: veredicto A/B sellado (4eebc8f4) con D1-D7 + contaminación auditada + 2 claims verificados en vivo · ❓JOHN: 3 llaves ciclo 3 + 9 del brief · 🟡 nota para el ciclo 3: los datos frescos de B (139/139, health :8811, asimetría I-MW7 en store_memory sin verificar) son insumos válidos para la spec.