--- episode_id: "ac039f5b-c656-4c86-b997-dc0fbb17c7de" puente_flat: "TRAZA_para-john_S20260705.R15_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260705.EVAL_INSTRUMENT_FORGE_SKILL" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "NEXUS" fase_proyecto: "operations" tipo_semantico: "design" summary_one_line: "EPISODIO 15 — BLINDADAS: 📍 PARA JOHN" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-07-12T15:16:09.756753+00:00" relectura_tagged: false forgejo_commit_sha: "pending" --- No adopto nada por bonito. **Construir `external_oracle` y re-correr el AB-LAB** sobre (a) el caso 4b real y (b) **LUMEN, tu modelo local débil** — donde la hipótesis es que la estructura *sí* paga (C−B>0). Si el oráculo no atrapa 4b o no ayuda en modelo débil → v2 no se adopta y el veredicto de retiro se refuerza. Eso conecta con los dos frentes abiertos que ya teníamos (mantenibilidad + modelo-débil). # Los tres diseños externos: buen rumbo, mismos pecados Commit `725f6cd`, push 3/3. [docs/TRIAJE_DISENOS_EXTERNOS_RELOJERO_V2_S20260705.md](docs/TRIAJE_DISENOS_EXTERNOS_RELOJERO_V2_S20260705.md). John, verifiqué en vivo antes de opinar, y el resultado es limpio: **estos tres diseños no superan al RELOJERO-v2 que ya construimos — son su versión sin verificar, sin escalonar y sin auditar.** ## Lo bueno: convergen Los 3 externos + mi v2 + las 4 opiniones + las 5 investigaciones apuntan al mismo núcleo: verificación externa, least-privilege, receipts, escalonar. **Cinco caminos independientes al mismo lugar** — el rumbo está sólido, y eso vale. ## Lo malo: repiten los 4 pecados que mi workflow ya atrapó 1. **Bloat universal.** Aplican 5 pilares pesados (sandbox + red-team + fuzzing + receipt firmado + contrato) a *toda* generación de código. El paper de ETH ([2602.11988](https://arxiv.org/abs/2602.11988)) y mi AB-LAB prueban que eso baja el éxito y sube el costo >20%. **Ninguno escalona.** Mi v2 sí (LITE por defecto = cero ceremonia). 2. **Herramientas fantasma** (verificado en vivo): - **garak** → lo citan como `leonardovolker/garak` con una API `fuzz.Fuzzer(codigo)`. Real es **[NVIDIA/garak](https://github.com/NVIDIA/garak)**, y **escanea LLMs, no fuzzea código**. La API está inventada. - **LLM Guard** → lo citan como `GuardrailsAI/llm-guard` con un `RedTeamAgent` que "ataca código". Real es **[protectai/llm-guard](https://github.com/protectai/llm-guard)**, un **firewall de prompts**, sin ese API. - **AgentForge** → sigue sin verificarse (arrastra los enlaces `morphllm.com` alucinados). 3. **El juez sobornable, de vuelta.** Su "verificador externo" estrella es **DeepEval, que es un LLM juzgando a otro LLM** — y el ejemplo compara el archivo *consigo mismo* (`expected == actual`), o sea siempre pasa. Es literalmente el fallo 4b ("2.7M verde" auto-confirmado) re-instanciado.