ember-memory-test/episodes/TRAZA_para-john_S20260705.R15_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember ca7bcb5c09 feat(episode): TRAZA_para-john_S20260705.R15_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NEXUS | Type: design
Summary: EPISODIO 15 — BLINDADAS: 📍 PARA JOHN
2026-07-12 15:16:18 +00:00

2.9 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
ac039f5b-c656-4c86-b997-dc0fbb17c7de TRAZA_para-john_S20260705.R15_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NEXUS operations design EPISODIO 15 — BLINDADAS: 📍 PARA JOHN claude_code internal 2026-07-12T15:16:09.756753+00:00 false pending

No adopto nada por bonito. Construir external_oracle y re-correr el AB-LAB sobre (a) el caso 4b real y (b) LUMEN, tu modelo local débil — donde la hipótesis es que la estructura paga (CB>0). Si el oráculo no atrapa 4b o no ayuda en modelo débil → v2 no se adopta y el veredicto de retiro se refuerza. Eso conecta con los dos frentes abiertos que ya teníamos (mantenibilidad + modelo-débil).

Los tres diseños externos: buen rumbo, mismos pecados

Commit 725f6cd, push 3/3. docs/TRIAJE_DISENOS_EXTERNOS_RELOJERO_V2_S20260705.md. John, verifiqué en vivo antes de opinar, y el resultado es limpio: estos tres diseños no superan al RELOJERO-v2 que ya construimos — son su versión sin verificar, sin escalonar y sin auditar.

Lo bueno: convergen

Los 3 externos + mi v2 + las 4 opiniones + las 5 investigaciones apuntan al mismo núcleo: verificación externa, least-privilege, receipts, escalonar. Cinco caminos independientes al mismo lugar — el rumbo está sólido, y eso vale. ## Lo malo: repiten los 4 pecados que mi workflow ya atrapó

  1. Bloat universal. Aplican 5 pilares pesados (sandbox + red-team + fuzzing + receipt firmado + contrato) a toda generación de código. El paper de ETH (2602.11988) y mi AB-LAB prueban que eso baja el éxito y sube el costo >20%. Ninguno escalona. Mi v2 sí (LITE por defecto = cero ceremonia). 2. Herramientas fantasma (verificado en vivo):
    • garak → lo citan como leonardovolker/garak con una API fuzz.Fuzzer(codigo). Real es NVIDIA/garak, y escanea LLMs, no fuzzea código. La API está inventada. - LLM Guard → lo citan como GuardrailsAI/llm-guard con un RedTeamAgent que "ataca código". Real es protectai/llm-guard, un firewall de prompts, sin ese API. - AgentForge → sigue sin verificarse (arrastra los enlaces morphllm.com alucinados). 3. El juez sobornable, de vuelta. Su "verificador externo" estrella es DeepEval, que es un LLM juzgando a otro LLM — y el ejemplo compara el archivo consigo mismo (expected == actual), o sea siempre pasa. Es literalmente el fallo 4b ("2.7M verde" auto-confirmado) re-instanciado.