2.9 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ac039f5b-c656-4c86-b997-dc0fbb17c7de | TRAZA_para-john_S20260705.R15_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260705.EVAL_INSTRUMENT_FORGE_SKILL | informar | multi_actor | low | NEXUS | operations | design | EPISODIO 15 — BLINDADAS: 📍 PARA JOHN | claude_code | internal | 2026-07-12T15:16:09.756753+00:00 | false | pending |
No adopto nada por bonito. Construir external_oracle y re-correr el AB-LAB sobre (a) el caso 4b real y (b) LUMEN, tu modelo local débil — donde la hipótesis es que la estructura sí paga (C−B>0). Si el oráculo no atrapa 4b o no ayuda en modelo débil → v2 no se adopta y el veredicto de retiro se refuerza. Eso conecta con los dos frentes abiertos que ya teníamos (mantenibilidad + modelo-débil).
Los tres diseños externos: buen rumbo, mismos pecados
Commit 725f6cd, push 3/3. docs/TRIAJE_DISENOS_EXTERNOS_RELOJERO_V2_S20260705.md. John, verifiqué en vivo antes de opinar, y el resultado es limpio: estos tres diseños no superan al RELOJERO-v2 que ya construimos — son su versión sin verificar, sin escalonar y sin auditar.
Lo bueno: convergen
Los 3 externos + mi v2 + las 4 opiniones + las 5 investigaciones apuntan al mismo núcleo: verificación externa, least-privilege, receipts, escalonar. Cinco caminos independientes al mismo lugar — el rumbo está sólido, y eso vale. ## Lo malo: repiten los 4 pecados que mi workflow ya atrapó
- Bloat universal. Aplican 5 pilares pesados (sandbox + red-team + fuzzing + receipt firmado + contrato) a toda generación de código. El paper de ETH (2602.11988) y mi AB-LAB prueban que eso baja el éxito y sube el costo >20%. Ninguno escalona. Mi v2 sí (LITE por defecto = cero ceremonia). 2. Herramientas fantasma (verificado en vivo):
- garak → lo citan como
leonardovolker/garakcon una APIfuzz.Fuzzer(codigo). Real es NVIDIA/garak, y escanea LLMs, no fuzzea código. La API está inventada. - LLM Guard → lo citan comoGuardrailsAI/llm-guardcon unRedTeamAgentque "ataca código". Real es protectai/llm-guard, un firewall de prompts, sin ese API. - AgentForge → sigue sin verificarse (arrastra los enlacesmorphllm.comalucinados). 3. El juez sobornable, de vuelta. Su "verificador externo" estrella es DeepEval, que es un LLM juzgando a otro LLM — y el ejemplo compara el archivo consigo mismo (expected == actual), o sea siempre pasa. Es literalmente el fallo 4b ("2.7M verde" auto-confirmado) re-instanciado.
- garak → lo citan como