ember-memory-test/episodes/EXPLORA_mi-v2-lo-cierra-exigiendo-referencia-de_S20260705.R16_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 6db296ada1 feat(episode): EXPLORA_mi-v2-lo-cierra-exigiendo-referencia-de_S20260705.R16_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 16 — BLINDADAS: Mi v2 lo cierra exigiendo referencia de procedencia...
2026-07-12 15:19:09 +00:00

2.4 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
14f3b922-3792-4f09-9e10-d03a2eb5a4f0 EXPLORA_mi-v2-lo-cierra-exigiendo-referencia-de_S20260705.R16_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations troubleshooting EPISODIO 16 — BLINDADAS: Mi v2 lo cierra exigiendo referencia de procedencia... claude_code internal 2026-07-12T15:16:09.887028+00:00 false pending

Mi v2 lo cierra exigiendo referencia de procedencia no-modelo y un oráculo en puro Python. 4. Confianza fabricada. Los "receipts" de ejemplo traen mutation 90%, deepeval 100%, crashes 0 — números inventados horneados en un JSON. El pecado "2.7M verde" convertido en plantilla. ## Lo que sí vale rescatar

Una sola cosa que mi v2 tenía delgada: la dimensión de seguridad del código que se ejecuta (sandbox least-privilege, threat-model en el contrato). Es legítima — pero solo escalonada (dispara únicamente cuando el código va a correr con privilegios reales), con herramientas bien atribuidas (protectai/llm-guard), y componiendo con lo que EMBER ya tiene: AEGIS + Casbin, no un stack paralelo. Lo folé como un 4º trigger opcional (EXTERNAL-SEC), no como pilar universal. ### 📍 PARA JOHN

  • Hice: verifiqué las herramientas de los 3 diseños (garak/LLM-Guard mal-citadas y mal-usadas; DeepEval es LLM-juez, no oráculo), y los mapeé contra mi v2. Triaje commiteado. - Lo esencial: los externos validan el rumbo pero adoptarlos tal cual reintroduciría bloat, herramientas fantasma y el juez sobornable del 4b. Mi RELOJERO-v2 ya destiló lo bueno, verificado. La única adición real es la seguridad escalonada sobre AEGIS. - Mi consejo: no fusionar estos diseños. El movimiento con retorno real es el mismo de siempre: construir external_oracle.py y medirlo sobre 4b + LUMEN. Todo lo demás es discusión de diseño hasta que haya dato — y ya tenemos suficiente diseño. - Para avanzar: 🟢 construyo external_oracle + re-corro el AB-LAB (el experimento que cierra todo) · 🟡 folo formalmente el tier EXTERNAL-SEC en el diseño v2 · "cierre" y hago la disciplina final (STATE + cosecha + commit).