ember-memory-test/episodes/EXPLORA_lo-esencial-que-ya-s-verificado-en-vivo_S20260705.R10_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 2f83038bef feat(episode): EXPLORA_lo-esencial-que-ya-s-verificado-en-vivo_S20260705.R10_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 10 — ember-mcp: Lo esencial que ya sé (verificado en vivo)
2026-07-12 16:27:45 +00:00

2.6 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
7cb550ea-9f2b-433f-b7ff-365cdeee90f0 EXPLORA_lo-esencial-que-ya-s-verificado-en-vivo_S20260705.R10_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations troubleshooting EPISODIO 10 — ember-mcp: Lo esencial que ya sé (verificado en vivo) claude_code internal 2026-07-12T16:18:09.034086+00:00 false pending

Triaje verificado commiteado (984d290, push 3/3): docs/LANDSCAPE_VERIFICADO_RELOJERO_S20260705.md. El workflow de diseño RELOJERO-v2 (wct7heks4) sigue corriendo; te aviso su resultado cuando termine.

Lo esencial que ya sé (verificado en vivo)

Tu pregunta era doble: (a) qué hay comparable a RELOJERO y (b) cómo llevarlo al máximo. La parte (a) está resuelta con dato — y el hallazgo más importante no es un competidor, es una advertencia empírica:

El paper de ETH Zürich (2602.11988) demuestra que los "context files" tipo instrucciones-de-agente REDUCEN el éxito y suben el costo >20%. Es respaldo independiente y externo de exactamente lo que mi laboratorio encontró solo: añadir ceremonia a tareas acotadas hace daño. Dos caminos distintos (mi AB-LAB + un paper académico revisado) llegaron a la misma conclusión. Eso convierte el rediseño de RELOJERO en algo con dirección clara: no más prosa — solo controles ejecutables, y solo donde se ganen su lugar.

Y confirmé el patrón de la sesión una vez más: los 5 documentos que te dieron las IAs son ~70% real, ~30% inventado. spec-kit, Loopy, Agent Contracts, Outlines, LLMorpheus, QWED son reales y sólidos. Pero "525× variance", "F1=96.95%", el repo flyersworder, AgentForge y los enlaces morphllm.com son fabricados o no verificables. Si hubiera construido RELOJERO-v2 tomándolos por su cara, habría repetido el pecado del "2.7M casos verde" a nivel meta.

La dirección convergente (de lo verificado)

Todo apunta al mismo RELOJERO-v2: (1) el 3er pilar cambia de auto-verificación introspectiva → verificación externa mandatoria (mutation real / oráculo diferencial / QWED simbólico) — esto fija el 4b; (2) escalonado Lite/Full/External para no perjudicar tareas fáciles; (3) budget + least-privilege + receipt como controles ejecutables, no prosa.