Skill: NONE | Type: troubleshooting Summary: EPISODIO 10 — ember-mcp: Lo esencial que ya sé (verificado en vivo)
2.6 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 7cb550ea-9f2b-433f-b7ff-365cdeee90f0 | EXPLORA_lo-esencial-que-ya-s-verificado-en-vivo_S20260705.R10_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260705.EVAL_INSTRUMENT_FORGE_SKILL | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 10 — ember-mcp: Lo esencial que ya sé (verificado en vivo) | claude_code | internal | 2026-07-12T16:18:09.034086+00:00 | false | pending |
Triaje verificado commiteado (984d290, push 3/3): docs/LANDSCAPE_VERIFICADO_RELOJERO_S20260705.md. El workflow de diseño RELOJERO-v2 (wct7heks4) sigue corriendo; te aviso su resultado cuando termine.
Lo esencial que ya sé (verificado en vivo)
Tu pregunta era doble: (a) qué hay comparable a RELOJERO y (b) cómo llevarlo al máximo. La parte (a) está resuelta con dato — y el hallazgo más importante no es un competidor, es una advertencia empírica:
El paper de ETH Zürich (2602.11988) demuestra que los "context files" tipo instrucciones-de-agente REDUCEN el éxito y suben el costo >20%. Es respaldo independiente y externo de exactamente lo que mi laboratorio encontró solo: añadir ceremonia a tareas acotadas hace daño. Dos caminos distintos (mi AB-LAB + un paper académico revisado) llegaron a la misma conclusión. Eso convierte el rediseño de RELOJERO en algo con dirección clara: no más prosa — solo controles ejecutables, y solo donde se ganen su lugar.
Y confirmé el patrón de la sesión una vez más: los 5 documentos que te dieron las IAs son ~70% real, ~30% inventado. spec-kit, Loopy, Agent Contracts, Outlines, LLMorpheus, QWED son reales y sólidos. Pero "525× variance", "F1=96.95%", el repo flyersworder, AgentForge y los enlaces morphllm.com son fabricados o no verificables. Si hubiera construido RELOJERO-v2 tomándolos por su cara, habría repetido el pecado del "2.7M casos verde" a nivel meta.
La dirección convergente (de lo verificado)
Todo apunta al mismo RELOJERO-v2: (1) el 3er pilar cambia de auto-verificación introspectiva → verificación externa mandatoria (mutation real / oráculo diferencial / QWED simbólico) — esto fija el 4b; (2) escalonado Lite/Full/External para no perjudicar tareas fáciles; (3) budget + least-privilege + receipt como controles ejecutables, no prosa.