ember-memory-test/episodes/TRAZA_lo-que-pediste-y-lo-que-encontr_S20260731.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember c1f3d06620 feat(episode): TRAZA_lo-que-pediste-y-lo-que-encontr_S20260731.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: design
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Lo que pediste, y lo que encontré
2026-08-01 01:56:25 +00:00

3 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
c4912c90-026a-4fa2-bdf7-8a68dd455909 TRAZA_lo-que-pediste-y-lo-que-encontr_S20260731.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260731.ZERO_DEUDA_CIERRE_TOTAL informar multi_actor low NONE operations design EPISODIO 2 — MNEMO_PRE_DIGEST: Lo que pediste, y lo que encontré claude_code internal 2026-08-01T01:56:10.418959+00:00 false pending

Todo cerrado y verificado. Te resumo la jornada.

Lo que pediste, y lo que encontré

Sí, fuiste claro, y la respuesta corta a tu pregunta central es alentadora: el ecosistema que construiste ya usa la arquitectura correcta. Lo que falla es más pequeño y más arreglable de lo que parecía.

El hallazgo que ordena todo lo demás es un criterio que ninguna de las fuentes nombra como titular, pero en el que convergen cuatro de ellas de forma independiente:

El trabajo de lectura se paraleliza; el de escritura no.

Eso disuelve una polémica pública que parecía irreconciliable. Anthropic publicó que su enjambre de agentes supera al mejor agente único en un 90%; Cognition publicó un ensayo titulado "no construyas multi-agentes". No se contradicen: describen los dos lados del mismo eje. Cuando cada agente lee una faceta distinta, el enjambre gana. Cuando varios escriben sobre el mismo estado compartido, se pisan — y la propia Anthropic lo dice, excluyendo explícitamente programar y depurar del caso multi-agente. La evidencia más cruda es suya: pusieron 16 agentes a construir un compilador y "chocaron con el mismo bug, lo arreglaron, y sobrescribieron los cambios de los demás".

Y sobre tu patrón Fable-dirige / Opus-ejecuta: existe, está medido, y Anthropic lo vende cableado. Separar "quien piensa" de "quien edita" mejora entre 3 y 10 puntos, y el récord se logró justamente cuando el ejecutor era el modelo más barato. Además hay un dato que valida SHERPA de forma directa: el rendimiento cae un 39% cuando la tarea se refina conversando, frente a un único briefing bien hecho. Cuando el modelo toma un mal giro en la conversación, se pierde y no se recupera. Tu instinto de empaquetar todo de una vez estaba bien fundado.

Lo que la auditoría destapó en casa

Mandé siete auditores a medir los siete canales, y luego siete refutadores distintos a intentar tumbar cada hallazgo con mediciones propias. De 54 hallazgos, 28 sobrevivieron intactos, 25 quedaron matizados y uno fue refutado. Los refutadores además encontraron 28 cosas que los auditores no vieron, varias peores.

El diagnóstico se resume en una frase: seis de siete sensores mentían, y todos por la misma razón — medían algo fácil (un conteo, una presencia) en vez del hecho que importaba (si alguien lo leyó, si sirvió). Tres ejemplos que duelen: