Skill: NONE | Type: design Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Lo que pediste, y lo que encontré
3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| c4912c90-026a-4fa2-bdf7-8a68dd455909 | TRAZA_lo-que-pediste-y-lo-que-encontr_S20260731.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260731.ZERO_DEUDA_CIERRE_TOTAL | informar | multi_actor | low | NONE | operations | design | EPISODIO 2 — MNEMO_PRE_DIGEST: Lo que pediste, y lo que encontré | claude_code | internal | 2026-08-01T01:56:10.418959+00:00 | false | pending |
Todo cerrado y verificado. Te resumo la jornada.
Lo que pediste, y lo que encontré
Sí, fuiste claro, y la respuesta corta a tu pregunta central es alentadora: el ecosistema que construiste ya usa la arquitectura correcta. Lo que falla es más pequeño y más arreglable de lo que parecía.
El hallazgo que ordena todo lo demás es un criterio que ninguna de las fuentes nombra como titular, pero en el que convergen cuatro de ellas de forma independiente:
El trabajo de lectura se paraleliza; el de escritura no.
Eso disuelve una polémica pública que parecía irreconciliable. Anthropic publicó que su enjambre de agentes supera al mejor agente único en un 90%; Cognition publicó un ensayo titulado "no construyas multi-agentes". No se contradicen: describen los dos lados del mismo eje. Cuando cada agente lee una faceta distinta, el enjambre gana. Cuando varios escriben sobre el mismo estado compartido, se pisan — y la propia Anthropic lo dice, excluyendo explícitamente programar y depurar del caso multi-agente. La evidencia más cruda es suya: pusieron 16 agentes a construir un compilador y "chocaron con el mismo bug, lo arreglaron, y sobrescribieron los cambios de los demás".
Y sobre tu patrón Fable-dirige / Opus-ejecuta: existe, está medido, y Anthropic lo vende cableado. Separar "quien piensa" de "quien edita" mejora entre 3 y 10 puntos, y el récord se logró justamente cuando el ejecutor era el modelo más barato. Además hay un dato que valida SHERPA de forma directa: el rendimiento cae un 39% cuando la tarea se refina conversando, frente a un único briefing bien hecho. Cuando el modelo toma un mal giro en la conversación, se pierde y no se recupera. Tu instinto de empaquetar todo de una vez estaba bien fundado.
Lo que la auditoría destapó en casa
Mandé siete auditores a medir los siete canales, y luego siete refutadores distintos a intentar tumbar cada hallazgo con mediciones propias. De 54 hallazgos, 28 sobrevivieron intactos, 25 quedaron matizados y uno fue refutado. Los refutadores además encontraron 28 cosas que los auditores no vieron, varias peores.
El diagnóstico se resume en una frase: seis de siete sensores mentían, y todos por la misma razón — medían algo fácil (un conteo, una presencia) en vez del hecho que importaba (si alguien lo leyó, si sirvió). Tres ejemplos que duelen: