feat(episode): TRAZA_lo-que-pediste-y-lo-que-encontr_S20260731.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: design
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Lo que pediste, y lo que encontré
This commit is contained in:
Ember 2026-08-01 01:56:25 +00:00
parent 2abf3e19b6
commit c1f3d06620

View file

@ -0,0 +1,37 @@
---
episode_id: "c4912c90-026a-4fa2-bdf7-8a68dd455909"
puente_flat: "TRAZA_lo-que-pediste-y-lo-que-encontr_S20260731.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260731.ZERO_DEUDA_CIERRE_TOTAL"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "design"
summary_one_line: "EPISODIO 2 — MNEMO_PRE_DIGEST: Lo que pediste, y lo que encontré"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-01T01:56:10.418959+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Todo cerrado y verificado. Te resumo la jornada.
## Lo que pediste, y lo que encontré
Sí, fuiste claro, y la respuesta corta a tu pregunta central es alentadora: **el ecosistema que construiste ya usa la arquitectura correcta**. Lo que falla es más pequeño y más arreglable de lo que parecía.
**El hallazgo que ordena todo lo demás** es un criterio que ninguna de las fuentes nombra como titular, pero en el que convergen cuatro de ellas de forma independiente:
> **El trabajo de lectura se paraleliza; el de escritura no.**
Eso disuelve una polémica pública que parecía irreconciliable. Anthropic publicó que su enjambre de agentes supera al mejor agente único en un 90%; Cognition publicó un ensayo titulado *"no construyas multi-agentes"*. No se contradicen: describen los dos lados del mismo eje. Cuando cada agente lee una faceta distinta, el enjambre gana. Cuando varios escriben sobre el mismo estado compartido, se pisan — y la propia Anthropic lo dice, excluyendo explícitamente programar y depurar del caso multi-agente. La evidencia más cruda es suya: pusieron 16 agentes a construir un compilador y *"chocaron con el mismo bug, lo arreglaron, y sobrescribieron los cambios de los demás"*.
**Y sobre tu patrón Fable-dirige / Opus-ejecuta:** existe, está medido, y Anthropic lo vende cableado. Separar "quien piensa" de "quien edita" mejora entre 3 y 10 puntos, y el récord se logró justamente cuando el ejecutor era el modelo más barato. Además hay un dato que valida SHERPA de forma directa: el rendimiento cae un **39%** cuando la tarea se refina conversando, frente a un único briefing bien hecho. *Cuando el modelo toma un mal giro en la conversación, se pierde y no se recupera.* Tu instinto de empaquetar todo de una vez estaba bien fundado.
## Lo que la auditoría destapó en casa
Mandé siete auditores a medir los siete canales, y luego siete refutadores distintos a intentar **tumbar** cada hallazgo con mediciones propias. De 54 hallazgos, 28 sobrevivieron intactos, 25 quedaron matizados y uno fue refutado. Los refutadores además encontraron 28 cosas que los auditores no vieron, varias peores.
El diagnóstico se resume en una frase: **seis de siete sensores mentían**, y todos por la misma razón — medían algo fácil (un conteo, una presencia) en vez del hecho que importaba (si alguien lo leyó, si sirvió). Tres ejemplos que duelen: