ember-memory-test/episodes/TRAZA_el-3er-intento-est-completando-la-tolera_S20260712.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 6487404710 feat(episode): TRAZA_el-3er-intento-est-completando-la-tolera_S20260712.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: El 3er intento **está completando** (la toleranci
2026-07-12 17:34:37 +00:00

3.8 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
d690873b-7e00-43f8-b36e-ba0b2fdc67c4 TRAZA_el-3er-intento-est-completando-la-tolera_S20260712.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260712.SHERPA_MISION1_LOOPWRITE informar multi_actor low NONE operations troubleshooting EPISODIO 1 — MNEMO_PRE_DIGEST: El 3er intento **está completando** (la tolerancia por-parej claude_code internal 2026-07-12T17:34:36.495357+00:00 false pending

El 3er intento está completando (la tolerancia por-pareja funciona — se ve a claude-3-haiku saltando 1 pareja sin abortar). Pero hay un dato que NO me creo y lo marco antes de que me lo creas tú:

  • llama-8b A=1.00 ⚠️ — eso es imposible: es el modelo más débil, y en la curva firmada (N=21) su base fue 0.048. Un 8B no pasa 7/7 tareas en el primer draft. Con err={timeout_or_crash:2, IndexError:2} de por medio, sospecho corrupción del dato de llama en este run, no una medición real. No emito veredicto de llama hasta investigarlo.
  • qwen-7b R−D = −0.143 ✅ creíble — y es informativo: la reparación quedó PEOR que la selección (R<D, 1 discordante a favor de D). Eso apunta a "cosecha": reparar no supera a seleccionar.
  • claude-3-haiku — todavía corriendo.

Lectura honesta: el punto creíble (qwen) ya inclina hacia cosecha; el punto sospechoso (llama A=1.00) lo trato como corrupto hasta verificarlo. Cuando termine, hago dos cosas: (1) auditar el llama A=1.00 con el oráculo directo (¿por qué pasó?), y (2) emitir el veredicto solo con los puntos que sobrevivan el escrutinio. Si llama es irrecuperable, el veredicto se apoya en qwen + claude-3-haiku, que ya es suficiente para "cosecha vs amplificación".

No hago polling — la notificación me trae con el run completo para el escrutinio final.

Paridad perfecta b7b3ccdd en los 3 remotos. El brazo-R está cerrado y con esto la última pregunta abierta del arco queda respondida.

🏁 Veredicto final del arco: COSECHA, no amplificación

El experimento que la auditoría Fable-5 marcó como decisivo —¿la reparación supera a la selección, o todo es cosecha de pass@K?— dio su respuesta, y es limpia:

Modelo A (base) D (selección) R (reparación) R−D Veredicto
qwen-7b 0.857 0.857 0.714 −0.143 reparación PEOR
claude-3-haiku 0.833 1.00 1.00 0.000 reparación = selección
llama-8b 1.00* 1.00* 1.00* 0.000 ruido N=7 (auditado)

En ningún modelo R > D. La condición pre-registrada de "amplificación" no se cumple en ninguno — y en qwen la reparación incluso empeoró (reescribir tras el contraejemplo degradó una solución que best-of-K ya tenía). El experimento diseñado para rehabilitar la palabra "amplificador" la enterró. "Cosechador de pass@K" es definitivo.

Lo que me deja tranquilo del método: no me tragué el dato incoherente. El A=1.00 de llama contradecía el firmado (0.048), así que lo audité con el oráculo directo antes de usarlo — resultó ser varianza de N=7, no bug (safe_judge y el oráculo directo coincidieron en que spell_int falla). Y el veredicto es robusto igual: aun a valor facial, A=D=R para llama → R no supera D.

El arco completo, en una frase honesta: los protocolos no ganan su costo sobre modelos fuertes saturados; sobre modelos débiles son un cosechador barato y fiable (seleccionar la mejor de K muestras contra un oráculo, acotado por el techo del modelo) — no un elevador de techo vía reparación. Números intactos, palabras exactas, cada afirmación auditada.