Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: El 3er intento **está completando** (la toleranci
3.8 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| d690873b-7e00-43f8-b36e-ba0b2fdc67c4 | TRAZA_el-3er-intento-est-completando-la-tolera_S20260712.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260712.SHERPA_MISION1_LOOPWRITE | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: El 3er intento **está completando** (la tolerancia por-parej | claude_code | internal | 2026-07-12T17:34:36.495357+00:00 | false | pending |
El 3er intento está completando (la tolerancia por-pareja funciona — se ve a claude-3-haiku saltando 1 pareja sin abortar). Pero hay un dato que NO me creo y lo marco antes de que me lo creas tú:
llama-8bA=1.00 ⚠️ — eso es imposible: es el modelo más débil, y en la curva firmada (N=21) su base fue 0.048. Un 8B no pasa 7/7 tareas en el primer draft. Conerr={timeout_or_crash:2, IndexError:2}de por medio, sospecho corrupción del dato de llama en este run, no una medición real. No emito veredicto de llama hasta investigarlo.qwen-7bR−D = −0.143 ✅ creíble — y es informativo: la reparación quedó PEOR que la selección (R<D, 1 discordante a favor de D). Eso apunta a "cosecha": reparar no supera a seleccionar.claude-3-haiku— todavía corriendo.
Lectura honesta: el punto creíble (qwen) ya inclina hacia cosecha; el punto sospechoso (llama A=1.00) lo trato como corrupto hasta verificarlo. Cuando termine, hago dos cosas: (1) auditar el llama A=1.00 con el oráculo directo (¿por qué pasó?), y (2) emitir el veredicto solo con los puntos que sobrevivan el escrutinio. Si llama es irrecuperable, el veredicto se apoya en qwen + claude-3-haiku, que ya es suficiente para "cosecha vs amplificación".
No hago polling — la notificación me trae con el run completo para el escrutinio final.
Paridad perfecta b7b3ccdd en los 3 remotos. El brazo-R está cerrado y con esto la última pregunta abierta del arco queda respondida.
🏁 Veredicto final del arco: COSECHA, no amplificación
El experimento que la auditoría Fable-5 marcó como decisivo —¿la reparación supera a la selección, o todo es cosecha de pass@K?— dio su respuesta, y es limpia:
| Modelo | A (base) | D (selección) | R (reparación) | R−D | Veredicto |
|---|---|---|---|---|---|
| qwen-7b | 0.857 | 0.857 | 0.714 | −0.143 | reparación PEOR |
| claude-3-haiku | 0.833 | 1.00 | 1.00 | 0.000 | reparación = selección |
| llama-8b | 1.00* | 1.00* | 1.00* | 0.000 | ruido N=7 (auditado) |
En ningún modelo R > D. La condición pre-registrada de "amplificación" no se cumple en ninguno — y en qwen la reparación incluso empeoró (reescribir tras el contraejemplo degradó una solución que best-of-K ya tenía). El experimento diseñado para rehabilitar la palabra "amplificador" la enterró. "Cosechador de pass@K" es definitivo.
Lo que me deja tranquilo del método: no me tragué el dato incoherente. El A=1.00 de llama contradecía el firmado (0.048), así que lo audité con el oráculo directo antes de usarlo — resultó ser varianza de N=7, no bug (safe_judge y el oráculo directo coincidieron en que spell_int falla). Y el veredicto es robusto igual: aun a valor facial, A=D=R para llama → R no supera D.
El arco completo, en una frase honesta: los protocolos no ganan su costo sobre modelos fuertes saturados; sobre modelos débiles son un cosechador barato y fiable (seleccionar la mejor de K muestras contra un oráculo, acotado por el techo del modelo) — no un elevador de techo vía reparación. Números intactos, palabras exactas, cada afirmación auditada.