Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Guardado (`6f278901`, 3/3 remotos).
2.9 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 136020a1-33d2-4965-9d2e-473568f5f6bf | TRAZA_guardado-6f278901-33-remotos_S20260712.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260712.PIPELINE_PG_HYDE_FIX | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 2 — MNEMO_PRE_DIGEST: Guardado (`6f278901`, 3/3 remotos). | claude_code | internal | 2026-07-12T20:21:27.384037+00:00 | false | pending |
Guardado (6f278901, 3/3 remotos).
El resumen de tu respuesta, en 3 puntos:
-
No es que Opus sea "poco listo" de primera — es que un LLM escribe de un solo trazo sin poder releerse; hasta el más brillante omite cosas escribiendo de corrido. La inteligencia mejora el trazo, no reemplaza la relectura.
-
El beneficio de una segunda pasada depende del HUECO, no de la inteligencia: en tareas fáciles Opus/Sonnet salen perfectos (medimos: cero beneficio); en tareas difíciles (tu trabajo real) sí tienen hueco y sí mejoran. Por eso lo que tú percibes y lo que medimos son ambos ciertos — solo que nuestras pruebas usaron tareas fáciles.
-
Tu intuición es correcta y es el hallazgo entero: no era el protocolo, era el mecanismo. Con dos precisiones que medimos: no es solo la segunda pasada, es varios intentos + una prueba objetiva que escoja el bueno; y ni siquiera es "el modelo arregla su error" (eso, el brazo-R, no ganó) — es "genera varios y quédate con el que pasa el test".
Guardado (214a0f5d, 3/3 remotos). Tu respuesta, apretada:
Tres puntos:
- "Pensando" sí existe y ayuda — pero sigue siendo un solo trazo, más largo. El modelo escribe su borrador ("A… no, mejor B") antes de responder, y se apoya en él. Se corrige escribiendo más, no borrando. No me contradice: lo refina.
- "Varios hilos en paralelo" es el matiz inexacto. Un stream de pensamiento es secuencial (explora A, luego B), no ramas paralelas comparándose. El paralelismo real —correr K veces y que algo escoja— es externo, y es justo el best-of-K que medimos.
- El enganche con todo el arco: "el modelo escoge internamente la mejor" = el modelo juzgándose a sí mismo, con el mismo punto ciego que causó el error. Por eso el lift fiable no vino de la auto-selección interna sino del corrector externo insobornable. Pensar (interno) y best-of-K+oráculo (externo) son ambos "más cómputo al responder" — pero solo el que tiene una prueba objetiva de por medio da mejora medible y confiable.
Y la honestidad de siempre: no me miro los pesos por dentro; describo cómo funcionan estos sistemas en general. Lo firme es que la generación es token-a-token, "pensar" es borrador-antes-de-responder, y la selección-paralela real es externa.