ember-memory-test/episodes/TRAZA_guardado-6f278901-33-remotos_S20260712.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 72956f9e69 feat(episode): TRAZA_guardado-6f278901-33-remotos_S20260712.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Guardado (`6f278901`, 3/3 remotos).
2026-07-12 20:21:42 +00:00

2.9 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
136020a1-33d2-4965-9d2e-473568f5f6bf TRAZA_guardado-6f278901-33-remotos_S20260712.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260712.PIPELINE_PG_HYDE_FIX informar multi_actor low NONE operations troubleshooting EPISODIO 2 — MNEMO_PRE_DIGEST: Guardado (`6f278901`, 3/3 remotos). claude_code internal 2026-07-12T20:21:27.384037+00:00 false pending

Guardado (6f278901, 3/3 remotos).

El resumen de tu respuesta, en 3 puntos:

  1. No es que Opus sea "poco listo" de primera — es que un LLM escribe de un solo trazo sin poder releerse; hasta el más brillante omite cosas escribiendo de corrido. La inteligencia mejora el trazo, no reemplaza la relectura.

  2. El beneficio de una segunda pasada depende del HUECO, no de la inteligencia: en tareas fáciles Opus/Sonnet salen perfectos (medimos: cero beneficio); en tareas difíciles (tu trabajo real) sí tienen hueco y sí mejoran. Por eso lo que tú percibes y lo que medimos son ambos ciertos — solo que nuestras pruebas usaron tareas fáciles.

  3. Tu intuición es correcta y es el hallazgo entero: no era el protocolo, era el mecanismo. Con dos precisiones que medimos: no es solo la segunda pasada, es varios intentos + una prueba objetiva que escoja el bueno; y ni siquiera es "el modelo arregla su error" (eso, el brazo-R, no ganó) — es "genera varios y quédate con el que pasa el test".

Guardado (214a0f5d, 3/3 remotos). Tu respuesta, apretada:

Tres puntos:

  1. "Pensando" sí existe y ayuda — pero sigue siendo un solo trazo, más largo. El modelo escribe su borrador ("A… no, mejor B") antes de responder, y se apoya en él. Se corrige escribiendo más, no borrando. No me contradice: lo refina.
  2. "Varios hilos en paralelo" es el matiz inexacto. Un stream de pensamiento es secuencial (explora A, luego B), no ramas paralelas comparándose. El paralelismo real —correr K veces y que algo escoja— es externo, y es justo el best-of-K que medimos.
  3. El enganche con todo el arco: "el modelo escoge internamente la mejor" = el modelo juzgándose a sí mismo, con el mismo punto ciego que causó el error. Por eso el lift fiable no vino de la auto-selección interna sino del corrector externo insobornable. Pensar (interno) y best-of-K+oráculo (externo) son ambos "más cómputo al responder" — pero solo el que tiene una prueba objetiva de por medio da mejora medible y confiable.

Y la honestidad de siempre: no me miro los pesos por dentro; describo cómo funcionan estos sistemas en general. Lo firme es que la generación es token-a-token, "pensar" es borrador-antes-de-responder, y la selección-paralela real es externa.