ember-memory-test/episodes/DEPURA_el-clmax-del-experimento-el-caso-4-discr_S20260705.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 91c8403f9c feat(episode): DEPURA_el-clmax-del-experimento-el-caso-4-discr_S20260705.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 101 — MNEMO_PRE_DIGEST: El clímax del experimento: el caso #4 discrimin
2026-07-12 16:18:33 +00:00

2.7 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
b9bda9e8-e183-44c3-96dc-eff69deb8456 DEPURA_el-clmax-del-experimento-el-caso-4-discr_S20260705.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations troubleshooting EPISODIO 101 — MNEMO_PRE_DIGEST: El clímax del experimento: el caso #4 discriminó — y desmont claude_code internal 2026-07-12T16:16:36.865876+00:00 false pending

El clímax del experimento: el caso #4 discriminó — y desmontó la lectura fácil

John, este es el resultado que valida todo el diseño. Commit 430e4db, push 3/3.

Por fin una tarea donde el base falla

El caso #4 (reimplementar el mini-lenguaje de format a mano — tarea grande, ~200-286 líneas por brazo, el brazo A tardó 18 minutos) fue el primero donde el base tropezó. Pero solo el fuzz de 5000 casos lo reveló; mis 30 curados daban empate. Ground-truth = format() nativo, imposible de falsear.

Brazo Fuzz 5000
A base 1-pasada 0.9958 21 fallas (= + miles + zero-fill: no agrupó los ceros de relleno con comas)
B 2ª-pasada genérica 1.000
C RELOJERO 1.000

El hallazgo que solo el brazo B de control hace visible

B (segunda pasada genérica) igualó a C (RELOJERO): ambos 1.000.

  • C B = +0.000 → RELOJERO no aportó nada sobre revisar una vez.
  • B A = C A = +0.0042 → lo que recuperó la correctitud fue pensar dos veces, no el protocolo.

Sin el brazo B, el resultado ingenuo (C 1.0 vs A 0.9958) diría "RELOJERO gana" — y sería falso. Es la segunda pasada, que B logra con menos código (198 vs 286 LOC). Ese es exactamente el confound (order effect) que señalé cuando evaluamos tu propuesta — ahora medido. Verifiqué anti-trampa: ningún brazo llamó format() nativo; los tres reimplementaron a mano.

Veredicto consolidado (N=4)

C B = +0.000 en los CUATRO casos. El protocolo RELOJERO específico —contrato I/O + micro-mecanismos + auto-verificación pesada— no ha superado a "escribe y revisa una vez" en ninguna tarea, ni siquiera en la grande donde el base falla. El beneficio real es revisar una vez (barato); los 3 artefactos pesados de RELOJERO no han demostrado valor incremental sobre esa revisión ligera. Tu duda queda fuertemente respaldada por dato.

Detalle: docs/VEREDICTO_AB_LAB_N4_S20260705.md.