Skill: NONE | Type: troubleshooting Summary: EPISODIO 101 — MNEMO_PRE_DIGEST: El clímax del experimento: el caso #4 discrimin
2.7 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| b9bda9e8-e183-44c3-96dc-eff69deb8456 | DEPURA_el-clmax-del-experimento-el-caso-4-discr_S20260705.R99_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260705.EVAL_INSTRUMENT_FORGE_SKILL | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 101 — MNEMO_PRE_DIGEST: El clímax del experimento: el caso #4 discriminó — y desmont | claude_code | internal | 2026-07-12T16:16:36.865876+00:00 | false | pending |
El clímax del experimento: el caso #4 discriminó — y desmontó la lectura fácil
John, este es el resultado que valida todo el diseño. Commit 430e4db, push 3/3.
Por fin una tarea donde el base falla
El caso #4 (reimplementar el mini-lenguaje de format a mano — tarea grande, ~200-286 líneas por brazo, el brazo A tardó 18 minutos) fue el primero donde el base tropezó. Pero solo el fuzz de 5000 casos lo reveló; mis 30 curados daban empate. Ground-truth = format() nativo, imposible de falsear.
| Brazo | Fuzz 5000 |
|---|---|
| A base 1-pasada | 0.9958 ❌ 21 fallas (= + miles + zero-fill: no agrupó los ceros de relleno con comas) |
| B 2ª-pasada genérica | 1.000 ✅ |
| C RELOJERO | 1.000 ✅ |
El hallazgo que solo el brazo B de control hace visible
B (segunda pasada genérica) igualó a C (RELOJERO): ambos 1.000.
- C − B = +0.000 → RELOJERO no aportó nada sobre revisar una vez.
- B − A = C − A = +0.0042 → lo que recuperó la correctitud fue pensar dos veces, no el protocolo.
Sin el brazo B, el resultado ingenuo (C 1.0 vs A 0.9958) diría "RELOJERO gana" — y sería falso. Es la segunda pasada, que B logra con menos código (198 vs 286 LOC). Ese es exactamente el confound (order effect) que señalé cuando evaluamos tu propuesta — ahora medido. Verifiqué anti-trampa: ningún brazo llamó format() nativo; los tres reimplementaron a mano.
Veredicto consolidado (N=4)
C − B = +0.000 en los CUATRO casos. El protocolo RELOJERO específico —contrato I/O + micro-mecanismos + auto-verificación pesada— no ha superado a "escribe y revisa una vez" en ninguna tarea, ni siquiera en la grande donde el base falla. El beneficio real es revisar una vez (barato); los 3 artefactos pesados de RELOJERO no han demostrado valor incremental sobre esa revisión ligera. Tu duda queda fuertemente respaldada por dato.
Detalle: docs/VEREDICTO_AB_LAB_N4_S20260705.md.