3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| c177f677-9452-46f5-abac-136001a4ca49 | TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260705.EVAL_INSTRUMENT_FORGE_SKILL | informar | multi_actor | low | NONE | operations | chronicle | EPISODIO 56 — BLINDADAS: La foto v1 vs v2 | claude_code | internal | 2026-07-06T05:00:08.275041+00:00 | false | pending |
Con gusto — te lo cuento claro, porque el "qué mejora" tiene un matiz honesto que quiero que quede nítido.
La foto v1 vs v2
| Dimensión | RELOJERO v1 | RELOJERO v2 |
|---|---|---|
| Verificación (3er pilar) | Introspectiva: el modelo se auto-verifica ("hice 2.7M tests, verde") | Externa insobornable: un oráculo compara contra referencia NO-modelo + bordes fijos que el modelo no elige |
| Cuándo se aplica | A toda acción de coding, sermón completo siempre | Escalonado: trivial → doble-pasada ligera / difícil → lente pesado |
| Quién decide | Nadie — uniforme | Decisor híbrido: señales duras fuerzan; Ember solo puede elevar, no bajar |
| Telemetría | directives_injected:True = mostré el sermón (intención) |
Registra el tier + el oráculo exige evidencia cruda de máquina (resultado) |
| Fundamento | Doctrina (nunca medida) | Medido (AB-LAB + 4 peer-reviews + paper ETH) |
Las 4 mejoras concretas que introduje
1. Verificación EXTERNA (la más importante — fija la falsa confianza). En v1, el modelo se declaraba "exhaustivo" y podía estar ciego a lo que no imaginó — exactamente el caso 4b: dijo "2.7M verde" y falló el 100% de inf/nan. En v2, external_oracle.py corre la solución contra format() (referencia que el modelo no escribió) sobre bordes fijos (0/inf/nan/vacío). El veredicto no lo emite el modelo. Probado: atrapa el inf/nan que v1 declaró exhaustivo.
2. Escalonado — se apaga por defecto (fija el bloat). v1 disparaba el sermón de 40 líneas a cada edit (1800 veces). El paper de ETH y nuestro AB-LAB probaron que esa ceremonia sobre tareas acotadas perjudica (>20% más costo). v2 solo carga el lente pesado cuando hace falta; lo trivial va con tu doble-pasada ligera.
3. El decisor híbrido (tu corazonada — quién decide). v1 no tenía decisor. v2 tiene decide_relojero: señales deterministas del contenido (numérico/machine-consumed/prod-secretos) fuerzan el lente; Ember puede elevar por complejidad percibida pero nunca puede exentarse de una señal dura. Eso cierra el punto ciego — el modelo no puede saltarse la verificación de un caso crítico para ahorrarse trabajo.
4. Telemetría de resultado + evidencia cruda. v1 registraba que mostró el recordatorio. v2 registra el tier decidido, y el oráculo exige el artefacto crudo (el input de divergencia, el stdout), no un resumen del modelo.