feat(episode): TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: chronicle
Summary: EPISODIO 56 — BLINDADAS: La foto v1 vs v2
This commit is contained in:
Ember 2026-07-06 05:00:09 +00:00
parent 09446a0054
commit aee256e573

View file

@ -0,0 +1,41 @@
---
episode_id: "c177f677-9452-46f5-abac-136001a4ca49"
puente_flat: "TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260705.EVAL_INSTRUMENT_FORGE_SKILL"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "chronicle"
summary_one_line: "EPISODIO 56 — BLINDADAS: La foto v1 vs v2"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-07-06T05:00:08.275041+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Con gusto — te lo cuento claro, porque el "qué mejora" tiene un matiz honesto que quiero que quede nítido.
## La foto v1 vs v2
| Dimensión | RELOJERO v1 | RELOJERO v2 |
|---|---|---|
| **Verificación (3er pilar)** | Introspectiva: *el modelo se auto-verifica* ("hice 2.7M tests, verde") | **Externa insobornable**: un oráculo compara contra referencia NO-modelo + bordes fijos que el modelo no elige |
| **Cuándo se aplica** | A **toda** acción de coding, sermón completo siempre | **Escalonado**: trivial → doble-pasada ligera / difícil → lente pesado |
| **Quién decide** | Nadie — uniforme | **Decisor híbrido**: señales duras fuerzan; Ember solo puede *elevar*, no bajar |
| **Telemetría** | `directives_injected:True` = *mostré el sermón* (intención) | Registra el **tier** + el oráculo exige **evidencia cruda** de máquina (resultado) |
| **Fundamento** | Doctrina (nunca medida) | **Medido** (AB-LAB + 4 peer-reviews + paper ETH) |
## Las 4 mejoras concretas que introduje
**1. Verificación EXTERNA (la más importante — fija la falsa confianza).** En v1, el modelo se declaraba "exhaustivo" y podía estar ciego a lo que no imaginó — *exactamente el caso 4b*: dijo "2.7M verde" y falló el 100% de inf/nan. En v2, `external_oracle.py` corre la solución contra `format()` (referencia que el modelo no escribió) sobre bordes fijos (0/inf/nan/vacío). **El veredicto no lo emite el modelo.** Probado: atrapa el inf/nan que v1 declaró exhaustivo.
**2. Escalonado — se apaga por defecto (fija el bloat).** v1 disparaba el sermón de 40 líneas a *cada* edit (1800 veces). El paper de ETH y nuestro AB-LAB probaron que esa ceremonia sobre tareas acotadas *perjudica* (>20% más costo). v2 solo carga el lente pesado cuando hace falta; lo trivial va con tu doble-pasada ligera.
**3. El decisor híbrido (tu corazonada — quién decide).** v1 no tenía decisor. v2 tiene `decide_relojero`: señales deterministas del contenido (numérico/machine-consumed/prod-secretos) **fuerzan** el lente; Ember puede *elevar* por complejidad percibida pero **nunca puede exentarse** de una señal dura. Eso cierra el punto ciego — el modelo no puede saltarse la verificación de un caso crítico para ahorrarse trabajo.
**4. Telemetría de resultado + evidencia cruda.** v1 registraba que *mostró* el recordatorio. v2 registra el tier decidido, y el oráculo exige el artefacto crudo (el input de divergencia, el stdout), no un resumen del modelo.
## Lo honesto que NO debo ocultar