feat(episode): TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: chronicle Summary: EPISODIO 56 — BLINDADAS: La foto v1 vs v2
This commit is contained in:
parent
09446a0054
commit
aee256e573
1 changed files with 41 additions and 0 deletions
|
|
@ -0,0 +1,41 @@
|
|||
---
|
||||
episode_id: "c177f677-9452-46f5-abac-136001a4ca49"
|
||||
puente_flat: "TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||
session_code: "S20260705.EVAL_INSTRUMENT_FORGE_SKILL"
|
||||
acto_dialogico: "informar"
|
||||
actor_flujo: "multi_actor"
|
||||
criticidad_aegis: "low"
|
||||
skill_dominante: "NONE"
|
||||
fase_proyecto: "operations"
|
||||
tipo_semantico: "chronicle"
|
||||
summary_one_line: "EPISODIO 56 — BLINDADAS: La foto v1 vs v2"
|
||||
source_type: "claude_code"
|
||||
trust_boundary: "internal"
|
||||
created_at: "2026-07-06T05:00:08.275041+00:00"
|
||||
relectura_tagged: false
|
||||
forgejo_commit_sha: "pending"
|
||||
---
|
||||
|
||||
Con gusto — te lo cuento claro, porque el "qué mejora" tiene un matiz honesto que quiero que quede nítido.
|
||||
|
||||
## La foto v1 vs v2
|
||||
|
||||
| Dimensión | RELOJERO v1 | RELOJERO v2 |
|
||||
|---|---|---|
|
||||
| **Verificación (3er pilar)** | Introspectiva: *el modelo se auto-verifica* ("hice 2.7M tests, verde") | **Externa insobornable**: un oráculo compara contra referencia NO-modelo + bordes fijos que el modelo no elige |
|
||||
| **Cuándo se aplica** | A **toda** acción de coding, sermón completo siempre | **Escalonado**: trivial → doble-pasada ligera / difícil → lente pesado |
|
||||
| **Quién decide** | Nadie — uniforme | **Decisor híbrido**: señales duras fuerzan; Ember solo puede *elevar*, no bajar |
|
||||
| **Telemetría** | `directives_injected:True` = *mostré el sermón* (intención) | Registra el **tier** + el oráculo exige **evidencia cruda** de máquina (resultado) |
|
||||
| **Fundamento** | Doctrina (nunca medida) | **Medido** (AB-LAB + 4 peer-reviews + paper ETH) |
|
||||
|
||||
## Las 4 mejoras concretas que introduje
|
||||
|
||||
**1. Verificación EXTERNA (la más importante — fija la falsa confianza).** En v1, el modelo se declaraba "exhaustivo" y podía estar ciego a lo que no imaginó — *exactamente el caso 4b*: dijo "2.7M verde" y falló el 100% de inf/nan. En v2, `external_oracle.py` corre la solución contra `format()` (referencia que el modelo no escribió) sobre bordes fijos (0/inf/nan/vacío). **El veredicto no lo emite el modelo.** Probado: atrapa el inf/nan que v1 declaró exhaustivo.
|
||||
|
||||
**2. Escalonado — se apaga por defecto (fija el bloat).** v1 disparaba el sermón de 40 líneas a *cada* edit (1800 veces). El paper de ETH y nuestro AB-LAB probaron que esa ceremonia sobre tareas acotadas *perjudica* (>20% más costo). v2 solo carga el lente pesado cuando hace falta; lo trivial va con tu doble-pasada ligera.
|
||||
|
||||
**3. El decisor híbrido (tu corazonada — quién decide).** v1 no tenía decisor. v2 tiene `decide_relojero`: señales deterministas del contenido (numérico/machine-consumed/prod-secretos) **fuerzan** el lente; Ember puede *elevar* por complejidad percibida pero **nunca puede exentarse** de una señal dura. Eso cierra el punto ciego — el modelo no puede saltarse la verificación de un caso crítico para ahorrarse trabajo.
|
||||
|
||||
**4. Telemetría de resultado + evidencia cruda.** v1 registraba que *mostró* el recordatorio. v2 registra el tier decidido, y el oráculo exige el artefacto crudo (el input de divergencia, el stdout), no un resumen del modelo.
|
||||
|
||||
## Lo honesto que NO debo ocultar
|
||||
Loading…
Reference in a new issue