ember-memory-test/episodes/TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember aee256e573 feat(episode): TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: chronicle
Summary: EPISODIO 56 — BLINDADAS: La foto v1 vs v2
2026-07-06 05:00:09 +00:00

3 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
c177f677-9452-46f5-abac-136001a4ca49 TRAZA_la-foto-v1-vs-v2_S20260705.R56_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations chronicle EPISODIO 56 — BLINDADAS: La foto v1 vs v2 claude_code internal 2026-07-06T05:00:08.275041+00:00 false pending

Con gusto — te lo cuento claro, porque el "qué mejora" tiene un matiz honesto que quiero que quede nítido.

La foto v1 vs v2

Dimensión RELOJERO v1 RELOJERO v2
Verificación (3er pilar) Introspectiva: el modelo se auto-verifica ("hice 2.7M tests, verde") Externa insobornable: un oráculo compara contra referencia NO-modelo + bordes fijos que el modelo no elige
Cuándo se aplica A toda acción de coding, sermón completo siempre Escalonado: trivial → doble-pasada ligera / difícil → lente pesado
Quién decide Nadie — uniforme Decisor híbrido: señales duras fuerzan; Ember solo puede elevar, no bajar
Telemetría directives_injected:True = mostré el sermón (intención) Registra el tier + el oráculo exige evidencia cruda de máquina (resultado)
Fundamento Doctrina (nunca medida) Medido (AB-LAB + 4 peer-reviews + paper ETH)

Las 4 mejoras concretas que introduje

1. Verificación EXTERNA (la más importante — fija la falsa confianza). En v1, el modelo se declaraba "exhaustivo" y podía estar ciego a lo que no imaginó — exactamente el caso 4b: dijo "2.7M verde" y falló el 100% de inf/nan. En v2, external_oracle.py corre la solución contra format() (referencia que el modelo no escribió) sobre bordes fijos (0/inf/nan/vacío). El veredicto no lo emite el modelo. Probado: atrapa el inf/nan que v1 declaró exhaustivo.

2. Escalonado — se apaga por defecto (fija el bloat). v1 disparaba el sermón de 40 líneas a cada edit (1800 veces). El paper de ETH y nuestro AB-LAB probaron que esa ceremonia sobre tareas acotadas perjudica (>20% más costo). v2 solo carga el lente pesado cuando hace falta; lo trivial va con tu doble-pasada ligera.

3. El decisor híbrido (tu corazonada — quién decide). v1 no tenía decisor. v2 tiene decide_relojero: señales deterministas del contenido (numérico/machine-consumed/prod-secretos) fuerzan el lente; Ember puede elevar por complejidad percibida pero nunca puede exentarse de una señal dura. Eso cierra el punto ciego — el modelo no puede saltarse la verificación de un caso crítico para ahorrarse trabajo.

4. Telemetría de resultado + evidencia cruda. v1 registraba que mostró el recordatorio. v2 registra el tier decidido, y el oráculo exige el artefacto crudo (el input de divergencia, el stdout), no un resumen del modelo.

Lo honesto que NO debo ocultar