feat(episode): DEPURA_prlogo-la-decisin-recalibrada_S20260618.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 3 — MNEMO Pipeline: 📖 Prólogo — la decisión recalibrada
This commit is contained in:
Ember 2026-06-18 16:50:35 +00:00
parent 64021c6fb8
commit c98f2ecbb8

View file

@ -0,0 +1,41 @@
---
episode_id: "29741d3c-ffe4-494d-ad06-1fc59f4c40a0"
puente_flat: "DEPURA_prlogo-la-decisin-recalibrada_S20260618.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260618.VERIFY_FIRST_PASSPORT_FIX"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 3 — MNEMO Pipeline: 📖 Prólogo — la decisión recalibrada"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-06-18T14:44:35.878171+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
⚠️ **Para — esto cambia todo.** La verificación de contenido (el paso que tu "archivado previo" implica hacer ANTES de borrar) acaba de **refutar la premisa**. Los "4-5 near-dups" NO son duplicados limpios. Medí la similitud real de contenido de cada par:
| Grupo | sim | longitudes | Qué es realmente | Veredicto |
|---|---|---|---|---|
| 1 | **0.647** | 1303 vs 2471 | Contenido **distinto** (colisión de prefijo, temas diferentes) | 🟢 **CONSERVAR ambos** |
| 3 | **0.769** | 1619 vs 3038 | Re-emisión que **casi duplicó su tamaño** (evolucionó mucho) | 🟢 **CONSERVAR ambos** |
| 2 | **0.882** | 1712 vs 1522 | Re-emisión con ~12% de delta | 🟡 borderline |
| 5 | **0.856** | 2311 vs 1748 | Re-emisión con ~15% de delta | 🟡 borderline |
| 4 | **0.958** | 2187 vs 2002 | **Casi idénticos** (re-emisión real) | 🔴 **borrar el redundante** |
**Solo 1 de los 5 es un duplicado limpio** (grupo 4, 0.958). Dos son **falsos positivos** (grupos 1 y 3: contenido genuinamente distinto que comparte las primeras 200 letras). Dos son **re-emisiones que evolucionaron** (2 y 5: mismo tema, pero 12-15% de contenido nuevo en la segunda).
Si hubiera borrado "los 4" a ciegas, **habría destruido contenido único** — exactamente el daño irreversible que el paso de verificación existe para atrapar. Por eso no lo auto-ejecuté.
### 📖 Prólogo — la decisión recalibrada
**Reframe.** Ya no es "¿borro los 4 dups?". Es: **dado que solo 1 es duplicado real, ¿qué tan agresivo quieres el dedup?** — solo lo casi-idéntico, o también las re-emisiones que se solapan ~85%.
**Historia.** Mi detección original (prefijo-200 + sesión) contó 5 grupos. Pero el prefijo-200 solo mira la *apertura*; al medir el *cuerpo completo* con `similarity()`, 4 de 5 resultan ser contenido distinto o evolucionado. El dato granular mató el diagnóstico grueso.
**Consecuencias.** Borrar grupo 4 → seguro, recupera pulcritud real. Borrar 2/5 → ganas pulcritud pero pierdes el ~12-15% de delta de la segunda versión (que a veces es una refinación tuya/mía). Borrar 1/3 → destruyes memorias distintas (NO).
**Implicación seria sobre Capa 1 (el guard que desplegué):** usa el MISMO criterio prefijo-200 → **es demasiado agresivo**, haría false-skip de re-emisiones evolucionadas como grupos 1 y 3. Hay que **refinarlo** (añadir un gate de similitud: skip solo si el cuerpo completo es >0.95 similar, no solo el prefijo) o revertirlo hasta refinar. Es importante porque está vivo.