Skill: NONE | Type: troubleshooting
Summary: EPISODIO 3 — MNEMO Pipeline: 📖 Prólogo — la decisión recalibrada
3.1 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 29741d3c-ffe4-494d-ad06-1fc59f4c40a0 | DEPURA_prlogo-la-decisin-recalibrada_S20260618.R3_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260618.VERIFY_FIRST_PASSPORT_FIX | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 3 — MNEMO Pipeline: 📖 Prólogo — la decisión recalibrada | claude_code | internal | 2026-06-18T14:44:35.878171+00:00 | false | pending |
⚠️ Para — esto cambia todo. La verificación de contenido (el paso que tu "archivado previo" implica hacer ANTES de borrar) acaba de refutar la premisa. Los "4-5 near-dups" NO son duplicados limpios. Medí la similitud real de contenido de cada par:
| Grupo | sim | longitudes | Qué es realmente | Veredicto |
|---|---|---|---|---|
| 1 | 0.647 | 1303 vs 2471 | Contenido distinto (colisión de prefijo, temas diferentes) | 🟢 CONSERVAR ambos |
| 3 | 0.769 | 1619 vs 3038 | Re-emisión que casi duplicó su tamaño (evolucionó mucho) | 🟢 CONSERVAR ambos |
| 2 | 0.882 | 1712 vs 1522 | Re-emisión con ~12% de delta | 🟡 borderline |
| 5 | 0.856 | 2311 vs 1748 | Re-emisión con ~15% de delta | 🟡 borderline |
| 4 | 0.958 | 2187 vs 2002 | Casi idénticos (re-emisión real) | 🔴 borrar el redundante |
Solo 1 de los 5 es un duplicado limpio (grupo 4, 0.958). Dos son falsos positivos (grupos 1 y 3: contenido genuinamente distinto que comparte las primeras 200 letras). Dos son re-emisiones que evolucionaron (2 y 5: mismo tema, pero 12-15% de contenido nuevo en la segunda).
Si hubiera borrado "los 4" a ciegas, habría destruido contenido único — exactamente el daño irreversible que el paso de verificación existe para atrapar. Por eso no lo auto-ejecuté.
📖 Prólogo — la decisión recalibrada
Reframe. Ya no es "¿borro los 4 dups?". Es: dado que solo 1 es duplicado real, ¿qué tan agresivo quieres el dedup? — solo lo casi-idéntico, o también las re-emisiones que se solapan ~85%.
Historia. Mi detección original (prefijo-200 + sesión) contó 5 grupos. Pero el prefijo-200 solo mira la apertura; al medir el cuerpo completo con similarity(), 4 de 5 resultan ser contenido distinto o evolucionado. El dato granular mató el diagnóstico grueso.
Consecuencias. Borrar grupo 4 → seguro, recupera pulcritud real. Borrar 2/5 → ganas pulcritud pero pierdes el ~12-15% de delta de la segunda versión (que a veces es una refinación tuya/mía). Borrar 1/3 → destruyes memorias distintas (NO).
Implicación seria sobre Capa 1 (el guard que desplegué): usa el MISMO criterio prefijo-200 → es demasiado agresivo, haría false-skip de re-emisiones evolucionadas como grupos 1 y 3. Hay que refinarlo (añadir un gate de similitud: skip solo si el cuerpo completo es >0.95 similar, no solo el prefijo) o revertirlo hasta refinar. Es importante porque está vivo.