ember-memory-test/episodes/TRAZA_cierre-del-da-b-c-y-a-ejecutados_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 1ebcbfff2c feat(episode): TRAZA_cierre-del-da-b-c-y-a-ejecutados_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: design
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: 🏁 Cierre del día — B, C y A ejecutados
2026-07-20 05:24:09 +00:00

3.4 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
8b4e14f5-f4ed-4c88-8480-0cbff01d39b7 TRAZA_cierre-del-da-b-c-y-a-ejecutados_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260719.ORACULO_RETRIEVAL_X09 informar multi_actor low TESSERA operations design EPISODIO 1 — MNEMO_PRE_DIGEST: 🏁 Cierre del día — B, C y A ejecutados claude_code internal 2026-07-20T05:24:07.869892+00:00 false pending

Push 3deb68d9 ×3 remotos. B, C y A completados.

🏁 Cierre del día — B, C y A ejecutados

Actas: X_QEXPAND_FAIL_Y_CIERRE · ARCO §7 al día · cosecha LEXICON generada.

B — La dimensión-PREGUNTA también cayó (y el porqué vale oro)

Brazo (dev-set 92) recall@1 vs cruda Gate
Pregunta cruda (producción) 0.304 control
HyDE clásico 0.109 0.196 [0.293, 0.109] FAIL rotundo
Multi-query (3 paráfrasis) 0.272 0.033 (cruza 0) FAIL

El diagnóstico es la joya: el HyDE clásico escribe una respuesta plausible pero inventada, y ese vector apunta a "un episodio genérico de EMBER" en lugar del específico. La especulación diluye el ancla — el mismo fenómeno que ya habíamos medido en f2c. El SOTA reporta HyDE sobre Wikipedia y papers, donde una respuesta hipotética se parece a documentos reales; tu memoria es idiosincrática y auto-referente: nadie puede adivinar su vocabulario. Es una lección sobre por qué el SOTA no se copia, se mide.

Consecuencia clara: las dos dimensiones vírgenes (orden y pregunta) cayeron con herramientas baratas. El techo de la brecha sigue medido y disponible — pero exige infraestructura real (un cross-encoder local), no prompt-engineering. Eso es un mapa mucho más útil que una lista de ideas sin probar.

C — Cosméticos

Docstring corregido en vivo (decía default: False siendo True — un instrumento que mentía; backup + restart + servicio verificado) · 🟡 "43 tools": auth_guard.py está en directorio read-only por diseño; el fix exige un workaround privilegiado desproporcionado para un string que solo aparece en mi unlock por SSH — deuda documentada, no drift silencioso · 🟡 MEMORY.md 21.2→20.2 KB: el resto exige reestructurar (mover detalle a topic-files), no recortar frases, y hacerlo apurado arriesgaría tus ~30 líneas de feedback. Tarea con criterio propio.

A — El marcador final

16 hipótesis falsificadas con criterio pre-registrado · 5 ganadores desplegados y verificados (backfill, writer v1.1, search_facts, bi-temporalidad, wiring) · 1 garantía cableada (el gate ya no depende de que nadie recuerde) · 24 commits triple-remoto · producción intacta salvo lo gateado, con backup en cada paso.

Lo que hoy cambió de verdad: amanecimos creyendo que el retrieval era 0.49 (era mentira), lo medimos honestamente (0.06), lo arreglamos (0.149), y descubrimos con un examen justo que el sistema real vale 0.542 a la primera / 0.861 en top-10. Y cada cosa que no funcionó quedó escrita con su número, para que nadie la repita.

Descansa, John. El cron vigila el gate; tu cola te lo recordará al abrir. 🔥