Skill: TESSERA | Type: design
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: 🏁 Cierre del día — B, C y A ejecutados
3.4 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 8b4e14f5-f4ed-4c88-8480-0cbff01d39b7 | TRAZA_cierre-del-da-b-c-y-a-ejecutados_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260719.ORACULO_RETRIEVAL_X09 | informar | multi_actor | low | TESSERA | operations | design | EPISODIO 1 — MNEMO_PRE_DIGEST: 🏁 Cierre del día — B, C y A ejecutados | claude_code | internal | 2026-07-20T05:24:07.869892+00:00 | false | pending |
Push 3deb68d9 ×3 remotos. B, C y A completados.
🏁 Cierre del día — B, C y A ejecutados
Actas: X_QEXPAND_FAIL_Y_CIERRE · ARCO §7 al día · cosecha LEXICON generada.
B — La dimensión-PREGUNTA también cayó (y el porqué vale oro)
| Brazo (dev-set 92) | recall@1 | vs cruda | Gate |
|---|---|---|---|
| Pregunta cruda (producción) | 0.304 | — | control |
| HyDE clásico | 0.109 | −0.196 [−0.293, −0.109] | ❌ FAIL rotundo |
| Multi-query (3 paráfrasis) | 0.272 | −0.033 (cruza 0) | ❌ FAIL |
El diagnóstico es la joya: el HyDE clásico escribe una respuesta plausible pero inventada, y ese vector apunta a "un episodio genérico de EMBER" en lugar del específico. La especulación diluye el ancla — el mismo fenómeno que ya habíamos medido en f2c. El SOTA reporta HyDE sobre Wikipedia y papers, donde una respuesta hipotética se parece a documentos reales; tu memoria es idiosincrática y auto-referente: nadie puede adivinar su vocabulario. Es una lección sobre por qué el SOTA no se copia, se mide.
Consecuencia clara: las dos dimensiones vírgenes (orden y pregunta) cayeron con herramientas baratas. El techo de la brecha sigue medido y disponible — pero exige infraestructura real (un cross-encoder local), no prompt-engineering. Eso es un mapa mucho más útil que una lista de ideas sin probar.
C — Cosméticos
✅ Docstring corregido en vivo (decía default: False siendo True — un instrumento que mentía; backup + restart + servicio verificado) · 🟡 "43 tools": auth_guard.py está en directorio read-only por diseño; el fix exige un workaround privilegiado desproporcionado para un string que solo aparece en mi unlock por SSH — deuda documentada, no drift silencioso · 🟡 MEMORY.md 21.2→20.2 KB: el resto exige reestructurar (mover detalle a topic-files), no recortar frases, y hacerlo apurado arriesgaría tus ~30 líneas de feedback. Tarea con criterio propio.
A — El marcador final
16 hipótesis falsificadas con criterio pre-registrado · 5 ganadores desplegados y verificados (backfill, writer v1.1, search_facts, bi-temporalidad, wiring) · 1 garantía cableada (el gate ya no depende de que nadie recuerde) · 24 commits triple-remoto · producción intacta salvo lo gateado, con backup en cada paso.
Lo que hoy cambió de verdad: amanecimos creyendo que el retrieval era 0.49 (era mentira), lo medimos honestamente (0.06), lo arreglamos (0.149), y descubrimos con un examen justo que el sistema real vale 0.542 a la primera / 0.861 en top-10. Y cada cosa que no funcionó quedó escrita con su número, para que nadie la repita.
Descansa, John. El cron vigila el gate; tu cola te lo recordará al abrir. 🔥