ember-memory-test/episodes/EXPLORA_tarea-reclamada-e-memop-y-el-reconocimi_S20260718.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 2819ae688f feat(episode): EXPLORA_tarea-reclamada-e-memop-y-el-reconocimi_S20260718.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Tarea reclamada (`E-MEMOP`)  y el **reconocimien
2026-07-19 01:46:16 +00:00

3.2 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
bb1d79f7-c4a8-45d2-8541-d5de378eab00 EXPLORA_tarea-reclamada-e-memop-y-el-reconocimi_S20260718.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260718.ECC_TOOLBOX_SURFACER informar multi_actor low TESSERA operations troubleshooting EPISODIO 2 — MNEMO_PRE_DIGEST: Tarea reclamada (`E-MEMOP`) y el **reconocimiento triple.. claude_code internal 2026-07-19T01:46:15.822979+00:00 false pending

Tarea reclamada (E-MEMOP) y el reconocimiento triple ya corre en paralelo (el aviso AEGIS del claim es advisory — registrado). Estado del sprint:

Fase Estado
Claim + declaración de archivos E-MEMOP en el tablero
🔍 Recon A — inventario de diarios JSONL (cuáles valen oro, cuáles son ruido, cuáles tienen datos sensibles) 🔄 corriendo
🔍 Recon B — contrato exacto del crisol (cómo se deposita un episodio, los checks CHK, el requisito HyDE post-fix, routing de colecciones) 🔄 corriendo
🔍 Recon C — verify-first anti-duplicación (¿alguien ya ingiere telemetría?) + política Q-CRIT-2 de ember_knowledge 🔄 corriendo
Spec con datos reales → PROBATOR-lite → v0 piloto al volver los 3

En cuanto los tres exploradores me entreguen sus JSON tipados, sigo sin pausa: síntesis de la spec (con los John-gates marcados), y de ahí al piloto pequeño con verificación de retrieval de punta a punta. No necesitas hacer nada — te aviso con el diseño masticado.

crisol (puerta canónica D-1, no bypass); diseño --condicionado-por--> lecciones S20260712 (dedup-first, no push ciego, HyDE autoría write-time); recon-triple --precede--> spec (verify-first antes de fabricar)] negated_concepts: [NO bypass del crisol vía store_memory directo sin evaluar doctrina; NO backfill masivo sin gate John; NO destabilizar el pipeline recién estabilizado; NO fabricar sin verify-first] epistemic_summary: hechos = claim hecho + workflow 3 agentes lanzado con schemas tipados; pendiente = resultados recon → spec → PROBATOR-lite → v0 piloto con oráculo retrieval -->

A completo — commit 411fbb31, push 3/3. Y respondió tu inquietud con un número real y honesto que, francamente, importa mucho.

🧠 Cómo está el pipeline MNEMO — el número real

Recall@1 de producción ≈ 0.32 (no el ~0.60 que el termómetro implicaba). El pipeline recupera notablemente peor en el corpus real acumulado (731 episodios) que en el lab curado de julio. Es en parte esperable —más datos = más colisiones— pero la magnitud (46% en recall@1) dice que el 78.7 de la rúbrica sobreestimaba la salud de la memoria. Y ese 0.32 aún es optimista: mide auto-recuperación (la query es la propia HyDE del episodio); el held-out real (B) daría más bajo.

Lo bueno: el pipeline está vivo y creciendo (697→731 durante la sesión). La durabilidad está sana; el recall es donde hay trabajo.

🔵 Sobre B (held-out N≥500) — te lo enmarco antes de lanzarme