ember-memory-test/episodes/EXPLORA_los-nmeros-de-hoy-contra-los-de-julio_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 6096677a4c feat(episode): EXPLORA_los-nmeros-de-hoy-contra-los-de-julio_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Los números de hoy contra los de julio
2026-08-12 00:14:15 +00:00

2.7 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
afb950e5-adc5-4b8b-afee-978dbccdffe7 EXPLORA_los-nmeros-de-hoy-contra-los-de-julio_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260808.MEMORIA_SOTA_BRECHA informar multi_actor low NONE operations troubleshooting EPISODIO 2 — MNEMO_PRE_DIGEST: Los números de hoy contra los de julio claude_code internal 2026-08-12T00:14:06.205121+00:00 false pending

Medición real, y cambia el plan.

Los números de hoy contra los de julio

Julio Hoy
recall@1 0.060 0.146 2,4× mejor
recall@10 0.169 0.420 2,5× mejor
MRR 0.094 0.232 2,5×

Mismo lockbox, mismo sha256 b4cbd9885c16, mismo arnés. Comparable de verdad.

★ Insight ───────────────────────────────────── El 6% que hemos usado todo el chat como número de referencia está obsoleto. El relleno de resúmenes desplegado en julio ya hizo su trabajo: hoy es 14,6%. Yo mismo te dije "EMBER recuerda mal lo de ayer" apoyándome en una cifra de hace tres semanas. La conclusión sigue siendo cierta —14,6% es malo— pero la magnitud del problema era menos de la mitad de lo que dije. ─────────────────────────────────────────────────

Y esto cambia el plan de Fable

Su gate exigía recall@50 ≥ 0.40 para que el bibliotecario experto tuviera sentido. Con el 0.169 de julio parecía imposible. Hoy el recall@10 ya es 0.420. El recall@50 será necesariamente mayor. El gate pasa con holgura, y probablemente por bastante. Traducido: la ficha correcta llega a la mesa el 42% de las veces, pero solo se pone primera el 14,6%. Hay un 27,4% de casos donde el recuerdo correcto está ahí y queda enterrado. Ese hueco es exactamente lo que un reranker recupera. El mecanismo M-2 pasa de apuesta a la jugada más clara del plan. ## El defecto que encontré por el camino

El arnés devolvió 0.0 en las seis métricas en el primer intento — porque no podía conectar a Qdrant, no porque el recall fuera cero. No falla ruidosamente: entrega ceros como si fueran una medición. Si alguien lo corre sin sospechar, concluye que el sistema colapsó y toma decisiones sobre una alarma falsa. La causa: busca Qdrant por el nombre del contenedor, que solo resuelve dentro de la red Docker.