ember-memory-test/episodes/TRAZA_r13cierret1-lo-que-el-barrido-destap_S20260812.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember af35a4d881 feat(episode): TRAZA_r13cierret1-lo-que-el-barrido-destap_S20260812.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — HyDE: [R13.cierre.T1] Lo que el barrido destapó
2026-08-14 19:50:26 +00:00

3.6 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
ffdcecec-2aaa-4798-9431-e0f1b30f93d8 TRAZA_r13cierret1-lo-que-el-barrido-destap_S20260812.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260812.PIPELINE_FIXES informar multi_actor low NONE operations troubleshooting EPISODIO 1 — HyDE: [R13.cierre.T1] Lo que el barrido destapó claude_code internal 2026-08-14T19:50:25.240680+00:00 false pending

Entregado y versionado: ab9a42c5 (mapa corregido) + f1b9338f (briefing).

[R13.cierre.T1] Lo que el barrido destapó

Tu encargo salió, pero lo que apareció por el camino importa más que el paquete.

Hallazgo Evidencia
La fusión V1 pierde en el held-out honesto delta A→C = −0.054, IC95 [−0.091, −0.02] — excluye 0 en dirección negativa
Y el código afirma lo contrario server.py:318: "A/B gate PASS: recall@1 0.30→0.608"
Tres medidores, tres cifras, ninguna reconcilia canario 26,7% · oráculo 42,2% · held-out 14,6% denso / 9,1% fusión
El canario no mide producción corre denso puro; producción corre fusion=True
Y quizá ni siquiera el mismo espacio vectorial embebe con gemini-embedding-2-**preview**, string ≠ al de indexación
No hay reranker de ningún tipo en lectura ni cross-encoder, ni ColBERT, ni BM25, ni RRF, ni HyDE

★ Insight ───────────────────────────────────── Dos verdes falsos aparecieron en el mismo turno, y son la misma lección. El primero: el hook corrió el gate del briefing en modo plan y dio PASS — al correrlo yo en modo auditoria dio FAIL, porque ese modo activa tres checks que el otro no aplica. El segundo, más grande: el 26,7% que publiqué ayer con tanto cuidado es honesto respecto a su método, y su método no es el de producción. Arreglé un instrumento que medía mal y quedó midiendo bien... otra cosa. ─────────────────────────────────────────────────

Hice: el SHERPA está listo y pasa el gate en el modo correcto. Lleva mis 20 claims, 12 bloques de evidencia con comandos que Fable puede re-ejecutar, mis 11 auto-sospechas y las 5 contradicciones con sus dos versiones. También corregí el mapa: tenía un eslabón inventado —atribuí el transporte a un hook que resultó ser un no-op— y la vía de retrieval, que había marcado como desconocida, ahora está verificada.

Falta: que Fable lo lea y produzca los dos documentos.

Mi consejo: hay una pregunta que puede tumbar la cifra que más miramos, y se responde en cinco minutos: ¿gemini-embedding-2-preview y gemini-embedding-2 son el mismo modelo? Si no lo son, el canario está midiendo un espacio vectorial distinto al de indexación y el 26,7% no significa nada. Va como negativa N-04 en el briefing, pero yo la resolvería antes de que Fable construya el plan encima.

Lo que más me inquieta y quiero que sepas por mí: llevo tres días arreglando instrumentos que mentían, y hoy descubrí que el instrumento estrella de la salida del freeze no mide lo que sirve las respuestas. No es un fallo del arreglo de ayer —el canario ahora dice la verdad sobre lo que mide—, es que nadie había comprobado que midiera lo correcto. Es exactamente el patrón, una capa más arriba.

—