Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — HyDE: [R13.cierre.T1] Lo que el barrido destapó
3.6 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ffdcecec-2aaa-4798-9431-e0f1b30f93d8 | TRAZA_r13cierret1-lo-que-el-barrido-destap_S20260812.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260812.PIPELINE_FIXES | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — HyDE: [R13.cierre.T1] Lo que el barrido destapó | claude_code | internal | 2026-08-14T19:50:25.240680+00:00 | false | pending |
Entregado y versionado: ab9a42c5 (mapa corregido) + f1b9338f (briefing).
[R13.cierre.T1] Lo que el barrido destapó
Tu encargo salió, pero lo que apareció por el camino importa más que el paquete.
| Hallazgo | Evidencia |
|---|---|
| La fusión V1 pierde en el held-out honesto | delta A→C = −0.054, IC95 [−0.091, −0.02] — excluye 0 en dirección negativa |
| Y el código afirma lo contrario | server.py:318: "A/B gate PASS: recall@1 0.30→0.608" |
| Tres medidores, tres cifras, ninguna reconcilia | canario 26,7% · oráculo 42,2% · held-out 14,6% denso / 9,1% fusión |
| El canario no mide producción | corre denso puro; producción corre fusion=True |
| Y quizá ni siquiera el mismo espacio vectorial | embebe con gemini-embedding-2-**preview**, string ≠ al de indexación |
| No hay reranker de ningún tipo en lectura | ni cross-encoder, ni ColBERT, ni BM25, ni RRF, ni HyDE |
★ Insight ─────────────────────────────────────
Dos verdes falsos aparecieron en el mismo turno, y son la misma lección. El primero: el hook corrió el gate del briefing en modo plan y dio PASS — al correrlo yo en modo auditoria dio FAIL, porque ese modo activa tres checks que el otro no aplica. El segundo, más grande: el 26,7% que publiqué ayer con tanto cuidado es honesto respecto a su método, y su método no es el de producción. Arreglé un instrumento que medía mal y quedó midiendo bien... otra cosa.
─────────────────────────────────────────────────
Hice: el SHERPA está listo y pasa el gate en el modo correcto. Lleva mis 20 claims, 12 bloques de evidencia con comandos que Fable puede re-ejecutar, mis 11 auto-sospechas y las 5 contradicciones con sus dos versiones. También corregí el mapa: tenía un eslabón inventado —atribuí el transporte a un hook que resultó ser un no-op— y la vía de retrieval, que había marcado como desconocida, ahora está verificada.
Falta: que Fable lo lea y produzca los dos documentos.
Mi consejo: hay una pregunta que puede tumbar la cifra que más miramos, y se responde en cinco minutos: ¿gemini-embedding-2-preview y gemini-embedding-2 son el mismo modelo? Si no lo son, el canario está midiendo un espacio vectorial distinto al de indexación y el 26,7% no significa nada. Va como negativa N-04 en el briefing, pero yo la resolvería antes de que Fable construya el plan encima.
Lo que más me inquieta y quiero que sepas por mí: llevo tres días arreglando instrumentos que mentían, y hoy descubrí que el instrumento estrella de la salida del freeze no mide lo que sirve las respuestas. No es un fallo del arreglo de ayer —el canario ahora dice la verdad sobre lo que mide—, es que nadie había comprobado que midiera lo correcto. Es exactamente el patrón, una capa más arriba.
—