update(episode): TRAZA_todo-el-arco-en-una-frase-honesta-el_S20260719.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting Summary: EPISODIO 2 — MNEMO: **Todo el arco, en una frase honesta:** el...
This commit is contained in:
parent
dbe9119f01
commit
8833631368
1 changed files with 14 additions and 2 deletions
|
|
@ -16,5 +16,17 @@ relectura_tagged: false
|
||||||
forgejo_commit_sha: "pending"
|
forgejo_commit_sha: "pending"
|
||||||
---
|
---
|
||||||
|
|
||||||
**Todo el arco, en una frase honesta:** el sistema de memoria funciona mejor de lo que el 0.06 sugiere (a pool chico es 0.36), la fusión que celebramos era humo de leakage, y la mejora real no es más ranking ni más resúmenes — es **buscar dentro de un pool ya filtrado por contexto**. Grabado en memoria operativa (§6b del runbook) para que ninguna instancia futura re-descubra esto. **Hice:** ejecuté el experimento del lever completo (S-1 145 resúmenes + S-2 A/B sombra). Descubrí que **el pool domina** (0.36 vs 0.06), que el resumen ayuda recall@10 no recall@1, y que la palanca real es **filter-then-rank**. Todo documentado + grabado en memoria + commits `acd4a817`/`e2ff858e` 3/3. Producción intacta. **Falta:** el experimento que cierra el arco — **filter-then-rank**: repetir el examen honesto restringiendo el pool por la vía que la query insinúa (session_code/fecha/skill), a ver si el 0.06 salta a 0.30+. Ese sería el primer resultado que mejora el retrieval REAL, no un fantasma. **Mi consejo:** este es el punto donde el arco por fin apunta a la mejora verdadera. Vale la pena cerrar aquí con la conclusión firme y arrancar el experimento filter-then-rank fresco (es el clímax productivo). Llevamos ~13 rondas; un corte limpio con la POSTA actualizada dejaría la próxima ventana lista para ejecutarlo. **Para avanzar, elige:**
|
- 🟡 **B** — Sigo YA con el experimento filter-then-rank en esta ventana (restringir pool por vía inferida → re-medir). - ⚪ **C** — Barrido DLC-2 (P-D4): etiquetar el 0.490 como "oráculo optimista" en todos los docs antes de cerrar. **F0 + F1 COMPLETAS** ✅ — sin tocar ningún protocolo. Commit `77759c11`. ## Lo que quedó construido (la fase segura)
|
||||||
- 🟢 **A** *(recomendado)* — Cierre disciplinado (STATE + POSTA con "próximo: filter-then-rank" + confirmar todo pusheado); la mejora real arranca en ventana fresca. - 🟡 **B** — Sigo YA con el experimento filter-then-rank en esta ventana (restringir pool por vía inferida → re-medir). - ⚪ **C** — Barrido DLC-2 (P-D4): etiquetar el 0.490 como "oráculo optimista" en todos los docs antes de cerrar.
|
|
||||||
|
Ejecuté las 6 tareas de preparación + observabilidad **sin cambiar ni una regla**:
|
||||||
|
- **T-00** staleness (los targets intactos) · **T-01** baseline congelado + tag de rollback `pre_remediacion_wave1_S20260719` · **T-02** re-medición ALQUIMIA corriendo en background. - **T-10/11/12** — construí el **termómetro** (`outcome_probe.py`): la pieza que ARREGLA la brecha raíz #1 (no sabíamos medir si un protocolo sirve). Es un script (no un hook nuevo — para no agravar la brecha de candados), trae su propio test-anti-mentira (BLINDADA-30, 4/4 verde), y ya tomó la **foto baseline**:
|
||||||
|
|
||||||
|
| Protocolo | Métrica baseline | Lectura |
|
||||||
|
|---|---|---|
|
||||||
|
| COMPASS | accuracy 0.70 | el router acierta 70% en 20 queries |
|
||||||
|
| PROCEDENCIA | 0.10 | solo **1 de 10** docs recientes usa tags de confianza (PR-3 casi no vive) |
|
||||||
|
| TESSERA | anáforas 0.018/100w | muy bajo = TP-2 se cumple |
|
||||||
|
| GAUGE | null | session_state no guarda la zona en el formato esperado (refinamiento futuro) |
|
||||||
|
| ALQUIMIA | null | pendiente T-02 (background) |
|
||||||
|
|
||||||
|
Ahora, cuando apliquemos cada simplificación, **el termómetro dirá si ayudó o dañó** — que era exactamente lo que no teníamos. Dime **A / B / C**. El termómetro ya está — cuando quieras, seguimos con el CONCILIO y los cambios (con tu GO en cada escalón).
|
||||||
|
|
|
||||||
Loading…
Reference in a new issue