feat(episode): EXPLORA_query-expansion-hyde-de-lectura-alta_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: **Query expansion / HyDE de lectura** (ALTA —...
This commit is contained in:
Ember 2026-07-20 04:49:03 +00:00
parent b55baa6b94
commit 330713959b

View file

@ -0,0 +1,30 @@
---
episode_id: "7e2aca22-02ab-4d44-bf7a-2f24c48583d4"
puente_flat: "EXPLORA_query-expansion-hyde-de-lectura-alta_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260719.ORACULO_RETRIEVAL_X09"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "TESSERA"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — MNEMO_PRE_DIGEST: **Query expansion / HyDE de lectura** (ALTA —..."
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-07-20T04:48:54.901629+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
**Query expansion / HyDE de lectura** (ALTA — hoy embebemos la pregunta cruda; nuestras HyDE son solo de escritura) · **sub-chunking de episodios largos** (MEDIA) · **reflexión como generación de conocimiento** — "¿qué aprendí este mes?", que hoy no sabemos responder (MEDIA, es capacidad nueva, no recall) · **memoria procedimental** — aprender a HACER, no solo recordar (BAJA-MEDIA, alto valor identitario).
Y cuatro que **NO deberíamos adoptar** con razón escrita: LLM-judge como gate, fine-tuning de embeddings, quantization/IVF (optimizan millones de vectores, tenemos miles), y migrar a un framework externo.
- **Hice:** crucé los 15 papers verificados contra todo lo que probamos y falsificamos hoy; encontré la brecha @1/@10 y la dimensión virgen que la explica.
- **Falta:** decidir si el **micro-experimento de reranker** entra en cola. Es del patrón que ya nos funcionó cinco veces: ~1 hora, sin tocar producción, criterio pre-registrado, y si no paga se reporta el FAIL y se archiva.
- **Mi consejo:** sí, y ANTES que el writer v1.2 — porque el reranker es medición pura (cero riesgo) mientras el v1.2 toca ingesta viva y además espera el gate de 48h. Aprovechar la espera midiendo es exactamente el uso correcto del tiempo.
- **Para avanzar, elige:** 🟢 **A** — corro el micro-experimento de reranker ahora *(recomendado: aprovecha la espera del gate)* · 🟡 **B** — lo dejo en cola y cerramos aquí · ⚪ **C** — prefieres que estudie primero otra de las cinco (dime cuál).
**Acta:** [X_RERANK_FAIL_S20260719.md](docs/X_RERANK_FAIL_S20260719.md) · commit `1f168cca` ×3 remotos · [ARCO §7](docs/ARCO_AUTOMEJORA_FRONTIER.md) al día.
**El resultado en sencillo, John:** probamos la apuesta dos veces — primero con el juez barato (flash-lite, resúmenes cortos), luego con la config mejorada (gpt-4o-mini leyendo el contenido, sobre un set de práctica fresco para no quemar el examen). Las dos convergieron en lo mismo: el reranker-LLM captura apenas el **~10-11%** de la brecha disponible, muy lejos de significancia. **Un LLM leyendo rápido no distingue entre diez memorias casi gemelas cuál es LA que originó el dato** — el mismo fantasma de la multi-mención que vimos en los hechos.