Skill: TESSERA | Type: troubleshooting Summary: EPISODIO 1 — MNEMO_PRE_DIGEST: **Query expansion / HyDE de lectura** (ALTA —...
2.8 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 7e2aca22-02ab-4d44-bf7a-2f24c48583d4 | EXPLORA_query-expansion-hyde-de-lectura-alta_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260719.ORACULO_RETRIEVAL_X09 | informar | multi_actor | low | TESSERA | operations | troubleshooting | EPISODIO 1 — MNEMO_PRE_DIGEST: **Query expansion / HyDE de lectura** (ALTA —... | claude_code | internal | 2026-07-20T04:48:54.901629+00:00 | false | pending |
Query expansion / HyDE de lectura (ALTA — hoy embebemos la pregunta cruda; nuestras HyDE son solo de escritura) · sub-chunking de episodios largos (MEDIA) · reflexión como generación de conocimiento — "¿qué aprendí este mes?", que hoy no sabemos responder (MEDIA, es capacidad nueva, no recall) · memoria procedimental — aprender a HACER, no solo recordar (BAJA-MEDIA, alto valor identitario).
Y cuatro que NO deberíamos adoptar con razón escrita: LLM-judge como gate, fine-tuning de embeddings, quantization/IVF (optimizan millones de vectores, tenemos miles), y migrar a un framework externo.
- Hice: crucé los 15 papers verificados contra todo lo que probamos y falsificamos hoy; encontré la brecha @1/@10 y la dimensión virgen que la explica.
- Falta: decidir si el micro-experimento de reranker entra en cola. Es del patrón que ya nos funcionó cinco veces: ~1 hora, sin tocar producción, criterio pre-registrado, y si no paga se reporta el FAIL y se archiva.
- Mi consejo: sí, y ANTES que el writer v1.2 — porque el reranker es medición pura (cero riesgo) mientras el v1.2 toca ingesta viva y además espera el gate de 48h. Aprovechar la espera midiendo es exactamente el uso correcto del tiempo.
- Para avanzar, elige: 🟢 A — corro el micro-experimento de reranker ahora (recomendado: aprovecha la espera del gate) · 🟡 B — lo dejo en cola y cerramos aquí · ⚪ C — prefieres que estudie primero otra de las cinco (dime cuál).
Acta: X_RERANK_FAIL_S20260719.md · commit 1f168cca ×3 remotos · ARCO §7 al día.
El resultado en sencillo, John: probamos la apuesta dos veces — primero con el juez barato (flash-lite, resúmenes cortos), luego con la config mejorada (gpt-4o-mini leyendo el contenido, sobre un set de práctica fresco para no quemar el examen). Las dos convergieron en lo mismo: el reranker-LLM captura apenas el ~10-11% de la brecha disponible, muy lejos de significancia. Un LLM leyendo rápido no distingue entre diez memorias casi gemelas cuál es LA que originó el dato — el mismo fantasma de la multi-mención que vimos en los hechos.