feat(episode): EXPLORA_las-dos-mediciones-estn-en-marcha_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 2 — Ember: Las dos mediciones están en marcha
This commit is contained in:
Ember 2026-08-12 00:36:17 +00:00
parent d466963af5
commit 7b6fee9a0c

View file

@ -0,0 +1,50 @@
---
episode_id: "a0ae766d-ef6a-4067-bfec-9670e6962f74"
puente_flat: "EXPLORA_las-dos-mediciones-estn-en-marcha_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260808.MEMORIA_SOTA_BRECHA"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "TESSERA"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 2 — Ember: Las dos mediciones están en marcha"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-12T00:36:15.209321+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Aún corriendo — construir ~3.700 embeddings lleva su tiempo. Te resumo el estado mientras convergen.
## Las dos mediciones están en marcha
| Medición | Quién | Estado |
|---|---|---|
| Índice de preguntas sembradas | **Opus 5** (yo) | Construyendo el índice |
| La misma hipótesis, diseño propio | **Fable** | Diseñando su método |
**La hipótesis que ambos medimos:** hoy la búsqueda compara tu pregunta contra el **texto** del episodio. Las preguntas que Ember sembró al guardar —diez por episodio, cobertura del 100%— no se usan. Si se comparara pregunta contra pregunta, ¿subiría el recall?
## La decisión de método que protege tu idea
A Fable **no le di mi resultado**, y es deliberado. Le pasé el mismo universo congelado, el baseline del texto (`0.146 / 0.420`) y el aviso de que el `0.06` está obsoleto — todo lo necesario para que su número sea comparable. Pero no el mío.
Si le hubiera dicho *"a mí me sale X"*, su medición quedaría anclada a X y tu control cruzado se convertiría en un eco. Así, si coincidimos por caminos distintos el hallazgo es sólido; si discrepamos, la discrepancia señala dónde está el sesgo de quien mide — que es justo lo que querías detectar.
También le exigí que **su instrumento falle ruidosamente**, con el precedente de hoy explicado: un arnés que devolvía ceros silenciosos casi nos hace concluir que el sistema había colapsado.
Y le pedí una sección concreta: **"lo que viste y no esperabas"**. Ahí es donde puede aparecer lo que yo no vea, que es la razón entera de que midan dos.
## Salvaguardas activas
Cada uno en su propia colección de laboratorio, con prefijo que las marca como desechables. Producción es solo lectura para ambos. Y ambos borran al terminar.
**Hecho hasta ahora:** arnés reparado y verificado · baseline re-medido (`0.146 / 0.420`) · inventario de 52 campos · cobertura de preguntas sembradas confirmada al 100% · dos mediciones independientes lanzadas.
**Falta:** que ambas terminen. Luego te traigo las dos cifras juntas, coincidan o no — y si discrepan, eso también será un resultado que reportar, no un problema que esconder.
Después vendrá lo que pediste al principio: el análisis de Fable sobre cómo interactúan los 52 campos entre sí, ya con los números reales en la mano en vez de con el 6% obsoleto.
Te aviso en cuanto converjan.