feat(episode): EXPLORA_laboratorio-limpio-y-el-diagnstico-cambi_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: TESSERA | Type: troubleshooting
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Laboratorio limpio. Y el diagnóstico **cambia por
This commit is contained in:
Ember 2026-08-12 00:41:18 +00:00
parent 7b6fee9a0c
commit 1cf3867132

View file

@ -0,0 +1,52 @@
---
episode_id: "481907b4-16e9-4887-a89a-94e0a790890a"
puente_flat: "EXPLORA_laboratorio-limpio-y-el-diagnstico-cambi_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260808.MEMORIA_SOTA_BRECHA"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "TESSERA"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 2 — MNEMO_PRE_DIGEST: Laboratorio limpio. Y el diagnóstico **cambia por completo.."
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-08-12T00:41:17.590371+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Laboratorio limpio. Y el diagnóstico **cambia por completo la interpretación**.
Mira las preguntas sembradas reales:
> *"¿Cuántos tests quedaron verdes en el activo tras el retiro?"*
> *"¿Qué es /home/johnember/ember en el servidor MEMORIA?"*
> *"¿Cuántos días lleva corriendo el proceso claude remote-control mobile-s26?"*
**Son excelentes.** Específicas, con detalle concreto, perfectamente discriminativas. No son relleno genérico. Solo el 19,5% se repite literalmente.
Ahora compara con las preguntas del examen:
> *"¿Cómo se abordó la protección de John en el segundo episodio?"*
`★ Insight ─────────────────────────────────────`
**El problema no es la calidad de las preguntas sembradas: es que el examen no las representa.** Las del examen se generaron desde *título y fecha* — preguntan como alguien que solo vio el encabezado. Las sembradas nacen del *contenido* — responden a alguien que conoce el detalle. **Viven en universos semánticos distintos.** Comparar unas contra otras es comparar dos idiomas de pregunta, y por eso el índice rinde la mitad.
`─────────────────────────────────────────────────`
Y eso arrastra una implicación incómoda: **el examen held-out puede estar midiendo un escenario que no es el real**. Las preguntas desde título son un sustituto de "cómo preguntaría una persona", pero quizá un sustituto pobre. Todo el arco —incluido el 0.146 de hoy— cuelga de esa aproximación.
También apareció un hallazgo colateral: en la muestra, `puente_flat` salió **vacío** en episodios que sí tienen preguntas sembradas. Hay puntos sin el identificador que cruza los almacenes.
**Mi medición, honesta:** las preguntas sembradas **rinden la mitad** que el texto (`0.069` frente a `0.146`). Mi propia hipótesis del inventario queda refutada por mi propia medición.
**Pero el porqué importa más que el número.** No fallan por malas — fallan porque el examen pregunta en otro idioma. La idea no está muerta: está **mal examinada**.
**Falta.** La medición de Fable, que ahora vale más que antes: si él llega al mismo sitio por otro camino, la refutación es sólida; si ve algo distinto —y le pedí expresamente una sección de "lo que viste y no esperabas"—, puede que detecte justo esto.
Cuando devuelva, te traigo las dos cifras y la lectura conjunta. No toco nada del pipeline hasta entonces.
preguntas sembradas desde contenido; indice de preguntas --rinde la mitad que--> indice de texto; calidad alta de preguntas --NO implica--> utilidad en retrieval]
negated_concepts: [las preguntas sembradas NO son genericas; el fallo NO es de calidad; la hipotesis H-e NO se sostuvo; la idea NO esta muerta sino mal examinada]
epistemic_summary: hard_fact las cifras del experimento y la muestra cualitativa; inference el diagnostico del desajuste de idioma, que requiere medicion aparte para confirmarse
-->