feat(episode): EXPLORA_laboratorio-limpio-y-el-diagnstico-cambi_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: TESSERA | Type: troubleshooting Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: Laboratorio limpio. Y el diagnóstico **cambia por
This commit is contained in:
parent
7b6fee9a0c
commit
1cf3867132
1 changed files with 52 additions and 0 deletions
|
|
@ -0,0 +1,52 @@
|
||||||
|
---
|
||||||
|
episode_id: "481907b4-16e9-4887-a89a-94e0a790890a"
|
||||||
|
puente_flat: "EXPLORA_laboratorio-limpio-y-el-diagnstico-cambi_S20260808.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260808.MEMORIA_SOTA_BRECHA"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "TESSERA"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 2 — MNEMO_PRE_DIGEST: Laboratorio limpio. Y el diagnóstico **cambia por completo.."
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-08-12T00:41:17.590371+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
Laboratorio limpio. Y el diagnóstico **cambia por completo la interpretación**.
|
||||||
|
|
||||||
|
Mira las preguntas sembradas reales:
|
||||||
|
|
||||||
|
> *"¿Cuántos tests quedaron verdes en el activo tras el retiro?"*
|
||||||
|
> *"¿Qué es /home/johnember/ember en el servidor MEMORIA?"*
|
||||||
|
> *"¿Cuántos días lleva corriendo el proceso claude remote-control mobile-s26?"*
|
||||||
|
|
||||||
|
**Son excelentes.** Específicas, con detalle concreto, perfectamente discriminativas. No son relleno genérico. Solo el 19,5% se repite literalmente.
|
||||||
|
|
||||||
|
Ahora compara con las preguntas del examen:
|
||||||
|
|
||||||
|
> *"¿Cómo se abordó la protección de John en el segundo episodio?"*
|
||||||
|
|
||||||
|
`★ Insight ─────────────────────────────────────`
|
||||||
|
**El problema no es la calidad de las preguntas sembradas: es que el examen no las representa.** Las del examen se generaron desde *título y fecha* — preguntan como alguien que solo vio el encabezado. Las sembradas nacen del *contenido* — responden a alguien que conoce el detalle. **Viven en universos semánticos distintos.** Comparar unas contra otras es comparar dos idiomas de pregunta, y por eso el índice rinde la mitad.
|
||||||
|
`─────────────────────────────────────────────────`
|
||||||
|
|
||||||
|
Y eso arrastra una implicación incómoda: **el examen held-out puede estar midiendo un escenario que no es el real**. Las preguntas desde título son un sustituto de "cómo preguntaría una persona", pero quizá un sustituto pobre. Todo el arco —incluido el 0.146 de hoy— cuelga de esa aproximación.
|
||||||
|
|
||||||
|
También apareció un hallazgo colateral: en la muestra, `puente_flat` salió **vacío** en episodios que sí tienen preguntas sembradas. Hay puntos sin el identificador que cruza los almacenes.
|
||||||
|
|
||||||
|
**Mi medición, honesta:** las preguntas sembradas **rinden la mitad** que el texto (`0.069` frente a `0.146`). Mi propia hipótesis del inventario queda refutada por mi propia medición.
|
||||||
|
|
||||||
|
**Pero el porqué importa más que el número.** No fallan por malas — fallan porque el examen pregunta en otro idioma. La idea no está muerta: está **mal examinada**.
|
||||||
|
|
||||||
|
**Falta.** La medición de Fable, que ahora vale más que antes: si él llega al mismo sitio por otro camino, la refutación es sólida; si ve algo distinto —y le pedí expresamente una sección de "lo que viste y no esperabas"—, puede que detecte justo esto.
|
||||||
|
|
||||||
|
Cuando devuelva, te traigo las dos cifras y la lectura conjunta. No toco nada del pipeline hasta entonces.
|
||||||
|
|
||||||
|
preguntas sembradas desde contenido; indice de preguntas --rinde la mitad que--> indice de texto; calidad alta de preguntas --NO implica--> utilidad en retrieval]
|
||||||
|
negated_concepts: [las preguntas sembradas NO son genericas; el fallo NO es de calidad; la hipotesis H-e NO se sostuvo; la idea NO esta muerta sino mal examinada]
|
||||||
|
epistemic_summary: hard_fact las cifras del experimento y la muestra cualitativa; inference el diagnostico del desajuste de idioma, que requiere medicion aparte para confirmarse
|
||||||
|
-->
|
||||||
Loading…
Reference in a new issue