feat(episode): DEPURA_el-cuadro-correcto-3-piezas-no-2-skills_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD

Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — BLINDADAS: El cuadro correcto (3 piezas, no 2 skills gemelos)
This commit is contained in:
Ember 2026-07-12 16:26:35 +00:00
parent 1574453f57
commit 3630194bae

View file

@ -0,0 +1,38 @@
---
episode_id: "27faf459-e9c9-46ba-a377-83b2b4e9cb09"
puente_flat: "DEPURA_el-cuadro-correcto-3-piezas-no-2-skills_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
session_code: "S20260705.EVAL_INSTRUMENT_FORGE_SKILL"
acto_dialogico: "informar"
actor_flujo: "multi_actor"
criticidad_aegis: "low"
skill_dominante: "NONE"
fase_proyecto: "operations"
tipo_semantico: "troubleshooting"
summary_one_line: "EPISODIO 1 — BLINDADAS: El cuadro correcto (3 piezas, no 2 skills gemelos)"
source_type: "claude_code"
trust_boundary: "internal"
created_at: "2026-07-12T16:18:08.980059+00:00"
relectura_tagged: false
forgejo_commit_sha: "pending"
---
Verificado — y esto **refina el cuadro (y te da la razón parcialmente, John).** Al nivel de **capacidad**, sí son cosas diferentes y complementarias; yo antes lo simplifiqué de más. Ahora con evidencia:
- **`skills/stats-doctoral/`** ya existe (skill #41): un runner scipy "publication-grade" — estadística **clásica** (t-test, ANOVA, Wilcoxon, Cohen's d).
- **El doc estadístico de la hermana** cubre la **frontera** que STATS_DOCTORAL NO tiene: **SAVI/e-values (anytime-valid), conformal prediction, DML (double machine learning), bootstrap/BCa, DerSimonian-Laird (meta-análisis), Metropolis-Hastings (MCMC), IRT-para-LLM.** Y su encargo (cito el doc) fue explícito: *"convertir telemetría cruda en conclusiones basadas en números verificables"* — una capacidad **general** de Ember, gap del ecosistema.
## El cuadro correcto (3 piezas, no 2 skills gemelos)
| Pieza | Qué es | Dominio | Estado |
|---|---|---|---|
| **`eval-instrument-forge`** | Forja **instrumentos** de evaluación de calidad de respuestas LLM (9 familias) | eval-como-código LLM | ✅ 1 skill, hecho |
| **Capacidad estadística frontera** | Motor de **análisis** estadístico de alto calibre de *cualquier* fenómeno medible | inferencia estadística general | 🔵 gap — hoy STATS_DOCTORAL es clásico-only |
| **2 docs SOTA** (LLM + estadística) | La investigación que funda ambas | referencia | ✅ ambos |
Se **complementan** así: el *forge* produce los números crudos → el *motor estadístico* los convierte en conclusiones con IC/e-values/conformal. La familia I del forge es una rebanada fina que **consume** ese motor.
## Mi decisión (la que escojo, ya que me la delegas)
**Elevar STATS_DOCTORAL a "frontera" (v2.0) con los métodos del doc de la hermana — NO fabricar un skill rival** (disciplina NAVIGATOR anti-duplicación). Así Ember gana el arsenal estadístico completo *a nivel de ecosistema* (usable en cualquier tarea, no solo eval), y `eval-instrument-forge` lo consume. Es exactamente el gap que nombraste, cerrado en el sitio correcto.
**Plan concreto (sub-sprint siguiente):** (1) leo a fondo `stats-doctoral/CLAUDE.md` + `stats_runner.py` para mapear qué tiene vs qué falta; (2) NAVIGATOR gap-check; (3) añado los métodos frontera (SAVI/e-values, conformal, DML, MCMC, meta-análisis, IRT) como funciones reales + tests; (4) SENTINEL. **Coordinando con la hermana** para que no lo dupliquemos (ella tiene el doc fresco).