Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — EMBER: Aclaración entregada y la decisión ya está enmarcada...
3.3 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 7c2ae9c1-d8a9-4576-96a8-b5b8addc3f2e | EXPLORA_aclaracin-entregada-y-la-decisin-ya-est_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260705.EVAL_INSTRUMENT_FORGE_SKILL | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — EMBER: Aclaración entregada y la decisión ya está enmarcada... | claude_code | internal | 2026-07-12T15:16:09.897827+00:00 | false | pending |
Aclaración entregada y la decisión ya está enmarcada (1 skill + 2 docs, que es lo que hay hoy, vs 2 skills separados — mi recomendación: dejarlo como 1 skill, ya construido y certificado). Quedo en standby esperando tu confirmación 🟢/🟡.
Verificado — y esto refina el cuadro (y te da la razón parcialmente, John). Al nivel de capacidad, sí son cosas diferentes y complementarias; yo antes lo simplifiqué de más. Ahora con evidencia:
skills/stats-doctoral/ya existe (skill #41): un runner scipy "publication-grade" — estadística clásica (t-test, ANOVA, Wilcoxon, Cohen's d).- El doc estadístico de la hermana cubre la frontera que STATS_DOCTORAL NO tiene: SAVI/e-values (anytime-valid), conformal prediction, DML (double machine learning), bootstrap/BCa, DerSimonian-Laird (meta-análisis), Metropolis-Hastings (MCMC), IRT-para-LLM. Y su encargo (cito el doc) fue explícito: "convertir telemetría cruda en conclusiones basadas en números verificables" — una capacidad general de Ember, gap del ecosistema.
El cuadro correcto (3 piezas, no 2 skills gemelos)
| Pieza | Qué es | Dominio | Estado |
|---|---|---|---|
eval-instrument-forge |
Forja instrumentos de evaluación de calidad de respuestas LLM (9 familias) | eval-como-código LLM | ✅ 1 skill, hecho |
| Capacidad estadística frontera | Motor de análisis estadístico de alto calibre de cualquier fenómeno medible | inferencia estadística general | 🔵 gap — hoy STATS_DOCTORAL es clásico-only |
| 2 docs SOTA (LLM + estadística) | La investigación que funda ambas | referencia | ✅ ambos |
Se complementan así: el forge produce los números crudos → el motor estadístico los convierte en conclusiones con IC/e-values/conformal. La familia I del forge es una rebanada fina que consume ese motor.
Mi decisión (la que escojo, ya que me la delegas)
Elevar STATS_DOCTORAL a "frontera" (v2.0) con los métodos del doc de la hermana — NO fabricar un skill rival (disciplina NAVIGATOR anti-duplicación). Así Ember gana el arsenal estadístico completo a nivel de ecosistema (usable en cualquier tarea, no solo eval), y eval-instrument-forge lo consume. Es exactamente el gap que nombraste, cerrado en el sitio correcto.
Plan concreto (sub-sprint siguiente): (1) leo a fondo stats-doctoral/CLAUDE.md + stats_runner.py para mapear qué tiene vs qué falta; (2) NAVIGATOR gap-check; (3) añado los métodos frontera (SAVI/e-values, conformal, DML, MCMC, meta-análisis, IRT) como funciones reales + tests; (4) SENTINEL. Coordinando con la hermana para que no lo dupliquemos (ella tiene el doc fresco).