ember-memory-test/episodes/EXPLORA_aclaracin-entregada-y-la-decisin-ya-est_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 0525db5e33 feat(episode): EXPLORA_aclaracin-entregada-y-la-decisin-ya-est_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 1 — EMBER: Aclaración entregada y la decisión ya está enmarcada...
2026-07-12 15:19:21 +00:00

3.3 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
7c2ae9c1-d8a9-4576-96a8-b5b8addc3f2e EXPLORA_aclaracin-entregada-y-la-decisin-ya-est_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations troubleshooting EPISODIO 1 — EMBER: Aclaración entregada y la decisión ya está enmarcada... claude_code internal 2026-07-12T15:16:09.897827+00:00 false pending

Aclaración entregada y la decisión ya está enmarcada (1 skill + 2 docs, que es lo que hay hoy, vs 2 skills separados — mi recomendación: dejarlo como 1 skill, ya construido y certificado). Quedo en standby esperando tu confirmación 🟢/🟡.

Verificado — y esto refina el cuadro (y te da la razón parcialmente, John). Al nivel de capacidad, sí son cosas diferentes y complementarias; yo antes lo simplifiqué de más. Ahora con evidencia:

  • skills/stats-doctoral/ ya existe (skill #41): un runner scipy "publication-grade" — estadística clásica (t-test, ANOVA, Wilcoxon, Cohen's d).
  • El doc estadístico de la hermana cubre la frontera que STATS_DOCTORAL NO tiene: SAVI/e-values (anytime-valid), conformal prediction, DML (double machine learning), bootstrap/BCa, DerSimonian-Laird (meta-análisis), Metropolis-Hastings (MCMC), IRT-para-LLM. Y su encargo (cito el doc) fue explícito: "convertir telemetría cruda en conclusiones basadas en números verificables" — una capacidad general de Ember, gap del ecosistema.

El cuadro correcto (3 piezas, no 2 skills gemelos)

Pieza Qué es Dominio Estado
eval-instrument-forge Forja instrumentos de evaluación de calidad de respuestas LLM (9 familias) eval-como-código LLM ✅ 1 skill, hecho
Capacidad estadística frontera Motor de análisis estadístico de alto calibre de cualquier fenómeno medible inferencia estadística general 🔵 gap — hoy STATS_DOCTORAL es clásico-only
2 docs SOTA (LLM + estadística) La investigación que funda ambas referencia ✅ ambos

Se complementan así: el forge produce los números crudos → el motor estadístico los convierte en conclusiones con IC/e-values/conformal. La familia I del forge es una rebanada fina que consume ese motor.

Mi decisión (la que escojo, ya que me la delegas)

Elevar STATS_DOCTORAL a "frontera" (v2.0) con los métodos del doc de la hermana — NO fabricar un skill rival (disciplina NAVIGATOR anti-duplicación). Así Ember gana el arsenal estadístico completo a nivel de ecosistema (usable en cualquier tarea, no solo eval), y eval-instrument-forge lo consume. Es exactamente el gap que nombraste, cerrado en el sitio correcto.

Plan concreto (sub-sprint siguiente): (1) leo a fondo stats-doctoral/CLAUDE.md + stats_runner.py para mapear qué tiene vs qué falta; (2) NAVIGATOR gap-check; (3) añado los métodos frontera (SAVI/e-values, conformal, DML, MCMC, meta-análisis, IRT) como funciones reales + tests; (4) SENTINEL. Coordinando con la hermana para que no lo dupliquemos (ella tiene el doc fresco).