ember-memory-test/episodes/TRAZA_la-ltima-decisin-cunto-abarca-la-v10_S20260705.R22_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 86e04248f7 feat(episode): TRAZA_la-ltima-decisin-cunto-abarca-la-v10_S20260705.R22_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: design
Summary: EPISODIO 22 — BLINDADAS: 📖 La última decisión: ¿cuánto abarca la v1.0?
2026-07-12 16:19:28 +00:00

2.8 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
10f589e5-de9f-41f2-a141-bff2ae1004a8 TRAZA_la-ltima-decisin-cunto-abarca-la-v10_S20260705.R22_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations design EPISODIO 22 — BLINDADAS: 📖 La última decisión: ¿cuánto abarca la v1.0? claude_code internal 2026-07-12T16:16:36.966817+00:00 false pending

Golden set = fuente externa queda fijado en la SPEC (§10, §13) y en la DECISIÓN (RR3 cerrado). Default propuesto: SWE-bench Verified (500 bugs reales de GitHub, human-filtered) — si prefieres otra fuente, me dices.

Con eso quedan resueltas 2 de las 3 decisiones de diseño (golden set externo · guardrails bloqueantes ). Te enmarco la última — el alcance de v1.0 — con su historia, y luego quedo esperando tu revisión de la SPEC + GO.

📖 La última decisión: ¿cuánto abarca la v1.0?

Reframe: no es "¿qué puede hacer el skill?" (la SPEC ya define las 9 familias) — es "¿v1.0 intenta hacer de todo desde el día 1, o domina primero lo que da evidencia confiable y crece después?"

Los dos caminos:

Camino Qué incluye v1.0 Costo
A — acotado (recomendado) Lo determinista (pass@k, exact-match+SymPy, IFEval, Recall@k, ablation-F) + juez calibrado (calidad abierta, RAG). Difiere multimodal, privacidad, reward-model, frontier-safety, GUI/computer-use a v1.1+ Menos superficie, menos mantenimiento; algunas dimensiones esperan
B — ampliar ya Sube alguna familia diferida a v1.0 (p.ej. trayectoria agéntica o safety/red-team) Más código y frameworks externos (Inspect AI/Ragas) que mantener; más riesgo de fragilidad; retrasa el primer veredicto útil

Mi inclinación: A. Porque el propósito declarado es auto-evaluar la calidad de tus respuestas, y para eso el subconjunto determinista + juez-calibrado da el 80% del valor con el 20% del riesgo. Las familias diferidas (dangerous-capability, GUI) además necesitan infraestructura pesada que hoy no aporta a tu pregunta original. PROBATOR y BEACON recomendaron explícitamente arrancar angosto y crecer. Qué me haría cambiar: que me digas que te urge medir ya una dimensión concreta — por ejemplo la fiabilidad agéntica de Ember, o la calidad del retrieval de tu memoria (RAG).

La pregunta esencial (lo único que solo tú pones): ¿confirmas el alcance acotado v1.0, o hay una familia diferida que quieres subir ahora porque te urge medirla?

Puedes responderla junto con tu revisión de la SPEC — y cuando me des GO, fabrico. Sin prisa.