Skill: NONE | Type: design
Summary: EPISODIO 22 — BLINDADAS: 📖 La última decisión: ¿cuánto abarca la v1.0?
2.8 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 10f589e5-de9f-41f2-a141-bff2ae1004a8 | TRAZA_la-ltima-decisin-cunto-abarca-la-v10_S20260705.R22_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260705.EVAL_INSTRUMENT_FORGE_SKILL | informar | multi_actor | low | NONE | operations | design | EPISODIO 22 — BLINDADAS: 📖 La última decisión: ¿cuánto abarca la v1.0? | claude_code | internal | 2026-07-12T16:16:36.966817+00:00 | false | pending |
✅ Golden set = fuente externa queda fijado en la SPEC (§10, §13) y en la DECISIÓN (RR3 cerrado). Default propuesto: SWE-bench Verified (500 bugs reales de GitHub, human-filtered) — si prefieres otra fuente, me dices.
Con eso quedan resueltas 2 de las 3 decisiones de diseño (golden set externo ✅ · guardrails bloqueantes ✅). Te enmarco la última — el alcance de v1.0 — con su historia, y luego quedo esperando tu revisión de la SPEC + GO.
📖 La última decisión: ¿cuánto abarca la v1.0?
Reframe: no es "¿qué puede hacer el skill?" (la SPEC ya define las 9 familias) — es "¿v1.0 intenta hacer de todo desde el día 1, o domina primero lo que da evidencia confiable y crece después?"
Los dos caminos:
| Camino | Qué incluye v1.0 | Costo |
|---|---|---|
| A — acotado (recomendado) | Lo determinista (pass@k, exact-match+SymPy, IFEval, Recall@k, ablation-F) + juez calibrado (calidad abierta, RAG). Difiere multimodal, privacidad, reward-model, frontier-safety, GUI/computer-use a v1.1+ | Menos superficie, menos mantenimiento; algunas dimensiones esperan |
| B — ampliar ya | Sube alguna familia diferida a v1.0 (p.ej. trayectoria agéntica o safety/red-team) | Más código y frameworks externos (Inspect AI/Ragas) que mantener; más riesgo de fragilidad; retrasa el primer veredicto útil |
Mi inclinación: A. Porque el propósito declarado es auto-evaluar la calidad de tus respuestas, y para eso el subconjunto determinista + juez-calibrado da el 80% del valor con el 20% del riesgo. Las familias diferidas (dangerous-capability, GUI) además necesitan infraestructura pesada que hoy no aporta a tu pregunta original. PROBATOR y BEACON recomendaron explícitamente arrancar angosto y crecer. Qué me haría cambiar: que me digas que te urge medir ya una dimensión concreta — por ejemplo la fiabilidad agéntica de Ember, o la calidad del retrieval de tu memoria (RAG).
La pregunta esencial (lo único que solo tú pones): ¿confirmas el alcance acotado v1.0, o hay una familia diferida que quieres subir ahora porque te urge medirla?
Puedes responderla junto con tu revisión de la SPEC — y cuando me des GO, fabrico. Sin prisa.