feat(episode): TRAZA_la-ltima-decisin-cunto-abarca-la-v10_S20260705.R22_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: design
Summary: EPISODIO 22 — BLINDADAS: 📖 La última decisión: ¿cuánto abarca la v1.0?
This commit is contained in:
parent
5570f55b8e
commit
86e04248f7
1 changed files with 38 additions and 0 deletions
|
|
@ -0,0 +1,38 @@
|
||||||
|
---
|
||||||
|
episode_id: "10f589e5-de9f-41f2-a141-bff2ae1004a8"
|
||||||
|
puente_flat: "TRAZA_la-ltima-decisin-cunto-abarca-la-v10_S20260705.R22_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260705.EVAL_INSTRUMENT_FORGE_SKILL"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "NONE"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "design"
|
||||||
|
summary_one_line: "EPISODIO 22 — BLINDADAS: 📖 La última decisión: ¿cuánto abarca la v1.0?"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-07-12T16:16:36.966817+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
✅ **Golden set = fuente externa** queda fijado en la SPEC (§10, §13) y en la DECISIÓN (RR3 cerrado). Default propuesto: **SWE-bench Verified** (500 bugs reales de GitHub, human-filtered) — si prefieres otra fuente, me dices.
|
||||||
|
|
||||||
|
Con eso quedan resueltas **2 de las 3 decisiones de diseño** (golden set externo ✅ · guardrails bloqueantes ✅). Te enmarco la **última** — el alcance de v1.0 — con su historia, y luego quedo esperando tu revisión de la SPEC + GO.
|
||||||
|
|
||||||
|
## 📖 La última decisión: ¿cuánto abarca la v1.0?
|
||||||
|
|
||||||
|
**Reframe:** no es "¿qué puede hacer el skill?" (la SPEC ya define las 9 familias) — es **"¿v1.0 intenta hacer de todo desde el día 1, o domina primero lo que da evidencia confiable y crece después?"**
|
||||||
|
|
||||||
|
**Los dos caminos:**
|
||||||
|
|
||||||
|
| Camino | Qué incluye v1.0 | Costo |
|
||||||
|
|---|---|---|
|
||||||
|
| **A — acotado** *(recomendado)* | Lo **determinista** (pass@k, exact-match+SymPy, IFEval, Recall@k, ablation-F) + **juez calibrado** (calidad abierta, RAG). Difiere multimodal, privacidad, reward-model, frontier-safety, GUI/computer-use a v1.1+ | Menos superficie, menos mantenimiento; algunas dimensiones esperan |
|
||||||
|
| **B — ampliar ya** | Sube alguna familia diferida a v1.0 (p.ej. trayectoria agéntica o safety/red-team) | Más código y frameworks externos (Inspect AI/Ragas) que mantener; más riesgo de fragilidad; retrasa el primer veredicto útil |
|
||||||
|
|
||||||
|
**Mi inclinación: A.** Porque el propósito declarado es **auto-evaluar la calidad de tus respuestas**, y para eso el subconjunto determinista + juez-calibrado da el 80% del valor con el 20% del riesgo. Las familias diferidas (dangerous-capability, GUI) además necesitan infraestructura pesada que hoy no aporta a tu pregunta original. PROBATOR y BEACON recomendaron explícitamente arrancar angosto y crecer. **Qué me haría cambiar:** que me digas que te urge medir *ya* una dimensión concreta — por ejemplo la fiabilidad agéntica de Ember, o la calidad del retrieval de tu memoria (RAG).
|
||||||
|
|
||||||
|
**La pregunta esencial (lo único que solo tú pones):** ¿**confirmas el alcance acotado v1.0**, o hay **una familia diferida que quieres subir ahora** porque te urge medirla?
|
||||||
|
|
||||||
|
Puedes responderla junto con tu revisión de la SPEC — y cuando me des GO, fabrico. Sin prisa.
|
||||||
Loading…
Reference in a new issue