Skill: COMPASS | Type: chronicle
Summary: EPISODIO 1 — PROBATOR: ✅ Opción A ejecutada de punta a punta — alumno v2 constru
3.4 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 765dc1a8-6bb5-4fb1-81d7-8cbf756618ba | TRAZA_opcin-a-ejecutada-de-punta-a-punta-alu_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260815.COMPASS_CURE_AUDITORIA | informar | multi_actor | low | COMPASS | operations | chronicle | EPISODIO 1 — PROBATOR: ✅ Opción A ejecutada de punta a punta — alumno v2 construido | claude_code | internal | 2026-08-16T01:34:04.055437+00:00 | false | pending |
✅ Opción A ejecutada de punta a punta — alumno v2 construido, examinado y committeado
Resultado en una frase: el alumno v2 (herencia de contexto + target descompuesto, tus palancas 1-2) casi triplica la métrica cabecera (7,9% → 21,1% en el subset derivable) pero sigue lejos de igualar al maestro — tu elección del híbrido queda ratificada por los datos, no solo por prudencia.
| Métrica | v1 | v2 | Población |
|---|---|---|---|
| exact | 7,3% | 12,3% | global (n=494) |
| exact | 7,9% | 21,1% | derivable — cabecera (n=76) |
| jaccard | 0,126 | 0,240 | global |
| direct-vs-skill | 59,1% | 71,5% | global |
Lo más revelador: la herencia de contexto carga la mejora — disparó en el 59% de los turnos, y en las queries que no dicen nada (similitud <0,15) el acierto saltó de 8,6% a 24,1%. El alumno ya aprendió el gesto correcto: cuando la query es muda, mirar la sesión. La descomposición mejora el overlap (jaccard ×1,9) pero el combo exacto de skills sigue esquivo. Todo con disciplina: umbrales fijados a priori, suite 14/14 (herencia estrictamente-anterior, desfragmentación, controles positivo/negativo), recomputo independiente coincidente, y el caveat pre-registrado de que la confirmación honesta será la próxima ventana fresca (mismo comando, --alumno v2).
Estado final de la sesión completa: auditoría multi-agente del plan (15 agentes + verificación adversarial) → corpus refrescado S20260815 → examen vencido saldado (v1 REPRUEBA, PROBATOR confirmó) → 3 instrumentos reparados (guard anti-máquina en routing-verifier: BLOCK 30d 23,2%→13,8%; variante bracket en panel-analitico; test v1.2 instalado 6/6) → tu decisión A implementada mismo día. Commits 75eaa1a6 + 046e8099 en los 3 remotos verificados por ls-remote. D-1 y D-2 quedan RESUELTAS en el DECISION; el detalle v2 en el EXAMEN §7.
Hice: alumno v2 implementado, testeado (14/14), examinado sobre las mismas 494 preguntas, documentado, committeado y pusheado 3/3. D-1 (híbrido) y D-2 (v2) registradas como resueltas. Falta: nada ejecutable por mí. Quedan 3 pendientes tuyos, ninguno urgente. Mi consejo: dejar que el espía acumule ~4-6 semanas de ventana fresca y re-examinar al v2 con el mismo comando — ese re-examen confirma o desmiente el caveat de sobreajuste gratis. Para avanzar (cuando quieras, no bloquea nada):
- 🟡 D-3: GO-2 de T-30 Wave 1 (COMPASS → on-demand, ahorra 7.240 tok residentes; espera desde S20260719)
- ⚪ D-4: canonizar schema telemetría (
routing.skill_primaryanidado vs aplanar a 1.3) - ⚪ Palanca 3: embeddings semánticos para un eventual alumno v3 (requiere infra LiteLLM)