ember-memory-test/episodes/TRAZA_opcin-a-ejecutada-de-punta-a-punta-alu_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 4a119f6d5b feat(episode): TRAZA_opcin-a-ejecutada-de-punta-a-punta-alu_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: COMPASS | Type: chronicle
Summary: EPISODIO 1 — PROBATOR:  Opción A ejecutada de punta a punta — alumno v2 constru
2026-08-16 01:34:06 +00:00

3.4 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
765dc1a8-6bb5-4fb1-81d7-8cbf756618ba TRAZA_opcin-a-ejecutada-de-punta-a-punta-alu_S20260815.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260815.COMPASS_CURE_AUDITORIA informar multi_actor low COMPASS operations chronicle EPISODIO 1 — PROBATOR: Opción A ejecutada de punta a punta — alumno v2 construido claude_code internal 2026-08-16T01:34:04.055437+00:00 false pending

Opción A ejecutada de punta a punta — alumno v2 construido, examinado y committeado

Resultado en una frase: el alumno v2 (herencia de contexto + target descompuesto, tus palancas 1-2) casi triplica la métrica cabecera (7,9% → 21,1% en el subset derivable) pero sigue lejos de igualar al maestro — tu elección del híbrido queda ratificada por los datos, no solo por prudencia.

Métrica v1 v2 Población
exact 7,3% 12,3% global (n=494)
exact 7,9% 21,1% derivable — cabecera (n=76)
jaccard 0,126 0,240 global
direct-vs-skill 59,1% 71,5% global

Lo más revelador: la herencia de contexto carga la mejora — disparó en el 59% de los turnos, y en las queries que no dicen nada (similitud <0,15) el acierto saltó de 8,6% a 24,1%. El alumno ya aprendió el gesto correcto: cuando la query es muda, mirar la sesión. La descomposición mejora el overlap (jaccard ×1,9) pero el combo exacto de skills sigue esquivo. Todo con disciplina: umbrales fijados a priori, suite 14/14 (herencia estrictamente-anterior, desfragmentación, controles positivo/negativo), recomputo independiente coincidente, y el caveat pre-registrado de que la confirmación honesta será la próxima ventana fresca (mismo comando, --alumno v2).

Estado final de la sesión completa: auditoría multi-agente del plan (15 agentes + verificación adversarial) → corpus refrescado S20260815 → examen vencido saldado (v1 REPRUEBA, PROBATOR confirmó) → 3 instrumentos reparados (guard anti-máquina en routing-verifier: BLOCK 30d 23,2%→13,8%; variante bracket en panel-analitico; test v1.2 instalado 6/6) → tu decisión A implementada mismo día. Commits 75eaa1a6 + 046e8099 en los 3 remotos verificados por ls-remote. D-1 y D-2 quedan RESUELTAS en el DECISION; el detalle v2 en el EXAMEN §7.

Hice: alumno v2 implementado, testeado (14/14), examinado sobre las mismas 494 preguntas, documentado, committeado y pusheado 3/3. D-1 (híbrido) y D-2 (v2) registradas como resueltas. Falta: nada ejecutable por mí. Quedan 3 pendientes tuyos, ninguno urgente. Mi consejo: dejar que el espía acumule ~4-6 semanas de ventana fresca y re-examinar al v2 con el mismo comando — ese re-examen confirma o desmiente el caveat de sobreajuste gratis. Para avanzar (cuando quieras, no bloquea nada):

  • 🟡 D-3: GO-2 de T-30 Wave 1 (COMPASS → on-demand, ahorra 7.240 tok residentes; espera desde S20260719)
  • D-4: canonizar schema telemetría (routing.skill_primary anidado vs aplanar a 1.3)
  • Palanca 3: embeddings semánticos para un eventual alumno v3 (requiere infra LiteLLM)