ember-memory-test/episodes/DEPURA_r1seccion1i1-lo-primero-que-hay-que-ente_S20260719.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember cdbbae5289 feat(episode): DEPURA_r1seccion1i1-lo-primero-que-hay-que-ente_S20260719.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: BEACON | Type: troubleshooting
Summary: EPISODIO 2 — MNEMO_PRE_DIGEST: [R1.seccion1.I1] Lo primero que hay que entender:
2026-07-20 03:22:25 +00:00

3.5 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
8409c8fe-a750-4bb7-b6f6-4736136e69d9 DEPURA_r1seccion1i1-lo-primero-que-hay-que-ente_S20260719.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260719.ORACULO_RETRIEVAL_X09 informar multi_actor low BEACON operations troubleshooting EPISODIO 2 — MNEMO_PRE_DIGEST: [R1.seccion1.I1] Lo primero que hay que entender: tu ranking claude_code internal 2026-07-20T03:21:55.352219+00:00 false pending

Ya tengo la columna vertebral empírica del encargo. El workflow con los 14 agentes sigue corriendo (audita los 78 skills uno por uno, los 53 protocolos y el plan de Fable); mientras llega, te entrego lo que ya está medido y verificado — que es la parte más difícil de conseguir.

[R1.seccion1.I1] Lo primero que hay que entender: tu ranking anterior era una opinión

El documento docs/RANKING_PROTOCOLOS_EMBER.md (mayo 14) se declara a sí mismo, textualmente, confidence=soft_fact — inferencia subjetiva n=1, y pide "benchmarks N≥20 por protocolo para confidence=hard_fact". Su propio gate venció el 2026-05-28 y nadie lo renovó.

Lo que me pediste hoy es exactamente esa deuda declarada. Y la puedo pagar: el sistema llevaba registrando en silencio 4.053 turnos de enrutamiento real en compass_routing.jsonl, ventana 2026-05-03 → 2026-07-20. Eso ya no es opinión, es medición.

★ Insight ───────────────────────────────────── Por qué esto importa más de lo que parece: un ranking subjetivo se auto-confirma — invocas lo que crees útil, luego recuerdas haberlo usado, y eso "prueba" que era útil. La telemetría rompe ese circuito porque registra lo que pasó, no lo que creíste. Los tres skills que descubrí con uso cero no son los que hubieras adivinado. ─────────────────────────────────────────────────

[R1.seccion2.T1] Ranking real de uso — los que cargan el sistema

Medido sobre 4.053 turnos. La columna % es la fracción de turnos donde el skill estuvo activo.

# Skill / Protocolo Turnos % Naturaleza
1 COMPASS 2.774 68,4 % always-ON (enrutador)
2 GAUGE 2.487 61,4 % always-ON (medidor)
3 CODEX 1.155 28,5 % always-ON (sesión)
4 FORENSE 900 22,2 % on-demand (debugging)
5 RELOJERO 554 13,7 % on-demand (coding)
6 PROCEDENCIA 535 13,2 % protocolo (trazabilidad)
7 AEGIS 347 8,6 % on-demand (seguridad)
8 SCIENTIA 311 7,7 % on-demand (método)
9 PROBATOR 278 6,9 % adversarial
10 NARRATE 245 6,0 % protocolo
11 FORJA 232 5,7 % on-demand
12 CHRONICLE 226 5,6 % on-demand
13 PRÓLOGO 198+74 ~6,7 % protocolo (cuenta partida: aparece con y sin tilde)
14 CONCILIO 178 4,4 % meta-skill 13 lentes
15 MULTI-STORE-RETRIEVAL 155 3,8 % protocolo

Enrutamiento: L0 directo 1.953 · L1 un skill 1.545 · L2 cascada 555. Casi la mitad de tus turnos se resuelven sin cargar ningún skill — el pre-filtrado funciona.

Tipos de decisión detectados: D-ARCH 575 · D-EXTERNAL-PROPOSAL 142 · D-DEBUG-L3 112 · D-FABRICATE-SKILL 110 · D-AUDIT 109 · D-COMPARE 26.