ember-memory-test/episodes/DEPURA_qu-constru_S20260703.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 8723496e46 feat(episode): DEPURA_qu-constru_S20260703.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: troubleshooting
Summary: EPISODIO 2 — BLINDADAS: Qué construí
2026-07-12 16:11:30 +00:00

2.4 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
63fe7a1d-6447-452c-b7c6-1bed4ed57a12 DEPURA_qu-constru_S20260703.R2_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260703.ANTI_OLVIDO_ESTADO_VIVO informar multi_actor low NONE operations troubleshooting EPISODIO 2 — BLINDADAS: Qué construí claude_code internal 2026-07-12T16:11:21.614946+00:00 false pending

Listo, John. Paso 2 del ciclo de honestidad completo y verificado.

Qué construí

El juez BVB — un LLM-as-judge que puntúa mis respuestas contra los 3 supra-valores Φ (Bello/Verdadero/Bondadoso de rules/phi-values.md), agregados por media geométrica (si una dimensión cae a 0, el score colapsa — coherente con Ley Zero). Es el instrumento que ataca el gap #1: por fin algo mide la calidad real de mis respuestas a ti, no la higiene del repo.

  • 📄 bvb_judge.py — 8 micro-mecanismos ≤40 líneas (media geométrica=fold, prompt=template, parse=guard+validación, LLM=adapter urllib sin deps, batch=iteración con acumulador). Empareja query↔respuesta reusando tu extractor (sin duplicar). Key desde env, nunca hardcode. Modo --mock offline + modo live vía LiteLLM.
  • 📄 test_bvb_judge.py20 tests verdes, incluidas property-based Hypothesis (desigualdad AM-GM, clamp siempre en rango).
  • 📄 README sincronizado (paso 2 marcado hecho).

Verificado empíricamente: demo --mockphi_score 8.0, ok:true; pytest -q20 passed. RELOJERO completo (contrato + descomposición + verificación triple capa).

Lo que resta para cerrar el paso 2 del todo

El scaffold está probado, pero la medición real necesita dos cosas que no puedo hacer desde aquí:

  1. Corrida LIVE contra LiteLLM — necesita el servidor MEMORIA arriba + LITELLM_BASE_URL/LITELLM_API_KEY en entorno (el boot marcó el canal SSH/LiteLLM caído, y sin key el juez fuerza --mock). Ese run daría el mean_phi real de una muestra de mis respuestas.
  2. Dimensión 12 calidad_respuesta en scripts/rubrica_100.py con ese mean_phi — así la rúbrica deja de medir solo el repo.