ember-memory-test/episodes/EXPLORA_doc-veredicto_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember d0ea191635 feat(episode): EXPLORA_doc-veredicto_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: design
Summary: EPISODIO 1 — MNEMO: | Doc | Veredicto |
2026-07-19 19:41:03 +00:00

3.4 KiB

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
8fd5e702-404f-46cf-850d-04037be450ef EXPLORA_doc-veredicto_S20260719.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260719.ORACULO_RETRIEVAL_X09 informar multi_actor low NONE operations design EPISODIO 1 — MNEMO: | Doc | Veredicto | claude_code internal 2026-07-19T19:41:02.447797+00:00 false pending
Doc Veredicto
#2 Perplexity (survey) ALTO — base de la comparativa
#4 Reporte MemOS/Letta/Titans ALTO — el mejor para decidir stack
#5 Grok (blueprint) ALTO en rigor técnico — referencia para F4/E1
#1 Investigador-senior MEDIO-ALTO — trajo RAPTOR y Lost-in-the-Middle
#3 "hola plex" MEDIO-BAJO — bibliografía fabricada, ponderar menos

Conclusión del arco completo: ~15 papers + claims técnicos de Neo4j verificados en fuente primaria; tu plan v1.1 sale validado y reforzado por las 5 IAs; nada justifica cambiar el orden; y acumulamos R1-R6 + 2 blueprints de referencia para fases futuras.

  • Hice: integré el 5º doc (Grok), verifiqué sus claims de Neo4j contra la doc oficial (reales — mi sospecha refutada y declarada), determiné que es material para F4/E1 y no para el cuello actual, cerré la serie de 5 con ranking. Commit 0a6cc084 triple-remoto.
  • Falta: solo tu GO para el bump v1.2 del plan (R1-R6 + blueprints de referencia) y arrancar PRE-F2-ORACULO (read-only, insumos listos).
  • Mi consejo: la comparativa está completa y madura — no esperemos más documentos. El siguiente movimiento con mejor retorno es arrancar PRE-F2-ORACULO: es barato, no toca producción, y nos dice si la etapa 2 del diseño es viable antes de construir nada.
  • Para avanzar, elige: 🟢 A — GO v1.2 + arrancar PRE-F2-ORACULO ahora (recomendado) · 🟡 B — solo el bump v1.2 y PRE-F2 en la próxima sesión · C — pausa aquí; todo queda commiteado y documentado.

Push 40d3408a a los 3 remotos. El arco de ejecución arrancó y ya dio su primer veredicto medido.

🎯 PRE-F2-ORACULO: el experimento habló — y nos ahorró construir sobre arena

Entregables: PRE_F2_ORACULO_RESULTADO_S20260719.md (el acta) · golden_search_memories_check.py (F0) · ARCO §7 y PLAN sincronizados · CONSEJO + DECISION (PROBATOR PASSES).

El resultado, en sencillo

La pregunta del experimento era: si la búsqueda jerárquica eligiera SIEMPRE el tema correcto (un oráculo perfecto), ¿podría luego distinguir el turno exacto entre sus hermanos de sesión? La respuesta medida es no: acierta a la primera solo 12.6% (IC95 [8.9%, 15.7%]) — el criterio que tú y yo pre-registramos exigía ≥40%. Y el examen es confiable: el mismo harness reprodujo el 0.060 del baseline exacto (auto-chequeo de paridad), no hay sesiones-trampa infladas (0 singletons), y el intervalo completo queda bajo el umbral — no es mala suerte.