ember-memory-test/episodes/DEPURA_el-escaneo-con-un-giro-que-ya-te-respon_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD.md
Ember 4885b03033 feat(episode): DEPURA_el-escaneo-con-un-giro-que-ya-te-respon_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NONE | Type: design
Summary: EPISODIO 1 — BLINDADAS: El escaneo — con un giro que ya te responde
2026-07-12 15:20:47 +00:00

2.1 KiB
Raw Blame History

episode_id puente_flat session_code acto_dialogico actor_flujo criticidad_aegis skill_dominante fase_proyecto tipo_semantico summary_one_line source_type trust_boundary created_at relectura_tagged forgejo_commit_sha
fefafa78-2048-4bee-b503-fcfed07d055e DEPURA_el-escaneo-con-un-giro-que-ya-te-respon_S20260705.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD S20260705.EVAL_INSTRUMENT_FORGE_SKILL informar multi_actor low NONE operations design EPISODIO 1 — BLINDADAS: El escaneo — con un giro que ya te responde claude_code internal 2026-07-12T15:17:56.372348+00:00 false pending

El escaneo — con un giro que ya te responde

Commit 2f5aad4, push 3/3. docs/ESCANEO_OPENROUTER_MODELO_CODING_S20260705.md. John, tu instinto de canal es 100% correcto: LUMEN sin GPU no sirve, y OpenRouter vía LiteLLM es el camino — EMBER ya lo usa así para los embeddings. Pero el escaneo destapó algo que ya resuelve la pregunta, y te lo digo directo porque es lo honesto:

El giro (antes de la tabla)

Tu decisión de deploy ya contestó el frente modelo-débil. El test que quedaba abierto era "¿RELOJERO ayuda a un modelo débil?". Pero tú no vas a desplegar un modelo débil — vas a usar uno fuerte-y-barato. Y esos, en tareas acotadas, hacen techo igual que Opus (aciertan todo → el mismo empate CB=+0.000). O sea:

  • Para tu realidad (EMBER corriendo coding en un fuerte-barato): el valor de RELOJERO en correctitud sigue siendo marginal — el mismo hallazgo, ahora sobre el modelo que de verdad usarás. - El frente modelo-débil solo importaba si ibas a desplegar un modelo débil. Al elegir fuerte-barato, quedó moot para producción. Por eso el mejor uso de OpenRouter aquí no es "probar un débil" — es escalar el AB-LAB a N≥30 barato con un modelo capaz como runner, y sellar la estadística del hallazgo principal (el peer-review marcó que N=5 con techo era poder débil). Convierte tu idea en su versión de máximo valor.