feat(episode): TRAZA_respuesta-a-tu-pregunta-s-va-openrouter_S20260705.R29_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD
Skill: NEXUS | Type: troubleshooting Summary: EPISODIO 29 — Prompt Injection: Respuesta a tu pregunta: SÍ, vía OpenRouter — ve
This commit is contained in:
parent
95737332b1
commit
fe6441c2ad
1 changed files with 48 additions and 0 deletions
|
|
@ -0,0 +1,48 @@
|
||||||
|
---
|
||||||
|
episode_id: "7e4446a7-97e0-42ad-9f2a-ec2803cf736d"
|
||||||
|
puente_flat: "TRAZA_respuesta-a-tu-pregunta-s-va-openrouter_S20260705.R29_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD"
|
||||||
|
session_code: "S20260705.EVAL_INSTRUMENT_FORGE_SKILL"
|
||||||
|
acto_dialogico: "informar"
|
||||||
|
actor_flujo: "multi_actor"
|
||||||
|
criticidad_aegis: "low"
|
||||||
|
skill_dominante: "NEXUS"
|
||||||
|
fase_proyecto: "operations"
|
||||||
|
tipo_semantico: "troubleshooting"
|
||||||
|
summary_one_line: "EPISODIO 29 — Prompt Injection: Respuesta a tu pregunta: SÍ, vía OpenRouter — verificado liv"
|
||||||
|
source_type: "claude_code"
|
||||||
|
trust_boundary: "internal"
|
||||||
|
created_at: "2026-07-12T15:16:09.921652+00:00"
|
||||||
|
relectura_tagged: false
|
||||||
|
forgejo_commit_sha: "pending"
|
||||||
|
---
|
||||||
|
|
||||||
|
✅ Commit `cf9a070` push **3/3**. **A4 queda cerrado de verdad** — y por tu idea, mejor que el plan original: sin rotar ningún secreto.
|
||||||
|
|
||||||
|
## Respuesta a tu pregunta: SÍ, vía OpenRouter — verificado live
|
||||||
|
|
||||||
|
Tu intuición era la correcta. Lo que descubrimos juntos:
|
||||||
|
|
||||||
|
1. **OpenRouter funciona** — la key ya presente (`sk-or-v1`, válida) alcanza **340 modelos** de familias distintas con una sola credencial. El carril cross-provider de A4 **corre HOY** sin tocar la key Anthropic muerta.
|
||||||
|
2. **Número real medido** (n=6): descorrelación **0.5–0.667** entre gpt/claude/gemini → el gate (≥0.30) pasa, cross-provider **sí aporta**.
|
||||||
|
3. **El matiz que importa** (reproduce el paper en tu infra): en conteo de caracteres las 3 familias **erraron juntas** (claude+gemini dieron el mismo `12` equivocado) — punto ciego compartido de tokenización. En aritmética erraron independientes. → **cross-provider descorrelaciona por tipo de tarea, no siempre.** Eso valida la versión *refinada* de la gem #2 (elegir por descorrelación MEDIDA, no por marca).
|
||||||
|
|
||||||
|
**Implicación práctica:** el Anthropic-key-muerta (task_1f690646) **ya NO bloquea** A4 — OpenRouter lo cubre. Rotarla sigue valiendo para usar `claude-sonnet` *directo* vía el proxy, pero es opcional ahora. Y tu script `crossprovider_decorrelation_spike.py` ya habla OpenRouter tal cual (endpoint OpenAI-compatible: `LITELLM_BASE_URL=https://openrouter.ai/api/v1`).
|
||||||
|
|
||||||
|
Re-test limpio — **ahora sí, lectura honesta y positiva:**
|
||||||
|
|
||||||
|
| Ítem | gold | nemotron:free | nota |
|
||||||
|
|---|---|---|---|
|
||||||
|
| contar 'a' (abracadabra…) | 11 | **FINAL=11 ✓** | ¡acertó lo que gpt(7) y claude(9) fallaron! (1574 chars de razonamiento) |
|
||||||
|
| 137×149 | 20413 | **20413 ✓** | conciso |
|
||||||
|
| contar 's' en mississippi | 4 | **502 ResourceExhausted** | límite del free-tier NVIDIA, no error de modelo |
|
||||||
|
| 2¹³−1 | 8191 | **8191 ✓** | ✓ |
|
||||||
|
|
||||||
|
**En los 3 ítems que pasaron: 3/3 correcto (rate 0.000).** El 0.833 anterior era 100% artefacto (truncación + 502), descartado.
|
||||||
|
|
||||||
|
## Mi lectura para EMBER
|
||||||
|
|
||||||
|
**Lo bueno (real):** es un **modelo de razonamiento gratis, 1M de contexto, familia NVIDIA distinta** — y su perfil de error **descorrelaciona bien**: acertó el conteo de caracteres donde los modelos rápidos (flash/mini) comparten punto ciego. Eso es *exactamente* lo que quieres en un verificador cross-provider: un 2º juez que falla en cosas DISTINTAS. A costo cero es un candidato fuerte.
|
||||||
|
|
||||||
|
**La pega (real, verificada):** el tier `:free` te lanza **`502 ResourceExhausted: Worker local total request limit reached (119/32)`** — throttling compartido de NVIDIA. **No sirve para hot-path ni volumen** (1 de 4 llamadas murió). Encaja justo en su nicho declarado: **verificación adversarial ocasional / deep-research / eval batch offline**, donde latencia y rate-limit no importan y el $0 es oro. Para volumen: tier pagado o self-host (pesos abiertos en HF).
|
||||||
|
|
||||||
|
**Veredicto:** sí, vale como **4ª familia gratis para el carril cross-provider de verificación puntual** (no hot-path). Complementa bien a gemini-flash por su perfil de razonamiento.
|
||||||
Loading…
Reference in a new issue