--- episode_id: "6a6eb990-5580-46b4-a43c-088af340d8f1" puente_flat: "TRAZA_el-incidente-se-resolvi-solo-y-hay-que_S20260831.R5_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD" session_code: "S20260831.SID4EC5B030F7F0" acto_dialogico: "informar" actor_flujo: "multi_actor" criticidad_aegis: "low" skill_dominante: "NONE" fase_proyecto: "operations" tipo_semantico: "troubleshooting" summary_one_line: "EPISODIO 5 — Qdrant: ✅ El incidente se resolvió solo — y hay que corregir mi prop" source_type: "claude_code" trust_boundary: "internal" created_at: "2026-09-04T01:35:48.018795+00:00" relectura_tagged: false forgejo_commit_sha: "pending" --- # ✅ El incidente se resolvió solo — y hay que corregir mi propio reporte **Todo está sano ahora:** Qdrant responde 200 con sus 2.139 puntos en verde, el embedding devuelve vectores, y el contenedor pasó de `unhealthy` a **`healthy` hace un minuto**. Su propio log lo confirma: el mismo `GET /collections` que daba 401 en bucle ahora da 200, y el health-check pasó de 503 a 200. ## Corrección a lo que te dije hace dos turnos Te reporté "dos servicios distintos en 401" y sugerí mirar el stack de LiteLLM. **Eso era una lectura incompleta**, y la investigación que pediste la desmontó: - **No eran dos fallos**, sino uno solo con dos síntomas: mientras el contenedor arrancaba (recreado a las 01:16 UTC), *todas* sus dependencias respondían mal. - **La llave de OpenRouter nunca estuvo rota**: el endpoint de embeddings responde 200 con los tres nombres de modelo que probé. - **La llave de Qdrant tampoco**: su huella cambió entre mis dos mediciones (`256a2849` → `cf410f77`) porque el arranque aún estaba cargando la configuración cuando medí la primera vez. - **El `EMBEDDING_MODEL: gemini-embedding-001` que señalé como sospechoso era un falso positivo**: leí la variable de entorno cruda, pero la configuración efectiva resuelve al canónico `gemini-embedding-2`. Miré la sombra, no el hecho. `★ Insight ─────────────────────────────────────` **Diagnostiqué un contenedor a medio arrancar y lo llamé incidente.** Es el error de medir un sistema en transición y reportar el estado transitorio como permanente — exactamente la clase de fallo que el propio informe le reprocha a otros instrumentos. La lección operativa: ante un contenedor con minutos de vida, la primera pregunta no es *"¿qué está roto?"* sino *"¿ha terminado de arrancar?"*.