Skill: NONE | Type: troubleshooting Summary: EPISODIO 1 — MEMORIA: Opinión de Fable: qué blueprint de NVIDIA sirve como labor
2.6 KiB
| episode_id | puente_flat | session_code | acto_dialogico | actor_flujo | criticidad_aegis | skill_dominante | fase_proyecto | tipo_semantico | summary_one_line | source_type | trust_boundary | created_at | relectura_tagged | forgejo_commit_sha |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 9bc57175-239f-4837-a073-84126096328e | TRAZA_opinin-de-fable-qu-blueprint-de-nvidia-s_S20260913.R1_XX.ops.2.hot_inf.in.cc.es.000.MGQ_J.PMCFK_E.SGNFD | S20260913.SIDE55529A2E3F4 | informar | multi_actor | low | NONE | operations | troubleshooting | EPISODIO 1 — MEMORIA: Opinión de Fable: qué blueprint de NVIDIA sirve como laborat | claude_code | internal | 2026-09-13T19:08:23.381572+00:00 | false | pending |
Opinión de Fable: qué blueprint de NVIDIA sirve como laboratorio Ember en la DGX Spark GB10
Respuesta corta: ningún blueprint del catálogo se instala "tal cual" como laboratorio Ember. El que mejor encaja como arquitectura objetivo es AI-Q Blueprint for intelligent agents (agente que conecta, recupera y razona sobre datos propios), y la forma correcta de montarlo en la Spark es por la ruta nativa de playbooks de DGX Spark (rag-ai-workbench + nim-llm/vllm + txt2kg + open-webui), no por el paquete de datacenter. Lo que sigue es el porqué.
Lo verificado hoy (hard_fact, dos lecturas web). El catálogo tiene 32 blueprints. Solo cinco tocan RAG o recuperación de documentos: Enterprise RAG Pipeline, AI-Q, Nsight Copilot (el único que dice literalmente "on DGX Spark" con RAG), Streaming Data to RAG (radio y sensores, nicho) y VSS (video). La familia NemoClaw (Hermes Agent, OpenClaw, Deep Agents Code) aparece a la vez en blueprints y en los playbooks de Spark, lo que confirma soporte oficial en esa máquina. La página de Spark lista playbooks de servicio local (vllm, trt-llm, nim-llm, llama-cpp, sglang), de conocimiento (rag-ai-workbench, txt2kg, nemoclaw), interfaz (open-webui) y clúster de 2 o 3 Sparks.
La restricción real de la GB10 (soft_fact, spec pública, no re-medida hoy). Es ARM64 (Grace) con 128 GB de memoria unificada a unos 273 GB/s. La capacidad sobra; el ancho de banda no. Por eso los modelos MoE (mezcla de expertos, pocos parámetros activos por token) rinden bien y los densos de 70B se arrastran. Eso coincide con la nota que ya guardaste en memoria: "GB10 solo MoE". Los blueprints Enterprise RAG y AI-Q fueron diseñados para x86 con varias GPU H100/L40S y 4 o 5 microservicios NIM simultáneos más Milvus GPU. Portarlos entero exige que cada NIM tenga imagen ARM64, cosa parcial y que hay que verificar contenedor por contenedor antes de prometer nada.
Ranking para Ember (inference de Fable):