DGX Spark 跑 Nemotron 3 Nano Omni:56 tok/s、256k context、零雲費用
Nemotron 3 Nano Omni(30B-A3B MoE)2026-04-28 發布,256K context,影片/音頻/圖片/文字全支援。接上 Hermes Agent 跑在 DGX Spark 上,NVFP4 量化達到 56.96 tok/s。這篇拆解這個組合的技術細節和成本算術。
目錄+
Nemotron 3 Nano Omni 在 2026-04-28 上線,當天 NVIDIA 的示範 demo 就是接 Hermes Agent 跑。
這個組合不是偶然的。Nemotron 是 NVIDIA 在本地推理方向的旗艦開源模型,DGX Spark 是那台放在桌上、有 128GB 統一記憶體的 Grace Blackwell 機器。兩者放在一起,你可以在本地跑一個 256K context 的多模態 agent,不送一個 token 去雲端。
Nemotron 3 Nano Omni 是什麼
正式名稱:Nemotron-3-Nano-Omni-30B-A3B。MoE 架構,總參數 30B,每次推理只激活 3B。
這個 30B-A3B 的數字說明了一件事:你用 3B 的算力,卻能調用 30B 的知識庫。MoE(Mixture of Experts)的邏輯就是這樣——大多數 token 只需要動用部分專家。
模型規格(NVIDIA 官方):
| 項目 | 數值 |
|---|---|
| 參數 | 30B 總 / 3B 活躍 |
| Context 長度 | 256K tokens |
| 架構 | 混合 MoE(Mamba + Transformer) |
| 模態 | 文字、圖片、音頻、影片 |
| 授權 | Apache 2.0 |
影片處理用 Conv3D 和 EVS(Efficient Video Sampling)。音頻走 Parakeet encoder,同一個 context window 裡處理轉錄、語音問答和音樂分析。NVIDIA 說跟其他開源 omni 模型比,video 場景吞吐量高 9.2 倍,多文件場景高 7.5 倍。
現在可以在 Hugging Face、OpenRouter(有免費 tier)和 build.nvidia.com 取得。
DGX Spark 的關鍵數字
DGX Spark 是 Grace Blackwell GB10,128GB LPDDR5X 統一記憶體。CPU 和 GPU 用同一塊記憶體,不需要 PCIe 傳輸。
幾個你需要知道的數字:
- CUDA 可見記憶體:121.7 GiB(128GB 實體,CUDA 因為 overhead 只能用 121.7 GiB)
- 記憶體頻寬:273 GB/s(LPDDR5X,這是瓶頸所在)
- 售價:約 3,999 漲到這裡)
273 GB/s 的頻寬是 DGX Spark 的天花板。跑小模型(8B 以下)你會被頻寬卡住,不是算力。但跑 30B 以上的 MoE,Spark 的 128GB 讓你根本不需要考慮量化策略——直接裝進去。
56.96 tok/s 是怎麼跑出來的
NVIDIA Developer Forums 上有詳細的 benchmark 記錄(2026-04-22):Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4,在 DGX Spark 上用 vLLM 跑出 56.96 tok/s。
NVFP4 不是「q8」意義上的大幅壓縮,是 NVIDIA Blackwell 架構原生支援的 4-bit 浮點格式。幾個關鍵的環境變數讓這個數字成立:
VLLM_NVFP4_GEMM_BACKEND=marlin
VLLM_USE_FLASHINFER_MOE_FP4=0
VLLM_MARLIN_USE_ATOMIC_ADD=1
加上 --mamba-ssm-cache-dtype float32 和 --video-pruning-rate 0.5。
56.96 tok/s 是文字生成的速度。同一個模型在影片推理場景下,吞吐量優勢更明顯(NVIDIA 自家 benchmark 說 9.2x 系統效率提升)。
接 Hermes Agent
NVIDIA 自己的發布 demo 就是拿 Hermes Agent 當示範框架。實際接法:在 Hermes 的 .env 裡設定:
NVIDIA_API_KEY=your-nim-key # 用 NIM,或改用 OpenRouter 免費 tier
Hermes 把 Nemotron 當作支援 OpenAI-compatible endpoint 的模型接入,本地跑就指向 vLLM 的 localhost:8000。你對 agent 說「看這個影片」或「聽這段音頻」,context 窗口的 256K 讓你不需要切片。
Hermes 在 OpenRouter 上的 /models 目前已列出 nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free,有免費 tier 可以先測試再決定要不要拉到本地。
成本算術
本地跑(DGX Spark + Nemotron NVFP4):
- 硬體一次性費用:約 $4,699
- 每 token 費用:$0(用電費計算,一台桌機的電費)
- 優勢:256K context 無限跑、影片/音頻 multimodal 不另計費
雲端 API 跑(build.nvidia.com NIM):
- 按 token 計費,長 context 任務費用累積快
- 影片/音頻 multimodal token 計費更貴
OpenRouter 免費 tier:
- 有速率限制,適合測試和低頻使用
說直接一點:256K context 是本地推理最有感的地方。你跑一個長文件分析 agent,或者讓 Hermes 記住整份會議記錄,雲端 API 的費用會讓你開始斟酌每次 call。本地跑你直接放開跑。
DGX Spark 不是「比 RTX 5090 快」的機器——它的 273 GB/s 頻寬跑 dense 模型會輸給 5090 的 1.8 TB/s。Spark 的意義是「128GB CUDA 記憶體放在桌上」。跑 MoE、跑 multimodal、跑需要大 context 的 agent loop——這些才是它的主場。
兩顆連接的情境
兩台 DGX Spark 用 200 Gb/s QSFP 連接,可以聯合跑 405B 參數的模型(NVIDIA 官方數據)。如果你的工作場景需要 405B FP4 的本地推理,這是目前市面上可以買到的最低成本路徑。
如果你在考慮本地推理的完整方案,記憶體頻寬和 context 長度是兩個比 tok/s 更重要的決策維度。DGX Spark + Nemotron 3 Nano Omni 的組合,目前在這兩個維度上同時對齊的開源方案不多。
Hermes Agent 的創意工具整合(ComfyUI、TouchDesigner、HyperFrames)見這篇,SuperGrok OAuth 整合見這篇。
跑長任務需要穩定的工作環境。桌面 4 件套(鍵盤、USB-C Hub、螢幕掛燈、站立書架)對於本地 AI 開發工作很有幫助——舒適的工作環境直接影響效率和代碼質量。