跳到主要內容
DGX Spark 跑 Nemotron 3 Nano Omni:56 tok/s、256k context、零雲費用
/閱讀約 6 分鐘/

DGX Spark 跑 Nemotron 3 Nano Omni:56 tok/s、256k context、零雲費用

Nemotron 3 Nano Omni(30B-A3B MoE)2026-04-28 發布,256K context,影片/音頻/圖片/文字全支援。接上 Hermes Agent 跑在 DGX Spark 上,NVFP4 量化達到 56.96 tok/s。這篇拆解這個組合的技術細節和成本算術。

目錄+

Nemotron 3 Nano Omni 在 2026-04-28 上線,當天 NVIDIA 的示範 demo 就是接 Hermes Agent 跑。

這個組合不是偶然的。Nemotron 是 NVIDIA 在本地推理方向的旗艦開源模型,DGX Spark 是那台放在桌上、有 128GB 統一記憶體的 Grace Blackwell 機器。兩者放在一起,你可以在本地跑一個 256K context 的多模態 agent,不送一個 token 去雲端。


Nemotron 3 Nano Omni 是什麼

正式名稱:Nemotron-3-Nano-Omni-30B-A3B。MoE 架構,總參數 30B,每次推理只激活 3B。

這個 30B-A3B 的數字說明了一件事:你用 3B 的算力,卻能調用 30B 的知識庫。MoE(Mixture of Experts)的邏輯就是這樣——大多數 token 只需要動用部分專家。

模型規格(NVIDIA 官方):

項目數值
參數30B 總 / 3B 活躍
Context 長度256K tokens
架構混合 MoE(Mamba + Transformer)
模態文字、圖片、音頻、影片
授權Apache 2.0

影片處理用 Conv3D 和 EVS(Efficient Video Sampling)。音頻走 Parakeet encoder,同一個 context window 裡處理轉錄、語音問答和音樂分析。NVIDIA 說跟其他開源 omni 模型比,video 場景吞吐量高 9.2 倍,多文件場景高 7.5 倍。

現在可以在 Hugging Face、OpenRouter(有免費 tier)和 build.nvidia.com 取得。


DGX Spark 的關鍵數字

DGX Spark 是 Grace Blackwell GB10,128GB LPDDR5X 統一記憶體。CPU 和 GPU 用同一塊記憶體,不需要 PCIe 傳輸。

幾個你需要知道的數字:

  • CUDA 可見記憶體:121.7 GiB(128GB 實體,CUDA 因為 overhead 只能用 121.7 GiB)
  • 記憶體頻寬:273 GB/s(LPDDR5X,這是瓶頸所在)
  • 售價:約 4,699(2026年因為LPDDR5X缺貨漲了184,699(2026 年因為 LPDDR5X 缺貨漲了 18%,Founders Edition 從 3,999 漲到這裡)

273 GB/s 的頻寬是 DGX Spark 的天花板。跑小模型(8B 以下)你會被頻寬卡住,不是算力。但跑 30B 以上的 MoE,Spark 的 128GB 讓你根本不需要考慮量化策略——直接裝進去。


56.96 tok/s 是怎麼跑出來的

NVIDIA Developer Forums 上有詳細的 benchmark 記錄(2026-04-22):Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4,在 DGX Spark 上用 vLLM 跑出 56.96 tok/s。

NVFP4 不是「q8」意義上的大幅壓縮,是 NVIDIA Blackwell 架構原生支援的 4-bit 浮點格式。幾個關鍵的環境變數讓這個數字成立:

VLLM_NVFP4_GEMM_BACKEND=marlin
VLLM_USE_FLASHINFER_MOE_FP4=0
VLLM_MARLIN_USE_ATOMIC_ADD=1

加上 --mamba-ssm-cache-dtype float32 和 --video-pruning-rate 0.5。

56.96 tok/s 是文字生成的速度。同一個模型在影片推理場景下,吞吐量優勢更明顯(NVIDIA 自家 benchmark 說 9.2x 系統效率提升)。


接 Hermes Agent

NVIDIA 自己的發布 demo 就是拿 Hermes Agent 當示範框架。實際接法:在 Hermes 的 .env 裡設定:

NVIDIA_API_KEY=your-nim-key   # 用 NIM,或改用 OpenRouter 免費 tier

Hermes 把 Nemotron 當作支援 OpenAI-compatible endpoint 的模型接入,本地跑就指向 vLLM 的 localhost:8000。你對 agent 說「看這個影片」或「聽這段音頻」,context 窗口的 256K 讓你不需要切片。

Hermes 在 OpenRouter 上的 /models 目前已列出 nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free,有免費 tier 可以先測試再決定要不要拉到本地。


成本算術

本地跑(DGX Spark + Nemotron NVFP4):

  • 硬體一次性費用:約 $4,699
  • 每 token 費用:$0(用電費計算,一台桌機的電費)
  • 優勢:256K context 無限跑、影片/音頻 multimodal 不另計費

雲端 API 跑(build.nvidia.com NIM):

  • 按 token 計費,長 context 任務費用累積快
  • 影片/音頻 multimodal token 計費更貴

OpenRouter 免費 tier:

  • 有速率限制,適合測試和低頻使用

說直接一點:256K context 是本地推理最有感的地方。你跑一個長文件分析 agent,或者讓 Hermes 記住整份會議記錄,雲端 API 的費用會讓你開始斟酌每次 call。本地跑你直接放開跑。

DGX Spark 不是「比 RTX 5090 快」的機器——它的 273 GB/s 頻寬跑 dense 模型會輸給 5090 的 1.8 TB/s。Spark 的意義是「128GB CUDA 記憶體放在桌上」。跑 MoE、跑 multimodal、跑需要大 context 的 agent loop——這些才是它的主場。


兩顆連接的情境

兩台 DGX Spark 用 200 Gb/s QSFP 連接,可以聯合跑 405B 參數的模型(NVIDIA 官方數據)。如果你的工作場景需要 405B FP4 的本地推理,這是目前市面上可以買到的最低成本路徑。


如果你在考慮本地推理的完整方案,記憶體頻寬和 context 長度是兩個比 tok/s 更重要的決策維度。DGX Spark + Nemotron 3 Nano Omni 的組合,目前在這兩個維度上同時對齊的開源方案不多。

Hermes Agent 的創意工具整合(ComfyUI、TouchDesigner、HyperFrames)見這篇,SuperGrok OAuth 整合見這篇。

跑長任務需要穩定的工作環境。桌面 4 件套(鍵盤、USB-C Hub、螢幕掛燈、站立書架)對於本地 AI 開發工作很有幫助——舒適的工作環境直接影響效率和代碼質量。