Grok 4.3、Blackwell、Nemotron:2026 年推理成本大戰已打響
同一天,xAI 發佈 Grok 4.3、NVIDIA 宣稱 Blackwell 讓 DeepSeek V4 成本降 20 倍、Nemotron 3 Super 登頂開源 agentic 榜。這不是巧合——推理的競爭軸線已從「誰更聰明」轉向「誰能讓 agent 跑得更便宜」。
目錄+
2026 年 5 月 5 日,三件事在 24 小時之內同時發生。
xAI 宣布 Grok 4.3 上線 API,登頂 ArtificialAnalysis agentic tool calling 排行榜。NVIDIA Data Center 宣稱 Blackwell 讓 DeepSeek V4 推論成本降低 20 倍。NVIDIA AI 公布 Nemotron 3 Super 成為 EnterpriseOps-Gym 開源榜第一。
三個陣營,一個共同訊號:benchmark accuracy 已不再是主戰場,成本與 agentic 效能才是 2026 年推理基礎設施的競爭核心。
Grok 4.3:最快、最能用工具的模型
xAI 對 Grok 4.3 的定位很直白:最快、最聰明、工具調用最強。數字支撐這個說法——
- ArtificialAnalysis leaderboard agentic tool calling:第一名
- ArtificialAnalysis instruction following:第一名
- ValsAI CaseLaw v2:第一名
- ValsAI Corporate Finance:第一名
- tau²-Bench Telecom:98%
這些排行榜測的都不是傳統的數學推理或知識廣度,而是「模型在真實工具調用場景下能不能可靠地執行任務」。這個轉變本身就是訊號——評測社群也在跟著 agentic workloads 移動。
定價是 $1.25 per 1M input tokens、$2.50 per 1M output tokens,1M token context。相較之下,Grok 4.3 推理常駐、不可關閉,意味著每一次調用都包含完整的思維鏈成本。
值得一提的侷限:在 GDPval-AA(一個評測跨域規劃能力的 benchmark)上,Grok 4.3 仍落後 GPT-5.5(xhigh)276 Elo。工具調用頂尖,不代表所有維度都頂尖。
NVIDIA Blackwell + DeepSeek V4:20 倍成本下降
NVIDIA 的聲明更激進:Blackwell 讓 DeepSeek V4 的推論成本,開箱即降低 20 倍。
DeepSeek V4(V4-Pro)的規格是:1.6T 總參數、49B active 參數、1M token context。這是目前最大的公開開源模型。在這個規模上宣稱 20 倍成本降幅,背後是幾個工程層面的疊加:
- KV cache 壓縮:V4 相比 V3.2,KV cache 需求壓縮 90%,大幅降低記憶體頻寬壓力
- GB300(Blackwell Ultra)吞吐量:初步測試達 3,500 tokens/sec(整個系統),對長 context agentic 工作流來說是質變
- 五套 rack-scale 系統協同設計:NVIDIA 強調這是端到端共同設計的結果,不是單一 GPU 的獨立優化
20 倍是 NVIDIA 官方數字,需要在相同基準條件下驗證。但方向不會錯——MoE 架構的 sparse activation、壓縮 KV cache、加上 Blackwell 的硬體效率,這三件事疊在一起,確實會讓成本曲線大幅下移。
對開發者來說,這代表什麼?過去因為成本而不敢讓 agent 多輪呼叫的設計,現在可以重新評估了。
如果你打算在本地跑這類大型 MoE 推論,NVIDIA Blackwell 架構的工作站顯卡是目前最直接的切入點。麗臺 RTX PRO 5000 Blackwell 48GB 提供 48GB VRAM,本地跑 70B 量化模型或測試 MoE 架構的推論效能都夠用。
Nemotron 3 Super:開源 agentic 新基準
NVIDIA AI 同一天公布的另一件事同樣值得關注:Nemotron 3 Super 拿下 EnterpriseOps-Gym 開源榜第一。
這個 benchmark 的設計比傳統學術 benchmark 更接近真實企業部署情境:
- 1,150 個任務,涵蓋 8 個企業 domain
- 512 個 functional tools,模擬真實工具調用的複雜度
- 完全互動環境——不是靜態問答,是需要多步驟操作的 agent loop
Nemotron 3 Super 的架構是 MoE hybrid Mamba-Transformer:120B 總參數,12B active 參數。EnterpriseOps-Gym 平均分 27.3,擊敗 Kimi-K2.5(#2)、DeepSeek V3.2(#3)、GPT-OSS-120B(#5)。
12B active 參數、開源、企業 agentic 榜第一——這個組合的意義在於:效率和能力不再是非此即彼的取捨。Nemotron 3 Super 用 12B 的推論成本,在企業 agent 工作上打敗了更大的模型。
三件事的交叉點:競爭軸線已轉移
把這三個消息放在一起看,有一個共同的方向:
推理基礎設施的競爭,從「誰的模型更聰明」移向「誰能讓 agentic workloads 跑得更便宜、更可靠」。
這是有結構性原因的。當模型能力在頂端趨於收斂,差異化的空間就往下游移動——推論框架、硬體效率、工具調用可靠性、企業 domain 準確度。Grok 4.3 拿 agentic tool calling 榜第一,而不是數學推理榜第一;NVIDIA 用「20 倍成本降低」當標題,而不是「更高 benchmark 分數」;Nemotron 3 Super 選擇在企業 agent loop 上競爭,而不是在 MMLU 上。
這不是三個獨立的 PR 決策,是同一個市場訊號在三個產品上的反映。
開放的問題
Agent 的邊際推論成本降到什麼程度,才算真正普及?
目前大型 agentic pipeline 的主要障礙不是模型能不能做——而是每一次多步驟推論的累積成本,讓大多數中小型團隊還是不敢部署。Blackwell 的 20 倍成本降幅、Nemotron 的高效率 MoE、Grok 4.3 的 $1.25/1M token 定價,都在把這條線往下拉。
但「普及」的臨界點在哪?是每次 agent loop 低於 $0.01?是中等規模的 SaaS 公司不需要再做 token budgeting?這個問題目前沒有標準答案。而接下來六個月,這三個方向都會同時給出它們的答案。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。