NVIDIA 真正的護城河不是 Blackwell,是 1000 個 CUDA-X 函式庫
Jensen Huang 在 GTC 2026 說「我們是演算法公司」——超過 1,000 個 CUDA-X SDK 與函式庫,才是 NVIDIA 真正難以被取代的原因。這篇從 GTC 的宣告講起,拆解 CUDA-X 技術棧(cuDNN、cuBLAS、NCCL、TensorRT)為什麼是 20 年積累的隱形基礎設施,以及它在推理與 RL 時代的重量。
目錄+
每次 NVIDIA 發新一代 GPU,市場討論都落在硬體規格。但 Jensen Huang 在 GTC 2026 把話講白了:「我們是一家演算法公司,碰巧也做出跑這些演算法最好的硬體。」皇冠上的寶石不是晶片,是函式庫。
GTC 2026:1000+ 函式庫的宣告
Blackwell 的記憶體頻寬、NVLink 拓撲、能耗比——這些是可以被量化比較的東西,所以討論重心很自然落在那裡。但 Jensen 在 GTC 2026 的發言方向不一樣。他說:
"Today, we've reinvented computing. A thousand CUDA-X libraries help developers make breakthroughs in every field of science and engineering."
接著是更直接的一句:「The libraries is the crown jewels of our company.」他沒有說晶片是皇冠上的寶石,他說的是函式庫。這個選擇不是偶然。
在 GTC 2026 單場活動,NVIDIA 就宣布超過 100 個新函式庫、70 個更新函式庫,以及 40 個新模型。整個 CUDA-X 生態系——包含 SDK、預訓練模型與函式庫——已超過 1,000 個元件,累積超過 6 億次下載,服務超過 700 萬名開發者。
值得注意的是,NVIDIA 官方產品頁面用的措辭是「超過 400 個函式庫」,Jensen 的「1,000」涵蓋了 SDK 與模型在內的整個生態系。所以正確的理解是:CUDA-X 生態系擁有超過 1,000 個 SDK、模型與函式庫。這個邊界的模糊本身也是刻意的——當函式庫、SDK 與模型的界線越來越不清楚,整個生態系的黏性就越來越高。
但數字本身不是重點。重點是這些元件覆蓋的領域廣度:
- cuOpt:決策最佳化,用於物流路線規劃、排程問題
- cuLitho:計算微影,用於晶片設計中的光罩模擬
- cuDSS:直接稀疏求解器,用於工程模擬的線性系統
- cuEquivariance:幾何感知神經網路,用於分子結構預測
- Aerial:電信 AI,用於 5G/6G 基站的訊號處理
- Parabricks:基因組學加速,用於 DNA 定序分析
每一個函式庫背後,都是一個特定領域十年以上的演算法積累。不是通用矩陣運算,而是每個領域最核心的計算問題的專門解法。
抽象的數量很難讓人有感,Parabricks 提供了一個具體參照點。2003 年,人類基因組計畫完成第一個人類基因組定序,耗時 13 年、花費 30 億美元,是人類科學史上規模最大的協作項目之一。2026 年,Roche、Broad Institute 與 Boston Children's Hospital 使用 Parabricks,把同樣規模的 DNA 定序壓縮到 4 小時以內。從 13 年到 4 小時,這不是優化,是量級跳躍。而 Parabricks 跑在 NVIDIA 的 GPU 上,使用 CUDA 的並行計算框架,依賴 NVIDIA 多年開發的生物資訊學演算法加速——它說明了 CUDA-X 的真正定位:不是讓通用計算變快,而是讓每個領域的核心瓶頸從不可能變成可能。
CUDA-X 不只是 CUDA:完整技術棧
最常見的誤解是把 CUDA-X 當成 CUDA 的延伸版本,或者一個新的 SDK。它不是。
CUDA-X 是一個傘形品牌,指的是所有建構在 CUDA Runtime 之上的領域特定加速庫。把它想成 GPU 計算的「標準庫」——就像 C++ 的 STL,或 Python 的 NumPy 生態系。CUDA 提供底層的 GPU 存取能力;CUDA-X 的各個庫把這個能力包裝成特定領域的高效能積木。除了上面那些垂直領域的函式庫,最貼近 AI 開發者日常的是這幾個核心成員:
cuDNN(CUDA Deep Neural Network Library)——深度學習基礎算子的最佳化實作。卷積、BatchNorm、Softmax、注意力機制——所有你在神經網路裡反覆用到的運算,cuDNN 都有針對特定 GPU 架構調整過的 kernel 實作。PyTorch 的 torch.nn 在 CUDA 後端裡幾乎全部走 cuDNN。
cuBLAS(CUDA Basic Linear Algebra Subprograms)——矩陣乘法和線性代數運算的基礎庫。當你的 Transformer 在做 Q @ K.T 的時候,底層是 cuBLAS 的 GEMM(General Matrix Multiply)kernel。這個 kernel 針對不同的矩陣大小和 GPU 架構有幾千種不同的實作,cuBLAS 在 runtime 選最快的那個。
NCCL(NVIDIA Collective Communications Library)——多 GPU 之間的通訊協議。AllReduce、AllGather、Broadcast——分散式訓練裡 GPU 之間交換梯度的操作,都走 NCCL。如果你用 PyTorch DDP 在 8 個 GPU 上訓練,同步梯度的那一步是 NCCL 在做。
TensorRT——推理部署的最佳化引擎。把訓練好的模型(支援 ONNX、PyTorch、TensorFlow)轉換成針對目標 GPU 最佳化過的部署格式,包含 kernel fusion(把多個操作合併成一個 kernel 減少記憶體搬移)、精度校準(FP32 → FP16/INT8)、動態批次大小處理。生產環境的 LLM 推理吞吐量,TensorRT 的貢獻通常是 2-4x。
一個值得更新的事實:從 TensorRT 10.x 開始,cuDNN 已經變成 optional,只有少數 deprecated layer 才需要它;TensorRT 自己已經為大多數常見算子提供最佳化實作。到了 Blackwell+ GPU 與 CUDA 13,cuDNN 甚至不再被支援。換句話說,cuDNN 的角色正從「不可或缺的核心」慢慢退成「相容層」——這反映 NVIDIA 把深度學習算子的 kernel 最佳化越來越集中在 TensorRT 和新的 frontend(cuDNN Frontend API)上。
整個技術棧的責任分工很清楚:
GPU Hardware 提供 CUDA core 和記憶體頻寬;CUDA Runtime 提供線程管理、記憶體配置、kernel 啟動的 API;CUDA-X 庫把常見計算模式包裝成高效能積木;ML 框架把這些積木組成使用者熟悉的 Python API。對大多數寫 PyTorch 的人來說,這整層是完全隱形的——你寫 tensor.to('cuda'),矩陣運算就快了幾十倍。但「透明」不代表「無關緊要」。
當你寫這段程式碼:
model = TransformerModel().to('cuda')
optimizer = torch.optim.AdamW(model.parameters())
for batch in dataloader:
loss = model(batch)
loss.backward()
optimizer.step()
實際發生的事情:
.to('cuda')把模型參數搬到 GPU 記憶體,透過 CUDA Runtime 分配- 前向傳播的 attention 運算走 cuDNN(或者 FlashAttention,它本質上是手寫的 CUDA kernel,提供比 cuDNN 更好的記憶體效率)
@矩陣乘法走 cuBLAS 的 GEMM kernelloss.backward()的梯度計算也走相同的 cuDNN/cuBLAS 路徑- 如果你在多 GPU 上跑 DDP,
optimizer.step()之前的梯度同步走 NCCL
你從來不需要直接接觸這些庫,但它們決定了你的程式碼到底有多快。FlashAttention 值得單獨提一下:它是 Tri Dao 等人在 CUDA 層面對注意力機制的重新實作——針對 GPU 記憶體存取的層次結構(HBM → SRAM → Register)手動優化,讓 attention 的記憶體複雜度從 O(n²) 降到接近線性。現在幾乎所有生產級別的 LLM 訓練都在用 FlashAttention,這就是一個深度 CUDA 優化帶來的決定性改善。
為什麼這是護城河:20 年的領域演算法積累
AMD 的 Instinct 系列在 FLOPS 層面有競爭力,Intel 的 Gaudi 在某些工作負載有成本優勢,雲端業者自研的 TPU、Trainium 也在持續演進。硬體可以被複製,或至少可以被替代。但沒有任何競爭者擁有 20 年累積的、跨越數十個科學與工程領域的、針對 GPU 並行架構深度優化的領域演算法庫。
具體看一個算子的歷史:cuDNN 從 2014 年開始開發,現在已有超過十年的工程優化。針對每一代 GPU 架構(Volta、Turing、Ampere、Hopper、Blackwell),每一個主要算子都有專門調優的 kernel 實作。這個優化工作的量是幾千個工程師年的累積,不是競爭對手能在幾年內複製的。再放大到整個 CUDA-X 生態系的 1,000 個元件,每一個背後都是一個垂直領域的演算法知識——這才是 Jensen 說的「皇冠上的寶石」。
更關鍵的是生態鎖定。所有主要 ML 框架(PyTorch、JAX、TensorFlow)的 GPU 後端都是以 CUDA 為主要目標開發的,框架開發者在設計 API 時就考慮了 CUDA 的記憶體模型和執行模型。當一個基因組學研究員、一個晶片設計工程師、一個物流最佳化團隊都依賴 CUDA-X 的函式庫,他們切換底層硬體的成本就不只是重新買機器,而是放棄一套已整合進工作流、已驗證、已有支援社群的演算法工具鏈。這是真實的轉換成本。
NVIDIA 賣的不只是 H100 和 B200——它賣的是一個 20 年積累的軟體棧,任何嚴肅的 AI 工作負載都已深深依賴它。對需要本地跑 70B 全精度模型、又離不開 CUDA 生態的人來說,麗臺 RTX PRO 5000 Blackwell 這類 48GB VRAM 的工作站卡,正是這套鎖定關係落到桌面的具體形態。
不過這裡有一個值得誠實討論的問題:深度整合同時意味著深度鎖定。當 GPU 供應吃緊、價格上漲,研究機構、企業、雲端業者沒有多少替代路徑,這個現實已引發持續的去 CUDA 動機。近期有兩個訊號:其一,CUDA Python 1.0 在 2025 年正式發布,這是 NVIDIA 自己對生態系可移植性的讓步;其二,ROCm 生態系持續成熟,AMD 在開放原始碼 GPU 計算框架的投入明顯加速,PyTorch 對 ROCm 的支援也在改善——想實際試水溫的人,SAPPHIRE Radeon AI Pro R9700 這張 32GB + ROCm 7 的工作站卡,是目前對 PyTorch 相對成熟的替代選項。
這不代表護城河會在短期消失,1,000 個領域特化函式庫不是三五年能複製的。但它確實意味著,NVIDIA 無法把「鎖定」當作唯一的競爭策略。真正持久的護城河,是讓開發者不想離開,而不是讓他們離不開——NVIDIA 目前兩者都有,但比例在緩慢移動。
推理與 RL 時代,隱形基礎設施浮上檯面
CUDA-X 覆蓋「訓練、推理和 RL」這三個詞放在一起是有意義的,因為它們的計算形態差異相當大:
Training:計算模式最規則。大批次、固定序列長度、前向加反向傳播。GPU 利用率最高,cuBLAS 和 cuDNN 是核心,優化目標是最大化吞吐量(tokens/second)。
Inference:分兩種場景。延遲敏感的場景(聊天、即時 API)需要低 TTFT(Time to First Token)和低 TBT(Time Between Tokens),批次很小甚至是 1;吞吐量優先的場景(批次推理)則類似訓練但沒有反向傳播。TensorRT 是核心——kernel fusion 和精度量化在這個場景效益最明顯。
RL:最複雜。在 2023-2024 之前,AI 訓練的主要模式是監督學習——一批資料、一次前向、一次反向,瓶頸很明確是大矩陣乘法,批次越大越有效率。RL 完全不同。RLHF / GRPO / PPO for reasoning models 的流程是:模型生成回應(rollout)→ 評分(reward)→ 用 policy gradient 更新參數 → 重複幾百萬次。問題在於:
- Rollout 是序列生成,不是批次矩陣運算。每個 token 要等上一個完成,這是根本的序列性,很難完全平行化。
- Reward 計算的延遲高度不均,尤其是 LLM-as-judge 的場景,GPU 等 reward 訊號時是閒置的。
- Policy 更新與 rollout 的比例(update-to-data ratio)是關鍵超參數,不同比例需要完全不同的計算排程策略。
這些特性讓 RL 的 GPU 利用率明顯低於監督學習,記憶體使用也更碎片化——你同時要在 GPU 上維護 policy model、value model、reference model 的參數,加上大量 rollout 的 KV cache。CUDA-X 的 RL-specific path 就是在應對這些特性:更好的非同步 kernel 調度、低延遲的序列生成優化、針對強化學習工作負載的記憶體管理策略。Rollout 像推理(低並行度的序列生成)、policy update 像訓練(高並行度的批次運算),兩個階段不斷切換、GPU 資源在多個模型之間共享——這是最難壓榨 GPU 效率的場景,也是 CUDA-X 新投入最多的方向。
這就是為什麼「隱形基礎設施」這個說法在現在特別有重量。當 AI 計算從純訓練擴展到推理和 RL,計算形態的多樣性暴增,而能在這三種形態下都把 GPU 壓到極限的,只有積累了 20 年的那一套軟體棧。對大多數 ML 工程師,CUDA-X 確實不需要日常操作——但在 TensorRT 部署、NCCL 通訊調優、FlashAttention 版本確認、混合精度排查這些場景,這一層的理解會讓排查時間從幾天縮短到幾小時。
GTC 2026 的核心訊息不是 Blackwell 的規格,而是那個框架:NVIDIA 是一家演算法公司,碰巧也製造跑這些演算法的最好硬體。理解護城河的正確位置——在演算法層,不在製造層——是判斷任何競爭動態的前提。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。文中商品為情境化推薦,請依自身需求評估。
參考來源:NVIDIA (@nvidia),GTC 2026;NVIDIA Data Center (@NVIDIADC),2026 年 4 月;NVIDIA CUDA-X 官方產品頁。