跳到主要內容
/閱讀約 9 分鐘/

Tencent Hy3 量化版 vs Google Gemma 提速賽:AI 塞進更少硬體的兩條路

Tencent 把 295B 的旗艦模型 Hy3 壓成 1-bit 和 4-bit GGUF,讓它塞進單張 96GB 等級顯卡;Google 則辦了一場 Fast Gemma Challenge,讓上百個 AI agent 在固定的 24GB A10G 上把推理速度拉高 5 倍。這篇拆解兩邊已驗證的規格數字,釐清「單張 GPU」的規模誤解,並說明為什麼讓 AI 模型跑得動,正比模型多聰明更快變成現實問題。

目錄+

同一個問題,兩家公司給出完全相反的解法。模型越做越大,硬體規格跟不上——這是所有動手做 AI 的人都在面對的現實。Tencent 選擇自己動手把模型壓小,讓 295B 的旗艦模型塞進一張顯卡;Google 選擇辦一場比賽,讓上百個 AI agent 去卷推理速度,把一張固定顯卡的極限往外推。兩條路徑完全不同,卻指向同一個結論:讓 AI 模型跑得動,正在比模型聰不聰明更早變成要解決的現實問題。

Tencent 把 295B 的 Hy3 壓成 1-bit,塞進一張顯卡

Hy3 是 Tencent Hunyuan 團隊的旗艦模型:295B 總參數,MoE 架構,192 個專家、每次啟動 8 個(21B active),80 層加 1 層 MTP,256K context,Apache 2.0 授權。原版 BF16 精度的檔案大小大概 598GB——這種規模平常得靠 8 張 H20 等級的 GPU 才跑得動推論,一般人碰不到。

後續 Tencent 放出了 1-bit 和 4-bit 的 GGUF 量化版本,可以直接用 llama.cpp 跑。量化(quantization)是把模型權重從高精度浮點數壓縮到更低位元表示的技術,犧牲一點精度,換取檔案體積和記憶體需求大幅縮小。

數字很直接:1-bit 版本用 IQ1_M 方法,把 598GB 壓到約 85.5GiB,縮小 6.7 倍;4-bit 版本用 Q4_K_M,壓到約 169.9GiB。搭配 MTP 投機解碼——原理是用一個小模型先猜、大模型再驗證,Gemma 4 靠同樣的技術把推理速度衝了 3 倍——1-bit 版本解碼速度提升約 50%,4-bit 版本提升近 60%。Tencent 內部在 agent workflow、多語言程式碼生成、工具呼叫、長文件理解幾項測試上,量化後的分數跟原版很接近,4-bit 版本掉分最少。要提醒一句:這是官方自己測的數字,目前還沒有外部第三方 benchmark 報告可以對照。

這裡有件事必須先講清楚。1-bit 版本能塞進「一張顯卡」,講的是 96GB 等級的顯卡或統一記憶體機種——DGX Spark、128GB 版本的 Mac Studio、Strix Halo 這一類——不是家裡那張 16GB 的 RTX 3060。4-bit 版本體積接近 170GB,得兩張標準顯卡才裝得下。已經有人誤會成「3060 加 16GB 記憶體就能跑」,這是錯的,Tencent 的記憶體算法完全不支援這個規模。能塞進一張顯卡,不代表塞得進你的顯卡。

如果手上的工作站是麗臺 RTX PRO 5000 Blackwell 這種 48GB 等級的旗艦單卡,離 Hy3 1-bit 版本要求的 96GB 門檻還差一半——想在本地跑到這個規模,得認真盤算多卡或統一記憶體平台這條路,不是隨便升一張卡就能解決。跟Ternary Bonsai 把 8B 模型壓進 1.75GB 的邏輯類似,壓縮的目的不是讓大象變小,是讓大象能塞進更少的門。

Google 辦了一場比賽,讓上百個 AI agent 去卷推理速度

Google Gemma 團隊跟 Hugging Face 合辦了「Fast Gemma Challenge」,玩法很直接:參賽者帶自己的 AI coding agent——可以是 Claude Code、Codex、Gemini CLI,任何工具都行——讓 agent 想辦法把 google/gemma-4-E4B-it 這個模型,在固定的單張 NVIDIA A10G(24GB)上跑得越快越好,同時輸出品質不能明顯下降。允許換推論引擎(vLLM、SGLang、TGI、TensorRT-LLM)、換量化方法、寫 kernel、調批次、玩解碼技巧;不能換模型、換硬體,文字/圖片/音訊四種輸入模態也都得維持能用。

結果:6 天內,超過 100 個 AI agent 加真人參賽,官方公布整體推理速度提升 5 倍。最快的單一結果衝到 491.8 TPS,但代價是其他面向的模型品質有掉;最快「無損」(品質沒明顯下降)的結果是 315 TPS。這些數字不是自己喊的——主辦方在私有的 prompt 集上驗證過,過關才會在公開 leaderboard 標上「verified」徽章。Google 把這件事定調成「人類跟 agent 一起合作能做到什麼」的示範:agent 互相比對、彼此盯著不要抄捷徑,真人負責給方向跟判斷品味。

固定的 24GB A10G,剛好是麗臺 RTX PRO 4000 Blackwell 這種工作站入門卡的規格量級——這場比賽示範的不是「換更貴的卡」,而是「同一張卡,軟體層還能榨出多少」。自己在本地跑模型時,這條思路值得記住:先問軟體棧有沒有榨乾,再問要不要換卡。同樣是靠投機解碼榨速度,DeepSeek DSpark 那篇 拆過「51% 到 400%」這種區間數字是怎麼量出來的,原理可以互相對照。

跑得動,比聰明更早成為要解決的問題

這兩件事表面上不相干——一個是廠商自己動手做壓縮,一個是社群辦比賽卷軟體優化——但指向同一個現實。模型越做越大,硬體規格卻不是無限往上疊的東西:VRAM 有物理上限,GPU 供應也有價錢跟數量的現實限制。模型已經聰明到能用之後,「能不能跑起來、跑得多快」就變成比「模型準不準」更先被問到的問題。

對開發者來說,這兩條路不衝突,反而是同一套工具箱的兩端:量化決定你能不能把模型裝進手上的硬體,推論優化決定裝進去之後能榨出多少速度。哪個場景先用哪個,取決於你被卡住的是「裝不下」還是「跑太慢」。

常見問題

Tencent Hy3 的 1-bit 量化版真的可以在家用顯卡跑嗎?

不行,至少不是一般認知的「家用顯卡」。1-bit 版本(約 85.5GiB)需要 96GB 等級的顯卡或統一記憶體機種,例如 DGX Spark、128GB Mac Studio、Strix Halo,不是 16GB 的 RTX 3060 這類消費卡塞得下的規模。

Fast Gemma Challenge 的 TPS 數字有沒有獨立驗證?

有經過主辦方驗證,但還不是外部第三方重現。官方在私有的 prompt 集上重新測過每個提交結果,過關才會在公開 leaderboard 標上「verified」徽章,不是參賽者自己回報數字就算數。

量化和推論優化,一般開發者該先看哪個?

看你卡在哪一關。模型大到裝不進你的硬體,先找量化版本;模型已經跑得動但速度不夠,換推論引擎、調批次這類優化手法投報率通常更高,不用整套重買硬體。

利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。文中蝦皮商品連結為依規格客觀描述適用情境,非第一人稱使用體驗。

一個是把模型壓小塞進硬體,一個是把硬體的極限榨到最大——你會先遇到哪一種瓶頸,決定了你該先學哪一套。