Tencent Hy3 量化版 vs Google Gemma 提速賽:AI 塞進更少硬體的兩條路
Tencent 把 295B 的旗艦模型 Hy3 壓成 1-bit 和 4-bit GGUF,讓它塞進單張 96GB 等級顯卡;Google 則辦了一場 Fast Gemma Challenge,讓上百個 AI agent 在固定的 24GB A10G 上把推理速度拉高 5 倍。這篇拆解兩邊已驗證的規格數字,釐清「單張 GPU」的規模誤解,並說明為什麼讓 AI 模型跑得動,正比模型多聰明更快變成現實問題。
