Qwen3.6-27B:27B dense 在 coding 贏 397B MoE,HuggingFace CTO 說「逼近 Opus」
Alibaba 發布 Qwen3.6-27B:Apache 2.0、dense、SWE-bench Verified 77.2,在 coding benchmark 超越自家 397B MoE。兩天後 HuggingFace CTO Julien Chaumond 在 MacBook Pro 上用 llama.cpp 跑出「非常接近 Opus」的實測體感。這是 2026 開源 coding agent 逼近閉源的拐點之一。
目錄+
「pretty magical。」
HuggingFace CTO Julien Chaumond 在 MacBook Pro 上跑本地 coding agent,說了這句話——模型是 Qwen3.6-27B,量化後 16.8GB,engine 是 llama.cpp。這是 4/22 發布兩天後的真人驗證。
這篇把兩件事放在一起看:4/22 的發布技術分析,和 4/24 Julien 實測之後「閉源護城河正在變淺」這個結論。
Dense vs MoE:為什麼 27B dense 是重要定位
同週剛發布的 Kimi K2.6 是 1 兆總參數、32B active 的 MoE。Qwen 自家上一代旗艦 Qwen3.5-397B-A17B 也是 MoE(397B 總、17B active)。當 open-source 賽道都在 scale MoE 的時候,Alibaba 回頭做一個 27B dense,是針對一個特定場景:部署。
MoE 部署有 expert routing 的額外複雜度、記憶體頻寬需求高、在低並發情境反而效率差。Dense 27B 直接就是 27B 參數,FP8 量化後單張 RTX 4090 就能跑。對於想在自己基礎設施上跑旗艦級 coding model、但沒有大規模 GPU cluster 的團隊,這是很實際的選擇。
架構上 Qwen3.6-27B 用 Hybrid Gated DeltaNet(linear attention)加傳統 self-attention,加入 Thinking Preservation 機制,支援 thinking 和 non-thinking 兩種模式,原生多模態包含影片。
需要本地跑量化模型的場景,麗臺 RTX PRO 4000 Blackwell 的 24GB VRAM 跑 Qwen3.6-27B Q4_K_M 版剛剛好——FP8 量化 27B 大約需要 16-17GB,單張卡可以跑,不需要 H100 cluster。
Benchmark:coding 贏大模型,knowledge 仍是小模型
這是 tweet 的核心主張,數字來自 Hugging Face model card:
Qwen3.6-27B coding benchmark 分數(官方 model card)
對比 Qwen3.5-397B-A17B(前代 397B MoE 旗艦)與 Claude 4.5 Opus:
| Benchmark | Qwen3.6-27B | Qwen3.5-397B-A17B | Claude 4.5 Opus |
|---|---|---|---|
| SWE-bench Verified | 77.2 | 76.2 | 80.9 |
| SWE-bench Pro | 53.5 | 50.9 | 57.1 |
| SWE-bench Multilingual | 71.3 | 69.3 | 77.5 |
| Terminal-Bench 2.0 | 59.3 | 52.5 | 59.3 |
| SkillsBench Avg5 | 48.2 | 30.0 | 45.3 |
兩個值得停下來看的數字:27B dense 在 SWE-bench Verified 超過自家 397B MoE(77.2 vs 76.2);SkillsBench Avg5 差距 18.2 分、Claw-Eval Pass^3 差 12.5 分,不是邊際差距。QwenWebBench 1487(自家 benchmark,涵蓋 Web Design、Games、SVG 等七類)也從 Qwen3.5-27B 的 1068 大幅拉升。
閉源旗艦的差距:SWE-bench Verified 仍差 Opus 3.7 分,SWE-bench Pro 差 3.6 分。整體 SWE-bench 系列還落後,但 SkillsBench 上 Qwen3.6-27B 的 48.2 已超過 Opus 的 45.3。
knowledge benchmark 的另一面,tweet 沒提:MMLU-Pro 86.2 vs 397B 的 87.8、SuperGPQA 66.0 vs 70.4、HLE 24.0 vs 28.7。知識密度高的 benchmark,27B dense 整體仍輸 15 倍大的 MoE。這符合 LLM 研究的既有觀察:模型大小和 knowledge capacity 強相關,這裡沒有例外。
合理的解讀是 Qwen 團隊在 post-training 階段針對 coding 和 agentic 任務做了大量強化——coding agent trajectory 訓練、SWE-bench 類任務的資料生成、tool use 強化學習。不是「dense 架構效率天生贏 MoE」,是「針對 coding 做過目標訓練」。
HuggingFace CTO 的 MacBook 實測
Julien 的配置:MacBook Pro、llama.cpp、Pi coding agent(@mariozechner/pi-coding-agent)、Qwen3.6-27B Q4_K_M 量化版(16.8GB)。
Pi 是 Armin Ronacher 在 OpenClaw 專案中提到的「最小 agent」典型——可以接 OpenAI/Anthropic/Google API,也可以透過 ~/.pi/agent/models.json 把 llama.cpp 的本地 server 當成自訂 provider。Simon Willison 4/22 也跑通了相同鏈路,證實是現成可用的組合。
Julien 的話:「在 HuggingFace 的 codebase 上做非簡單任務,這個體驗已經非常接近最新的 Claude Opus。」
這句話從 Anthropic 主要競爭對手生態的關鍵人物說出來,意思不只是「Qwen 進步了」,而是「閉源旗艦在 coding 上的領先正在被一台筆電上的 27B 模型追上」。
本地部署的實際意義
真正值得看的不是 benchmark 贏幾分,是「能不能拿來用」:
- Apache 2.0 授權:商業可用、可修改、可再散布,無條件
- Q4_K_M 量化後 16.8GB:16GB Mac、單張消費級 GPU 都可以跑
- 262K context 原生,YaRN 擴展可以更長
- dense 架構:部署比 MoE 直接,不用處理 routing
- 接得上主流 agent framework:OpenClaw、Pi、Hermes、OpenCode 都可以對接
對自架推論的團隊,方程式變成:「我的硬體能不能跑出 80% Opus 的體感?」答案越來越接近 yes。預算和 VRAM 有餘裕的話,麗臺 RTX PRO 4500 Blackwell 的 32GB 跑 Qwen3.6-27B 全精度游刃有餘,對需要同時跑多個 agent 任務的場景更合適。
應該降溫的幾件事
以下幾個點需要降溫:
Benchmark 均為自報。Hugging Face model card 清楚標示部分數字是 Qwen 團隊用相同條件重新評估得出,第三方獨立驗證需要一到兩週。歷次開源模型發布的模式:自報數字樂觀一兩分,第三方測出來後往回修正一點,但整體排名順序不會翻盤。
SWE-bench Verified 77.2 vs 76.2 只差 1 分,在 variance 範圍內。真正值得關注的是 SkillsBench +18、Terminal-Bench +6.8 這種大幅差距。
Julien 的「非常接近 Opus」是在 HuggingFace 自家 codebase 上。HF codebase 是公開資料,Qwen 訓練資料中極可能高度涵蓋。換到企業內部 codebase,差距會放大。
llama.cpp 的 throughput。Mac 上對長 agent 任務(多輪 tool call、數十 K 輸出)會比閉源 API 慢很多。「能跑」不等於「跑得快」。
開源對閉源的逼近曲線
2024 年的故事:閉源領先半年到一年。2025:差距縮小到 3-6 個月。2026 年 4 月:一個 27B dense 模型、可以塞進筆電、benchmark 在某些題型上超過閉源旗艦。
這不是「開源贏了」,是閉源護城河對於日常 coding 任務正在變淺。對個人開發者:你愈來愈不需要每月 200 美金的訂閱。對 SaaS 公司:定價權正在被擠壓。對 Anthropic / OpenAI:要不繼續拉開 frontier capability,要不把產品價值堆在 agent、工具、整合上。
Qwen3.6-27B 不是「小模型全面取代大模型」——knowledge benchmark 上仍輸 15 倍大的 MoE,這是 dense 架構的既有限制。但「dense、Apache 2.0、單卡可跑、coding 旗艦」四個條件同時滿足的 open-weight 模型出現了。對要在自己基礎設施跑 coding agent 的團隊,這是 2026 年目前最實際的選項。
Julien 那句「pretty magical」描述的不是 Qwen,是這條曲線到了肉眼可見的拐點。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。