跳到主要內容
Qwen3.6-27B:27B dense 在 coding 贏 397B MoE,HuggingFace CTO 說「逼近 Opus」

Qwen3.6-27B:27B dense 在 coding 贏 397B MoE,HuggingFace CTO 說「逼近 Opus」

Alibaba 發布 Qwen3.6-27B:Apache 2.0、dense、SWE-bench Verified 77.2,在 coding benchmark 超越自家 397B MoE。兩天後 HuggingFace CTO Julien Chaumond 在 MacBook Pro 上用 llama.cpp 跑出「非常接近 Opus」的實測體感。這是 2026 開源 coding agent 逼近閉源的拐點之一。

目錄+

「pretty magical。」

HuggingFace CTO Julien Chaumond 在 MacBook Pro 上跑本地 coding agent,說了這句話——模型是 Qwen3.6-27B,量化後 16.8GB,engine 是 llama.cpp。這是 4/22 發布兩天後的真人驗證。

這篇把兩件事放在一起看:4/22 的發布技術分析,和 4/24 Julien 實測之後「閉源護城河正在變淺」這個結論。

Dense vs MoE:為什麼 27B dense 是重要定位

同週剛發布的 Kimi K2.6 是 1 兆總參數、32B active 的 MoE。Qwen 自家上一代旗艦 Qwen3.5-397B-A17B 也是 MoE(397B 總、17B active)。當 open-source 賽道都在 scale MoE 的時候,Alibaba 回頭做一個 27B dense,是針對一個特定場景:部署。

MoE 部署有 expert routing 的額外複雜度、記憶體頻寬需求高、在低並發情境反而效率差。Dense 27B 直接就是 27B 參數,FP8 量化後單張 RTX 4090 就能跑。對於想在自己基礎設施上跑旗艦級 coding model、但沒有大規模 GPU cluster 的團隊,這是很實際的選擇。

架構上 Qwen3.6-27B 用 Hybrid Gated DeltaNet(linear attention)加傳統 self-attention,加入 Thinking Preservation 機制,支援 thinking 和 non-thinking 兩種模式,原生多模態包含影片。

需要本地跑量化模型的場景,麗臺 RTX PRO 4000 Blackwell 的 24GB VRAM 跑 Qwen3.6-27B Q4_K_M 版剛剛好——FP8 量化 27B 大約需要 16-17GB,單張卡可以跑,不需要 H100 cluster。

Benchmark:coding 贏大模型,knowledge 仍是小模型

這是 tweet 的核心主張,數字來自 Hugging Face model card:

Qwen3.6-27B coding benchmark 分數(官方 model card)

對比 Qwen3.5-397B-A17B(前代 397B MoE 旗艦)與 Claude 4.5 Opus:

BenchmarkQwen3.6-27BQwen3.5-397B-A17BClaude 4.5 Opus
SWE-bench Verified77.276.280.9
SWE-bench Pro53.550.957.1
SWE-bench Multilingual71.369.377.5
Terminal-Bench 2.059.352.559.3
SkillsBench Avg548.230.045.3

兩個值得停下來看的數字:27B dense 在 SWE-bench Verified 超過自家 397B MoE(77.2 vs 76.2);SkillsBench Avg5 差距 18.2 分、Claw-Eval Pass^3 差 12.5 分,不是邊際差距。QwenWebBench 1487(自家 benchmark,涵蓋 Web Design、Games、SVG 等七類)也從 Qwen3.5-27B 的 1068 大幅拉升。

閉源旗艦的差距:SWE-bench Verified 仍差 Opus 3.7 分,SWE-bench Pro 差 3.6 分。整體 SWE-bench 系列還落後,但 SkillsBench 上 Qwen3.6-27B 的 48.2 已超過 Opus 的 45.3。

knowledge benchmark 的另一面,tweet 沒提:MMLU-Pro 86.2 vs 397B 的 87.8、SuperGPQA 66.0 vs 70.4、HLE 24.0 vs 28.7。知識密度高的 benchmark,27B dense 整體仍輸 15 倍大的 MoE。這符合 LLM 研究的既有觀察:模型大小和 knowledge capacity 強相關,這裡沒有例外。

合理的解讀是 Qwen 團隊在 post-training 階段針對 coding 和 agentic 任務做了大量強化——coding agent trajectory 訓練、SWE-bench 類任務的資料生成、tool use 強化學習。不是「dense 架構效率天生贏 MoE」,是「針對 coding 做過目標訓練」。

HuggingFace CTO 的 MacBook 實測

Julien 的配置:MacBook Pro、llama.cpp、Pi coding agent(@mariozechner/pi-coding-agent)、Qwen3.6-27B Q4_K_M 量化版(16.8GB)。

Pi 是 Armin Ronacher 在 OpenClaw 專案中提到的「最小 agent」典型——可以接 OpenAI/Anthropic/Google API,也可以透過 ~/.pi/agent/models.json 把 llama.cpp 的本地 server 當成自訂 provider。Simon Willison 4/22 也跑通了相同鏈路,證實是現成可用的組合。

Julien 的話:「在 HuggingFace 的 codebase 上做非簡單任務,這個體驗已經非常接近最新的 Claude Opus。」

這句話從 Anthropic 主要競爭對手生態的關鍵人物說出來,意思不只是「Qwen 進步了」,而是「閉源旗艦在 coding 上的領先正在被一台筆電上的 27B 模型追上」。

本地部署的實際意義

真正值得看的不是 benchmark 贏幾分,是「能不能拿來用」:

  • Apache 2.0 授權:商業可用、可修改、可再散布,無條件
  • Q4_K_M 量化後 16.8GB:16GB Mac、單張消費級 GPU 都可以跑
  • 262K context 原生,YaRN 擴展可以更長
  • dense 架構:部署比 MoE 直接,不用處理 routing
  • 接得上主流 agent framework:OpenClaw、Pi、Hermes、OpenCode 都可以對接

對自架推論的團隊,方程式變成:「我的硬體能不能跑出 80% Opus 的體感?」答案越來越接近 yes。預算和 VRAM 有餘裕的話,麗臺 RTX PRO 4500 Blackwell 的 32GB 跑 Qwen3.6-27B 全精度游刃有餘,對需要同時跑多個 agent 任務的場景更合適。

應該降溫的幾件事

以下幾個點需要降溫:

Benchmark 均為自報。Hugging Face model card 清楚標示部分數字是 Qwen 團隊用相同條件重新評估得出,第三方獨立驗證需要一到兩週。歷次開源模型發布的模式:自報數字樂觀一兩分,第三方測出來後往回修正一點,但整體排名順序不會翻盤。

SWE-bench Verified 77.2 vs 76.2 只差 1 分,在 variance 範圍內。真正值得關注的是 SkillsBench +18、Terminal-Bench +6.8 這種大幅差距。

Julien 的「非常接近 Opus」是在 HuggingFace 自家 codebase 上。HF codebase 是公開資料,Qwen 訓練資料中極可能高度涵蓋。換到企業內部 codebase,差距會放大。

llama.cpp 的 throughput。Mac 上對長 agent 任務(多輪 tool call、數十 K 輸出)會比閉源 API 慢很多。「能跑」不等於「跑得快」。

開源對閉源的逼近曲線

2024 年的故事:閉源領先半年到一年。2025:差距縮小到 3-6 個月。2026 年 4 月:一個 27B dense 模型、可以塞進筆電、benchmark 在某些題型上超過閉源旗艦。

這不是「開源贏了」,是閉源護城河對於日常 coding 任務正在變淺。對個人開發者:你愈來愈不需要每月 200 美金的訂閱。對 SaaS 公司:定價權正在被擠壓。對 Anthropic / OpenAI:要不繼續拉開 frontier capability,要不把產品價值堆在 agent、工具、整合上。

Qwen3.6-27B 不是「小模型全面取代大模型」——knowledge benchmark 上仍輸 15 倍大的 MoE,這是 dense 架構的既有限制。但「dense、Apache 2.0、單卡可跑、coding 旗艦」四個條件同時滿足的 open-weight 模型出現了。對要在自己基礎設施跑 coding agent 的團隊,這是 2026 年目前最實際的選項。

Julien 那句「pretty magical」描述的不是 Qwen,是這條曲線到了肉眼可見的拐點。


利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。