Kimi K2.6:300 個 Agent、4,000 步、但 orchestration 脆弱性是整個行業的問題
Moonshot AI 的 Kimi K2.6 把 Agent Swarm 從 K2.5 的 100 agents / 1,500 steps 拉到 300 / 4,000——4 種不同技能類型平行運作,一次 run 可生 10 萬字 literature review 或 2 萬行資料集。SWE-Bench Pro 58.6%、HLE w/ tools 54.0。但所有 benchmark 自報、12 小時任務沒有第三方驗證,長程 agent 的 orchestration 脆弱性是整個行業共同面臨的難題。
目錄+
300 個 sub-agent、4,000 步、單次 run 吐出 10 萬字 literature review——Kimi K2.6 把 agent 規模拉到了一個新刻度。但規模和穩定性是兩件事,這篇拆開來看。
Kimi K2.6 的家底:1T MoE、Modified MIT、262K context
K2.6 是 Moonshot AI 於 2026-04-13 發布的新一代旗艦開源模型,屬於 MoE(Mixture-of-Experts)架構。核心規格:
- 總參數:1T,每個 token 只啟動 32B active 參數
- Expert 配置:384 experts,每次選 8 個 expert + 1 個 shared expert
- 架構:61 層 transformer,Multi-head Latent Attention(MLA)+ SwiGLU
- Context window:262,144 tokens
- 量化:原生 INT4 QAT,權重約 594GB
- 訓練資料:15.5T tokens,知識截止 2025-04
產品線分四個變體:Instant 追求速度、Thinking 負責長推理、Agent 做自主任務、Agent Swarm 做大規模平行 agent。
授權是 Modified MIT:月活 1 億以上或月營收 $20M 以上的使用者,產品內需顯示「Kimi K2.6」credit。對絕大多數開發者幾乎等同 MIT——這個門檻故意設得很高,意思是 Moonshot 只想對 hyperscaler 收 attribution 稅,對生態保持開放。
想在本地跑 K2.6 全精度需要大 VRAM。594GB 的權重意味著需要多 GPU 或特殊硬體;對大多數開發者來說,量化版(Q4 約 320GB)或透過 API 使用才是實際路徑。API 定價是 4 / 1M output token。如果要測試本地 inference pipeline,麗臺 RTX PRO 4500 Blackwell 的 32GB VRAM 能跑 Mixtral 和 Qwen2.5 32B 全精度,適合想在 workstation 上測試中型開源模型 inference 工作流的人。
Benchmark:開源 SOTA,但數字要保留懷疑空間
Moonshot 公布的 K2.6 成績單(皆為官方自報或自行 re-evaluate):
| Benchmark | K2.6 成績 |
|---|---|
| HLE w/ tools | 54.0 |
| SWE-Bench Pro | 58.6% |
| SWE-Bench Verified | 80.2% |
| SWE-bench Multilingual | 76.7% |
| BrowseComp | 83.2%(Agent Swarm 模式 86.3%) |
| DeepSearchQA F1 | 92.5% |
| Terminal-Bench 2.0 | 66.7% |
| Toolathlon | 50.0 |
| Charxiv w/ python | 86.7 |
| Math Vision w/ python | 93.2 |
SWE-Bench Pro 的 58.6 是整張清單最需要打問號的地方。
SWE-Bench Pro 是 Scale Labs 推出的新版 SWE-Bench,用強 copyleft 授權 repo 擋住訓練資料污染。根據 Scale Labs 公開 leaderboard,GPT-5 和 Claude Opus 4.1 在 Public Set 上分別只拿 23.3% 和 23.1%——連前沿商用模型跟 Verified 版相比都會掉 50 個百分點。如果 K2.6 真的拿 58.6,那不只是開源 SOTA,而是把整個 leaderboard 頂端拉到比 GPT-5 高兩倍以上。不是不可能,但官方推文沒附獨立第三方驗證,目前只能標為「Moonshot 自評」。
BrowseComp 83.2 也值得存疑。K2-Thinking 時代官方宣稱 60+,但社群在 Hugging Face discussion 回報用官方 API 只有 40+,差距非常大。Moonshot 員工自己承認「a simple context management strategy」會帶來顯著加分,但細節沒開源。K2.6 的 83.2 有沒有用同類技巧、能不能複現,官方也沒說。
對比組:Glia 2026-03 frontier 榜顯示,Claude Opus 4.6 的 HLE w/ tools 是 53.0,BrowseComp 最高是 Claude Mythos Preview 的 87。K2.6 的 HLE 54.0 和 BrowseComp 83.2 落在 frontier 區間,但不是屠榜。
比較穩健的讀法:把 K2.6 當作「在 agent 類 benchmark 與頂級閉源模型同級的候選」,而不是「確定贏」。
Agent Swarm 的四種技能類型
Kimi K2.6 的 Swarm 最明確的差異化點,是 heterogeneous skill 平行——不是同質 agent(全部都是「研究員」),而是在同一條 run 裡混用不同技能類型,由 K2.6 本身當 coordinator 做工作分派:
- Search agent:網路搜尋與資料擷取,同一時間多個在跑
- Analysis agent:對搜尋結果做結構化分析、比對、提煉
- Coding agent:跨語言程式任務(Rust / Go / Python),含 frontend、devops、perf optimization
- Long-form writing agent:生成 literature review、報告、文件——示範中一次吐出 10 萬字
- Visual generation agent:視覺輸出,K2.6 加入 video 理解後對這個 sub-agent 是必要基礎
輸出形態也從對話訊息變成直接寫檔案:100+ 個檔案的 repo、10 萬字的 literature review、2 萬行的資料集。Moonshot 的公開案例是在洛杉磯爬出 30 家沒有官網的餐廳,為每一家自動生成 landing page、booking 表單並做資料同步。
另一個案例是 Claw Groups(research preview):「bring your own agents, command your friends', bots & humans in the loop」——K2.6 作為 coordinator,指揮一群可能混合不同模型的 sub-agent。這是一個模糊的 teaser,可能是多人協作的 agent 編排平台、agent-to-agent 通訊協議,或類似 MCP 的開放介面,官方還沒給技術細節。
300 × 4,000:數字漂亮,但 orchestration 脆弱性還在
K2.5 的 Agent Swarm 上限是同時 100 個 sub-agent × 1,500 步。K2.6 直接變成 300 × 4,000——理論上單次 run 可以推進 120 萬步 agent 動作,持續超過 12 小時,甚至有示範 agent 連續運作長達 5 天做網站監控與事故應對。
數字好看,但這幾個降溫的點要誠實說:
所有 benchmark 都是自報。 Hugging Face model card 裡本身就註記部分數字是 Moonshot 自行 re-evaluate,需要幾週才有第三方獨立 run 的對照。
12 小時 / 5 天 long-horizon agent claim,是整個產業都還在掙扎的問題。 VentureBeat 在 K2.6 報導中直接下標「runs agents for days — and exposes the limits of enterprise orchestration」,多位 practitioner 指出:long-horizon agent 的脆弱性不是好的 prompting 能解決——記憶一致性、狀態漂移、工具回傳資料的 schema 變動、長鏈錯誤累積,都是 orchestration 層面的結構性問題。300 個 sub-agent 同時跑,是把 failure mode 的空間乘上去,加倍脆弱而不是線性脆弱。
成本可控性不透明。 300 agents × 4,000 steps 意味著單 run 的 token 消耗可以非常可觀,且很難事前精確預估。對企業使用者來說,「這個任務會花我多少錢」如果沒有清楚的預算護欄,就很難放進生產流程。
context 262K 落後競品。 Claude Opus 4.7 已開到 1M context、Gemini 長期在 1M-2M 區間。Moonshot 的回應是把戰場從「單模型長 context」轉到「agent swarm 協作」——用多 agent 去吃掉超大任務,而不是靠一個模型的超長 window。這是策略選擇,優劣要看任務型態。
和 K2.5 比,真正的進步在哪裡
| 維度 | K2.5 | K2.6 |
|---|---|---|
| Parallel sub-agents | 100 | 300 |
| Coordinated steps | 1,500 | 4,000 |
| Agent 類型 | 同質 | 5 種技能類型混用 |
| 多模態 | 文字 + 圖片 | 文字 + 圖片 + video 理解 |
| API 定價(input) | $0.60 / 1M | $0.95 / 1M |
| API 定價(output) | $3 / 1M | $4 / 1M |
| 知識截止 | 2024-06 | 2025-04 |
最實質的進步是兩個:規模(100→300 agents、1,500→4,000 steps)和 heterogeneous skill——把過去「多個同類 agent 並行」升級成「不同技能類型同時在一條 run 裡協作」。後者在任務分派複雜度和輸出多樣性上都是本質升級。
K2.6 對閉源替代的定位也更清楚了:Agent Swarm 模式對比 Claude Sonnet 4.5 主打的「30 小時自主執行」是同一條賽道,但定價差距讓「讓 300 個 agent 跑 12 小時」對獨立開發者從「只能想想」變成「可以認真試」。
值得留意的另一個切點:K2.6 官方特別提及針對「Motion-rich frontend」做了強化,能生成有 video hero section、WebGL shader、GSAP + Framer Motion 動畫、Three.js 3D 的前端程式碼——這是 coding 模型少見的垂直方向,但目前沒有對應 benchmark,要靠社群實測才能確認宣稱強度。
K2.6 主張開源、可自託的工作流搭配 24GB 以上 VRAM 的工作站顯卡可以跑量化版的中型模型;麗臺 RTX PRO 4000 Blackwell 的 24GB VRAM 適合跑 Llama 3 70B Q4 量化——預算有限、想測試開源模型 inference 而不完全依賴 API 的人可以作為入門參考。
這次 Moonshot 的節奏仍然穩:三個月一個版本,每次都有可驗證的配置差異,不只是分數。Agent 的下一輪競爭不靠單模型贏,而是靠 orchestration 層能不能穩定到放進生產。K2.6 丟出了很具體的答卷,接下來就看社群與企業實測回填的數據長什麼樣。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。
資料來源:Moonshot 官方推文(4/20)、Moonshot 官方 Agent Swarm 示範影片(4/23)、Scale Labs SWE-Bench Pro leaderboard、Moonshot Kimi-K2-Thinking HuggingFace discussion、Glia Frontier Model Comparison 2026-03、VentureBeat K2.6 報導、arXiv Kimi K2 tech report。