跳到主要內容
Kimi K2.6:300 個 Agent、4,000 步、但 orchestration 脆弱性是整個行業的問題

Kimi K2.6:300 個 Agent、4,000 步、但 orchestration 脆弱性是整個行業的問題

Moonshot AI 的 Kimi K2.6 把 Agent Swarm 從 K2.5 的 100 agents / 1,500 steps 拉到 300 / 4,000——4 種不同技能類型平行運作,一次 run 可生 10 萬字 literature review 或 2 萬行資料集。SWE-Bench Pro 58.6%、HLE w/ tools 54.0。但所有 benchmark 自報、12 小時任務沒有第三方驗證,長程 agent 的 orchestration 脆弱性是整個行業共同面臨的難題。

目錄+

300 個 sub-agent、4,000 步、單次 run 吐出 10 萬字 literature review——Kimi K2.6 把 agent 規模拉到了一個新刻度。但規模和穩定性是兩件事,這篇拆開來看。

Kimi K2.6 的家底:1T MoE、Modified MIT、262K context

K2.6 是 Moonshot AI 於 2026-04-13 發布的新一代旗艦開源模型,屬於 MoE(Mixture-of-Experts)架構。核心規格:

  • 總參數:1T,每個 token 只啟動 32B active 參數
  • Expert 配置:384 experts,每次選 8 個 expert + 1 個 shared expert
  • 架構:61 層 transformer,Multi-head Latent Attention(MLA)+ SwiGLU
  • Context window:262,144 tokens
  • 量化:原生 INT4 QAT,權重約 594GB
  • 訓練資料:15.5T tokens,知識截止 2025-04

產品線分四個變體:Instant 追求速度、Thinking 負責長推理、Agent 做自主任務、Agent Swarm 做大規模平行 agent。

授權是 Modified MIT:月活 1 億以上或月營收 $20M 以上的使用者,產品內需顯示「Kimi K2.6」credit。對絕大多數開發者幾乎等同 MIT——這個門檻故意設得很高,意思是 Moonshot 只想對 hyperscaler 收 attribution 稅,對生態保持開放。

想在本地跑 K2.6 全精度需要大 VRAM。594GB 的權重意味著需要多 GPU 或特殊硬體;對大多數開發者來說,量化版(Q4 約 320GB)或透過 API 使用才是實際路徑。API 定價是 0.95/1Minputtoken、0.95 / 1M input token、4 / 1M output token。如果要測試本地 inference pipeline,麗臺 RTX PRO 4500 Blackwell 的 32GB VRAM 能跑 Mixtral 和 Qwen2.5 32B 全精度,適合想在 workstation 上測試中型開源模型 inference 工作流的人。

Benchmark:開源 SOTA,但數字要保留懷疑空間

Moonshot 公布的 K2.6 成績單(皆為官方自報或自行 re-evaluate):

BenchmarkK2.6 成績
HLE w/ tools54.0
SWE-Bench Pro58.6%
SWE-Bench Verified80.2%
SWE-bench Multilingual76.7%
BrowseComp83.2%(Agent Swarm 模式 86.3%)
DeepSearchQA F192.5%
Terminal-Bench 2.066.7%
Toolathlon50.0
Charxiv w/ python86.7
Math Vision w/ python93.2

SWE-Bench Pro 的 58.6 是整張清單最需要打問號的地方。

SWE-Bench Pro 是 Scale Labs 推出的新版 SWE-Bench,用強 copyleft 授權 repo 擋住訓練資料污染。根據 Scale Labs 公開 leaderboard,GPT-5 和 Claude Opus 4.1 在 Public Set 上分別只拿 23.3% 和 23.1%——連前沿商用模型跟 Verified 版相比都會掉 50 個百分點。如果 K2.6 真的拿 58.6,那不只是開源 SOTA,而是把整個 leaderboard 頂端拉到比 GPT-5 高兩倍以上。不是不可能,但官方推文沒附獨立第三方驗證,目前只能標為「Moonshot 自評」。

BrowseComp 83.2 也值得存疑。K2-Thinking 時代官方宣稱 60+,但社群在 Hugging Face discussion 回報用官方 API 只有 40+,差距非常大。Moonshot 員工自己承認「a simple context management strategy」會帶來顯著加分,但細節沒開源。K2.6 的 83.2 有沒有用同類技巧、能不能複現,官方也沒說。

對比組:Glia 2026-03 frontier 榜顯示,Claude Opus 4.6 的 HLE w/ tools 是 53.0,BrowseComp 最高是 Claude Mythos Preview 的 87。K2.6 的 HLE 54.0 和 BrowseComp 83.2 落在 frontier 區間,但不是屠榜。

比較穩健的讀法:把 K2.6 當作「在 agent 類 benchmark 與頂級閉源模型同級的候選」,而不是「確定贏」。

Agent Swarm 的四種技能類型

Kimi K2.6 的 Swarm 最明確的差異化點,是 heterogeneous skill 平行——不是同質 agent(全部都是「研究員」),而是在同一條 run 裡混用不同技能類型,由 K2.6 本身當 coordinator 做工作分派:

  1. Search agent:網路搜尋與資料擷取,同一時間多個在跑
  2. Analysis agent:對搜尋結果做結構化分析、比對、提煉
  3. Coding agent:跨語言程式任務(Rust / Go / Python),含 frontend、devops、perf optimization
  4. Long-form writing agent:生成 literature review、報告、文件——示範中一次吐出 10 萬字
  5. Visual generation agent:視覺輸出,K2.6 加入 video 理解後對這個 sub-agent 是必要基礎

輸出形態也從對話訊息變成直接寫檔案:100+ 個檔案的 repo、10 萬字的 literature review、2 萬行的資料集。Moonshot 的公開案例是在洛杉磯爬出 30 家沒有官網的餐廳,為每一家自動生成 landing page、booking 表單並做資料同步。

另一個案例是 Claw Groups(research preview):「bring your own agents, command your friends', bots & humans in the loop」——K2.6 作為 coordinator,指揮一群可能混合不同模型的 sub-agent。這是一個模糊的 teaser,可能是多人協作的 agent 編排平台、agent-to-agent 通訊協議,或類似 MCP 的開放介面,官方還沒給技術細節。

300 × 4,000:數字漂亮,但 orchestration 脆弱性還在

K2.5 的 Agent Swarm 上限是同時 100 個 sub-agent × 1,500 步。K2.6 直接變成 300 × 4,000——理論上單次 run 可以推進 120 萬步 agent 動作,持續超過 12 小時,甚至有示範 agent 連續運作長達 5 天做網站監控與事故應對。

數字好看,但這幾個降溫的點要誠實說:

所有 benchmark 都是自報。 Hugging Face model card 裡本身就註記部分數字是 Moonshot 自行 re-evaluate,需要幾週才有第三方獨立 run 的對照。

12 小時 / 5 天 long-horizon agent claim,是整個產業都還在掙扎的問題。 VentureBeat 在 K2.6 報導中直接下標「runs agents for days — and exposes the limits of enterprise orchestration」,多位 practitioner 指出:long-horizon agent 的脆弱性不是好的 prompting 能解決——記憶一致性、狀態漂移、工具回傳資料的 schema 變動、長鏈錯誤累積,都是 orchestration 層面的結構性問題。300 個 sub-agent 同時跑,是把 failure mode 的空間乘上去,加倍脆弱而不是線性脆弱。

成本可控性不透明。 300 agents × 4,000 steps 意味著單 run 的 token 消耗可以非常可觀,且很難事前精確預估。對企業使用者來說,「這個任務會花我多少錢」如果沒有清楚的預算護欄,就很難放進生產流程。

context 262K 落後競品。 Claude Opus 4.7 已開到 1M context、Gemini 長期在 1M-2M 區間。Moonshot 的回應是把戰場從「單模型長 context」轉到「agent swarm 協作」——用多 agent 去吃掉超大任務,而不是靠一個模型的超長 window。這是策略選擇,優劣要看任務型態。

和 K2.5 比,真正的進步在哪裡

維度K2.5K2.6
Parallel sub-agents100300
Coordinated steps1,5004,000
Agent 類型同質5 種技能類型混用
多模態文字 + 圖片文字 + 圖片 + video 理解
API 定價(input)$0.60 / 1M$0.95 / 1M
API 定價(output)$3 / 1M$4 / 1M
知識截止2024-062025-04

最實質的進步是兩個:規模(100→300 agents、1,500→4,000 steps)和 heterogeneous skill——把過去「多個同類 agent 並行」升級成「不同技能類型同時在一條 run 裡協作」。後者在任務分派複雜度和輸出多樣性上都是本質升級。

K2.6 對閉源替代的定位也更清楚了:Agent Swarm 模式對比 Claude Sonnet 4.5 主打的「30 小時自主執行」是同一條賽道,但定價差距讓「讓 300 個 agent 跑 12 小時」對獨立開發者從「只能想想」變成「可以認真試」。

值得留意的另一個切點:K2.6 官方特別提及針對「Motion-rich frontend」做了強化,能生成有 video hero section、WebGL shader、GSAP + Framer Motion 動畫、Three.js 3D 的前端程式碼——這是 coding 模型少見的垂直方向,但目前沒有對應 benchmark,要靠社群實測才能確認宣稱強度。

K2.6 主張開源、可自託的工作流搭配 24GB 以上 VRAM 的工作站顯卡可以跑量化版的中型模型;麗臺 RTX PRO 4000 Blackwell 的 24GB VRAM 適合跑 Llama 3 70B Q4 量化——預算有限、想測試開源模型 inference 而不完全依賴 API 的人可以作為入門參考。

這次 Moonshot 的節奏仍然穩:三個月一個版本,每次都有可驗證的配置差異,不只是分數。Agent 的下一輪競爭不靠單模型贏,而是靠 orchestration 層能不能穩定到放進生產。K2.6 丟出了很具體的答卷,接下來就看社群與企業實測回填的數據長什麼樣。


利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。

資料來源:Moonshot 官方推文(4/20)、Moonshot 官方 Agent Swarm 示範影片(4/23)、Scale Labs SWE-Bench Pro leaderboard、Moonshot Kimi-K2-Thinking HuggingFace discussion、Glia Frontier Model Comparison 2026-03、VentureBeat K2.6 報導、arXiv Kimi K2 tech report。