跳到主要內容
Meta 推出 Muse Code 終端機 coding agent,搭 Muse Spark 1.2

Meta 推出 Muse Code 終端機 coding agent,搭 Muse Spark 1.2

Meta 在 8/5 發布 Muse Code 與 Muse Spark 1.2:一個用 async 背景 agent + 可重播 event log 的終端機 coding agent。這篇拆它的執行設計、訓練方法,以及它在自家 benchmark 上真正排第幾。

目錄+

Meta 在 2026 年 8 月 5 日一口氣丟出兩樣東西:終端機 coding agent Muse Code(beta),與驅動它的新模型 Muse Spark 1.2。他們把這次叫「next step toward the frontier」——但更值得注意的是這支 agent 的工程選擇:常駐的 async 背景 agent、靠 event log 重播的 runtime,以及一套先規劃再被嗆的 skills。Meta 過去在模型 API 上軍備競賽,現在把戰場推進到你自己的終端機裡。

來源:Meta AI Research — Introducing Muse Code and Muse Spark 1.2,2026-08-05

Muse Code 是什麼

以一條 curl -fsSL https://dev.meta.ai/install.sh | bash 安裝,在 macOS/Linux terminal 裡接手大規模軟體工程任務:規劃變更、寫 code、驗證結果,並協調多個常駐 subagent。官方展示的例子是把一段 mp4 房屋空拍影片丟進去,讓它產出一個可用的度假屋行銷訂房頁。

它不是 Meta 第一個 agent 嘗試——早在 4 月的 Muse Spark 原始發布就談過 native multimodal 與 agentic 方向。這次差別在:模型與 harness 是綁在一起訓練的。

三個值得拆的工程決策

Async background agents。 Muse Code 不是單一 agent loop。它讓一組 async 背景 agent 在整個 session 期間常駐運作,而不是每次任務才 spawn 一個。官方用語是「remain active throughout each session」,負責接下來的步驟、並自己決定何時回報給主 agent。好處是避免重複蒐集資訊、減少延遲,困難的多步驟任務比較不需要人一直下指令。這跟過去「單 agent 跑到底」的做法明顯不同層級。

可重播的本地 event log。 每次 model call、tool run、approval、edit 都 append 進本地 event log,作為單一真相來源。runtime 因此是 replay-exact、restart-safe:就算 crash,agent 也能從原本停下的位置繼續。這個設計讓長跑任務「不會因為失敗就整個報廢」,是 terminal agent 在實戰環境能不能被信任的關鍵差異。

Bundled skills:/plan、/grill、/goal。 /plan 把任務轉成需要批准才能執行的計劃,/grill 壓力測試那份計劃直到站得住腳,/goal 則朝指定目標執行到完成。把「先告訴我會做什麼、再放手去做」流程化,這正是成熟 terminal agent 該有的節奏。

Muse Spark 1.2 怎麼訓練的

官方列出三個方向:大量擴充 coding 訓練算力並增加訓練環境多樣性,同時維持 general agent 的能力;long-horizon 訓練(整 repo 生成、大型端對端專案、auto-research),搭配 planning、goal conditioning 與 context compaction 來維持長時間方向與知識;以及自我改進迴路——用 1.1 產生困難的 coding 環境與 instruction-following 模板,再讓模型評估候選解多符合需求,產生可擴充的訓練資料。官方表示這個迴路讓 1.2 比前代更精準地遵循複雜指令。

關鍵是 co-training:Muse Spark 1.2 跟 Muse Code 是一起訓練的,用 rejection sampled harness trajectories 與 goal/compaction/subagent 的 recipe 最佳化,再把 Muse Code 的工具整合進訓練。白話講,這模型不是「先練好再硬塞進 harness」,而是「在 harness 裡長大的」。

自己在自家 benchmark 上排第幾

Meta 貼了三張圖:Terminal-Bench 2.1(Stanford × Laude Institute)、DeepSWE 1.1(Datacurve),與自家 Meta Internal Coding Bench。每個模型搭配各自的 agent 產品跑——Muse Spark 1.2 用 Muse Code、Claude 用 Claude Code、GPT 用 Codex、Grok 用 Grok Build、Gemini 用 Antigravity——並用最大 reasoning effort。根據官方 methodology,Terminal-Bench 2.1 用全部 89 個任務、在隔離的 Daytona sandbox 跑五次取 pass@1 平均;DeepSWE v1.1 定義 113 個任務、橫跨 91 個 repo 與五種語言,評分時封鎖外部網路、只有模型 endpoint 能連;Meta Internal Coding Bench 則由 440 個取自內部 PR 的真實任務組成。

第三方整理的圖表數值(官方圖表以圖片呈現):在 Terminal-Bench 2.1,Muse Code 拿 2nd(82.9%)、微幅領先 Codex(81.8%);在 DeepSWE 1.1(長地平線 agentic 任務測試)Muse Code 掉到 3rd(59.3%),落後 Claude Code(65.0%)與 Codex(64.8%);Meta Internal Coding Bench 上,自家出的題目裡 Claude Opus 5 仍以 79.4% 領先 Muse Spark 1.2 的 70.6%。Meta 最想被看到的可能是「打贏 Grok Build 4.5 和 Gemini 3.6 Flash」——但這不是圖裡最有意思的地方。官方同場承認 1.1→1.2 的進步有一部分來自 harness 換代:1.1 用精簡的 mini-swe-agent 跑 76.2%,1.2 綁目的打造建的 Muse Code 跑 82.9%,這 6.7 分是模型加工具共同貢獻,官方圖表沒有把兩者分開。

Terminal-Bench 2.1 平均任務成功率(依 Meta 公布圖表轉錄)

Case study:GPU kernel 優化

官方也丟了一個超過 1,000 次 tool call、最長 24 小時的案例:用 Muse Code 的 agentic 環境,在 NVIDIA Hopper 上迭代優化 KDA 與 MLA 的 Triton kernel——寫、編譯、profiling、改進,跟 baseline 比較。限制是不准直接 import 第三方 kernel library(例如 FLA),必須靠 kernel 優化知識自己在 Triton 實作。KDA 的解法是把 chunk-parallel 的 preparation kernel 配 sequential inter-chunk scan,再把 gated cumulative decay 重新置中到 chunk 中點;MLA 則設計成兩段式 Triton pipeline,共用 KV latent 同時當 K 與 V。這案例展示的不是「一次寫對」,而是長時間自主迭代——正是前段 event log + long-horizon 訓練要服務的場景。

這對開發者意味什麼

  • 生態變擁擠:Terminal coding agent 現在有 Claude Code、Codex,加上 Meta。而終端機正是工程師現在必須學會用 AI agent 的原因——不是會寫 code 就夠,是要會指揮 agent 隊。
  • 訂價是潛在變數:Meta 用 1/4 左右的 token 價位進場(依第三方分析),端到端工作流與平行中型任務是它的主場。
  • 還有得等:beta、只有 macOS/Linux terminal,跨 Windows 與 IDE 整合未提。要拿它做長地平線、跨多檔案的「丟著隔天看」工程,現有證據先不建議全面換底座——DeepSWE 與自家 Internal Bench 都輸給領先者,官方自己也把增益歸因於 harness。

常見問題

Muse Code 是什麼? Meta Superintelligence Labs 在 2026 年 8 月 5 日發布的 macOS/Linux 終端機 coding agent(beta),由 Muse Spark 1.2 驅動,用一條 curl 指令安裝,特色是常駐 async 背景 agent 與可重播的本地 event log。

跟 Muse Spark 1.1 差在哪? 官方定位是 coding 強化版:code generation、複雜 debugging、codebase 理解與端到端工作流提升,增加 coding 訓練算力與環境多樣性,並與 Muse Code 共同訓練。

跟 Claude Code / Codex 比誰贏? 依 Meta 自己公布的圖表:Terminal-Bench 2.1 上 Muse Code 排第二、微幅領先 Codex;DeepSWE 1.1 與自家 Internal Bench 上都落後 Claude Code 與 Codex。beta 階段,長期展望才值得觀察。

只有終端機嗎? 是。目前僅 macOS/Linux terminal,官方沒推桌面 app,Windows 與 IDE 整合要等後續。


Muse Code 真正的訊號不在「又一個 coding agent」,而在 harness 設計開始變成產品——event log 重播、常駐 subagent、模型與工具 co-train,這些正把「agent 會不會自己崩掉」變成機率問題而不是聽天由命。對獨立開發者來說,多一個會爭取你注意力與荷包的選項總是好消息;問題不是「誰今天最強」,而是——一年後,哪一家 harness 讓你在週末熬夜時最不容易被中斷?

利益揭露:本文部分連結為合作分潤連結,桌面開發者 4 件套與本文主題無輔助關係,僅為站方選物。


本文根據 Meta AI Research 官方部落格與 methodology 報告整理;benchmark 數值來自官方圖表與第三方轉錄,未經獨立複測。查核日期 2026-08-14。