DarwinX 是什麼?不改模型,先改 agent 外殼
DarwinX 是什麼?Salesforce 一篇論文主張:模型權重可以完全不動,只改提示詞、工具、技能包和流程,coding agent 分數就能往上走。這篇用白話拆它怎麼篩版本、數字哪裡能信、台灣開發者現在能偷師什麼。
目錄+
Salesforce 最近丟出一篇論文:同一顆完全沒重練的 GPT-5.5,只改外層的工具和流程,終端機解題率就從 75.5% 拉到了 83.2%。
這篇論文叫 DarwinX,7 月 31 日上了 arXiv。往前兩週,8 月 5 日 Meta 的 Muse Code 走的是另一條路:把模型和外殼綁在一起練。Salesforce 賭的則是反方向——模型這顆腦子可以完全不動。
對在台灣、香港跑 Claude Code 的人來說,重點不在又多一個實驗室名詞,而在你每週都在改的 rules、skills、hook。
來源:Zhang 等人,DarwinX: Evolving Agent Harnesses Through Natural Selection,arXiv:2608.07545,投稿 2026-07-31。文中數字都是論文自己報的,沒有第三方重跑。
DarwinX 是什麼?
先講白話:DarwinX 不是你今晚能下載安裝的 coding agent,而是一套決定「哪一版外殼可以留下」的規則。
論文把模型外面那層東西叫做 harness(外殼),也就是提示詞、工具、筆記,以及先做什麼、再做什麼的流程。Salesforce 內部的 agent 叫 Monet;DarwinX 則是幫 Monet 不斷換外殼、留下好版本的方法。
模型權重從頭到尾鎖死,所以分數若有提升,只能算在外殼頭上。換句話說:模型沒更新,不代表 agent 沒變強。
它想解決的,其實是你自己改 skills 時很常卡住的兩件事。其一,一條改動線一直延伸下去,早期的某個決定會把後面整條鎖死,分數就停在這。其二,A 類任務修好了,B 類卻悄悄壞掉。
更早的自我改寫系統,例如 Darwin Gödel Machine,也會把舊版本存下來,但新版本多半只跟「上一版」比,很少把兩條各會解不同題的路線合回來。DarwinX 把門檻寫死:新版本一定要多解開題,舊題掉分也不能超過上限。
它怎麼決定哪一版留下?
沒有人在旁邊點頭說「這版比較好」,也不准偷看標準答案。分數來自各測驗自己的自動判分,看的是同一題重複跑幾次、平均能通過幾次。
新版本要比舊版本多解開題,舊題掉分還得壓在一個上限內。論文把這條規則叫 preserve-and-extend(保留並擴充),白話講就是:只能擴充,不能拆東牆補西牆。
嘗試階段,帶一點風險的版本可以先進候選名單;但要拿它當下一輪的起點,還得再考一次,而且考得更嚴。
輸的版本也不丟。整體表現較差的那一版,很可能正好是唯一解得開某題的版本,所以兩版要合併時,新的必須把雙方會的題都保住。合併只能讓會解的範圍變大,不能為了總分好看就犧牲覆蓋率。
它看三種線索,而且都只用來改外殼、不改模型:看失敗紀錄,找出缺哪一步;看更強的示範 run,學它怎麼做;再拿自己過關和失敗的次數對比,找出怎樣才穩。
這跟先把合法路徑畫清楚,再讓模型自己 loop是同一種直覺:下一步可以交給模型決定,但升級規則必須先寫死。
差別在 DarwinX 不是先畫一張流程圖,而是同時養很多版本,丟掉會害舊題掉分的。
論文自己報了哪些數字?
看這些數字,關鍵是先比同一顆模型的前後差,不要拿去跟別人的產品榜對打。公開榜用的模型和思考深度都不一樣,論文自己也說那只是參考,不是公平賽。
Terminal-Bench 2.1 平均過關率(論文 Table 2,未經獨立複測)
他們用四個測驗,一步步把「練習時看得到的分數」和「真正拿來交卷的考題」拉開。
Terminal-Bench 2.1 是練習和考試同一套題。GPT-5.5 鎖死時,Monet 從 75.5% 到 83.2%,多了 7.7 分。
換成 GPT-5.6 Sol、中等思考深度,論文報 84.7%。Claude Code 搭配 Fable 5、開到最高思考深度是 83.8%;OpenAI 自己的 GPT-5.6 Sol 則是 81.8%。
漲分多半出現在步驟又臭又長的題:機器學習和科學計算加 14.8 分,資料庫類加 13.8 分。88 題能配對的裡面,36 題變好、43 題沒變、9 題變差。
TerminalWorld 用 94 題練習,再用沒進過篩選的 41 題考試。Opus 4.8 解出 28 題,也就是 68.3%;沒改外殼前是 25 題。
練習那組卻從五成衝到滿分。這代表迴圈裡用來挑選版本的分數,會把自已被騙過去——練習分數漂亮,不代表考試也會漂亮。
WebArena-Infinity 用 300 條假任務練習,再用 1,260 題真網站任務考試。GPT-5.5 鎖死時,剔除他們判定無效的軌跡後,一次過關率從 43.5% 升到 93.0%。被標成無效的軌跡,一律當作沒過。
SWE-bench Verified 只拿來測「換考場還能不能用」。Terminal-Bench 練出來的外殼原封不動跑 500 題 GitHub issue,論文報 84.2%,對照組是 80.8%,只多 3.4 分。他們拿來比的那幾套外殼,分數都落在 80.8% 到 84.2% 之間。換考場的漲幅,明顯比在原考場小得多。
論文還寫到成本:新解開的 6 題,大約從 11 輪做到 22 輪,token 從 8.9 萬加到 38 萬;本來就會的 69 題幾乎沒多花,13 輪對 12 輪。他們要證明的是:外殼變聰明之後,知道哪題該繼續磨,不是每題都砸更多錢。
哪些地方不要照單全收?
先講限制。Monet 沒開源,DarwinX 也不是安裝檔,你現在買不到、也裝不到,能帶走的只有那套篩選規則。
其次,作者沒有把功勞拆開來證明。版本庫怎麼建、選哪個當下一版、怎麼合併、推論要花多少,都沒有分開抽樣重跑。
他們認為「先核對、再收工」最能解釋 Terminal-Bench 為什麼漲,可這是事後推測,不是一項一項拔掉重測。瀏覽器那場,把兩個版本合起來到底有沒有比單線一直改更好,他們也說還沒做對照。
第三,題數和機器都很吵。TerminalWorld 沒看過的考題只有 41 題,多解一題就差 2.4 個百分點;跟 Claude Code 比,作者自己寫的是「看起來比較好,但統計上算不準」。
第一輪沒看過的考題還碰上機房不穩,後來依事先訂好的規則重跑。SWE-bench 也只測單向搬家,因為練習時看得到的訊號是「流程有沒有跑完」,不是官方測試有沒有過。
第四,瀏覽器那場,agent 能寫 JavaScript 去控 Chrome。他們用程式加另一顆模型去抓作弊,但這不算把 agent 關進真正的沙箱。
有些軌跡要人看,少數根本拿不到,所以論文同時報「原始分數」和「剔除無效後的分數」。
限制講完,能信的其實很窄:模型鎖死時,認真篩外殼,分數確實會動;但不能信的是這套東西已經是你今晚能裝來取代 Claude Code 的產品。
在台灣現在能偷師什麼?
別等 Salesforce 開源。今晚就能用的,是三條規則,跟你跑的是 Claude Code、Codex,還是自己組一層 plan、test、review都無關。
- 升級要寫成門檻,不要寫成感覺。 新 skill、新 hook、新分身,都得講得出多解了哪題、舊題有沒有掉;沒有自動判分,至少留一組回歸題。
- 輸的版本先存著,別刪。 永遠只留最高分那一版,很容易把「只會解某一題」的版本一起丟掉。練習滿分的那隻,不一定在沒看過的題上最穩。
- 先改外殼,再吵要不要換模型。 Muse 把模型和工具綁著練;DarwinX 證明同一顆權重其實還有一段可以擠,而對 API 帳單來說,通常也比較便宜。
利益揭露:以下是聯盟連結,桌面開發者 4 件套能讓鍵盤和線材就位,但管不了 agent 能讀哪些檔。
常見問題
DarwinX 是什麼? Salesforce 實驗室用來篩 agent 外殼的規則。模型權重不動,只改提示詞、工具、技能包和流程。Monet 是他們內部的 agent,DarwinX 是決定哪一版留下的方法。
跟微調差在哪? 微調改模型腦子。DarwinX 鎖死腦子,只換外殼,而且新版本必須多解題、舊題又不能掉太多。
Terminal-Bench 數字能拿來排行嗎? 不能當獨立複測。只能看同一顆模型前後差:GPT-5.5 多 7.7 分到 83.2%,GPT-5.6 Sol 論文報 84.7%。別人的產品榜,模型和設定都不一樣。
現在裝得動嗎? 裝不到。論文沒給安裝包。該帶走的是門檻和封存,不是下一條指令。
下次再看到「我們的 agent 又創新高」,先問模型有沒有重練、新功能會不會弄壞舊題。答得出來,才是在做外殼工程;答不出來,多半只是換了一顆更貴的模型。
本文根據 arXiv:2608.07545 整理。測驗數字都是作者自報,未經獨立複測。查核日期 2026-08-15。