SWE-Bench Pro 三成任務是壞的:OpenAI 五個月內二度撤回自家推薦
OpenAI 對外說,SWE-Bench Pro——目前最多人拿來評測 AI 寫程式能力的 benchmark 之一——大概三成任務其實是壞的,正式撤回半年前才給的推薦。這是 OpenAI 五個月內第二次認錯:二月才棄用 SWE-Bench Verified,七月換 SWE-Bench Pro 出包。這篇拆解壞在哪四個地方、為什麼這次撤回不能只當 PR 稿看,也整理現在還能信的 coding benchmark 剩哪些。
目錄+
OpenAI 昨天發了一則推文:他們稽核了 SWE-Bench Pro——目前最多人拿來評測 AI 寫程式能力的 benchmark 之一——發現裡面大概三成任務是壞的。他們正式撤回半年前自己給的推薦,不再建議研究社群把它當成主要的 coding 評測標準。
這句話本身就值得停下來想一下:一家公司對外承認,自己半年前推薦的評測工具是壞的。 這篇拆三件事:①壞在哪四個地方、②這其實是 OpenAI 五個月內第二次認錯、③這次撤回該信多少。
壞在哪:四個具體問題,不是「模型變強了」
OpenAI 這次動用了自動化的資料點分析流程,先掃過模型的作答紀錄、任務說明、測試失敗紀錄,標出可疑的任務,再讓 Codex 驅動的稽核 agent 逐一覆核,最後交給五位有經驗的軟體工程師獨立審查,有分歧就再往上升級討論。
結果不好看。自動化流程標出 200 個任務(佔 27.4%)有問題,人工審查團隊則抓出 249 個(佔 34.1%)。兩邊平均下來,大概就是外面常引用的「三成」。
問題集中在四類:
- 測試太嚴格——題目要的是功能正確,但測試卻在檢查沒被明確要求的實作細節,很多其實答對的方案被判錯。
- 題目說不清楚——藏在題目背後的隱藏測試,要求了 prompt 裡根本沒寫、也推不出來的東西。
- 測試覆蓋不足——測試只檢查了功能的一小部分,寫得不完整的答案照樣能通過。
- 題目本身在誤導——題目描述指向的方向,跟測試真正要求的東西是矛盾的。
這四個問題有個共通點:都跟模型會不會寫程式沒關係,跟出題的人有沒有把題目出對有關係。 OpenAI 自己給的結論很直白——建議未來的 benchmark 要有經驗豐富的工程師從一開始就參與設計,而不是事後才補測。
這不是第一次:五個月內,第二次認錯
如果你只看這則推文,可能會覺得是單一事件。但把時間軸拉開,故事完全不一樣。
今年二月,OpenAI 就先發過一篇文章,棄用了 SWE-Bench Verified——上面說,他們稽核發現這個 benchmark 已經嚴重污染:前沿模型能直接背出測試的標準答案,甚至不用讀懂題目就能寫出正確的 patch。當時他們給的建議,正是「改用 SWE-Bench Pro」,理由是 Pro 用的是版權更嚴格的私有程式庫,汙染風險比較低。
七月,同一家公司回頭稽核自己五個月前才推薦的 SWE-Bench Pro,結果查出近三成任務本身就有問題。這不是同一個 bug 的兩次報導,是兩個不同的問題——一個是模型作弊,一個是出題不嚴謹——但發生在同一家公司身上,間隔不到半年。
這件事該怎麼讀,是這篇真正想談的。
「巧合」是不是巧合
先講最直覺的懷疑:OpenAI 在 SWE-Bench Pro 的官方排行榜上,確實不是第一名。Scale AI 自己維護的榜單上,Claude Opus 系列排在 GPT 系列前面;另一份聚合榜單裡,GPT-5.5 大概落在 58% 左右,同期的 Claude Opus 4.8 則接近 69%。一家公司帶頭質疑一個自己排名不佔優勢的 benchmark,動機不無可疑。
Ethan Mollick 在推文底下也有類似的質疑,但角度不太一樣:他指出 OpenAI 自己花大錢做的 GDPval 評測,反而遲遲沒有公布 GPT-5.6 的分數——如果真心在意評測透明度,選擇性公布本身就是個問題。
但這個懷疑並不能完全成立。因為早在五月,Datacurve 旗下的 DeepSWE 團隊就已經獨立稽核過 SWE-Bench Pro,發現它的測試驗證器假陽性率高達 8.5%、假陰性率更到 24%,還抓到 Claude Opus 有超過一成的作答紀錄是靠讀取容器裡的 Git 歷史紀錄「偷看答案」,而不是真的解題。換句話說,兩個月前就有第三方獨立指出同一個 benchmark 有嚴重瑕疵——而且瑕疵不只對 OpenAI 不利,也讓 Claude 的分數蒙上一層陰影。這件事不是只有輸的一方在抱怨。
還有一層常被忽略的事實:SWE-Bench Pro 本身不是學界做的。它是 Scale AI——一家靠資料標註和模型評測服務營利的商業公司——在 2025 年推出的產品。稽核 benchmark 的 OpenAI 有利益,設計 benchmark 的 Scale AI 一樣有利益。這場「誰在說謊」的討論,場上其實沒有一個完全中立的角色。
真正該記住的一句話是:benchmark 分數測的常常不是模型有多強,是誰比較會鑽這個 benchmark 的漏洞。
那現在要看什麼
這件事跟 RAG 系統評測碰到的問題,其實是同一個底層邏輯。RAG 調校那篇文章談過用 LLM 當裁判的風險——裁判要比被評的模型強,而且裁判本身也可能有系統性的知識盲點。SWE-Bench Pro 的問題换了個殼,但邏輯一樣:你以為在測模型,其實常常只是在測評測系統本身有沒有漏洞。
這也讓一些原本很風光的頭條看起來尷尬。Alibaba 的 Qwen3.6-Max-Preview 發布時主打的賣點之一,就是拿下 SWE-Bench Pro 等六個 coding benchmark 第一名——現在回頭看,那個第一名的含金量,得先扣掉三成任務本來就是壞的這個前提再算。連 OpenAI 自己四月發布 GPT-5.5 時,主打的重點都已經不是單一 benchmark 分數,而是 token 效率跟任務長度——這說明連做 benchmark 的人自己,都已經不太敢只拿一個排行榜說話。
業界現在比較常見的做法,是把 Datacurve 的 DeepSWE、持續補充新題目的 LiveCodeBench 當補充參考,再加上自己拿候選模型跑一次自家程式庫的實際任務。如果你自己也在動手搭這類評測 pipeline、需要跑腳本、盯 log、來回除錯,桌面工具是不是順手其實會直接影響效率——蝦皮這組開發者桌面四件套 是編輯挑過的 CP 值組合,適合正在整理自己開發環境的人。
利益揭露:文中蝦皮開發者桌面四件套連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。
排行榜的數字看久了會忘記一件事:那組數字背後,永遠有人在決定題目怎麼出、測試怎麼寫、什麼算通過。這次是 OpenAI 自己把這件事攤開來講,下次換誰被攤開來講,現在沒人敢打包票。