跳到主要內容
OpenAI GPT-5.5 發布:真正的躍進不在分數,而在「同樣速度、更少 token、更長任務」
/閱讀約 12 分鐘/

OpenAI GPT-5.5 發布:真正的躍進不在分數,而在「同樣速度、更少 token、更長任務」

OpenAI 在 4 月 23 日同步在 ChatGPT 與 Codex 上線 GPT-5.5。Terminal-Bench 2.0 82.7%、FrontierMath Tier 4 35.4%、GDPval 84.9% 全面超車 GPT-5.4 與 Claude Opus 4.7。但真正的結構性突破不在單一分數,而在三個維度的組合:per-token 延遲不變、token 消耗顯著下降、任務 horizon 大幅延長——這對應用層開發者的意義,比「又一個更強的模型」深得多。

目錄+

OpenAI 在 2026 年 4 月 23 日把 GPT-5.5 同步推到 ChatGPT 與 Codex,距離 GPT-5.4 只有 6 週、距離 Claude Opus 4.7 僅 7 天。別急著比 benchmark 分數——這次真正的突破,是三個維度同時往外推:per-token 延遲沒變、token 消耗變少、任務 horizon 變長。

Benchmark:全面超車,但那不是重點

所有數字引自 OpenAI 官方 blog,先看和同公司 GPT-5.4 的縱向對比:

Benchmark測什麼GPT-5.4GPT-5.5變化
Terminal-Bench 2.0命令列 agent 工作流75.1%82.7%+7.6
FrontierMath Tier 4研究級數學27.1%35.4%+8.3
GeneBench基因/量化生物學分析19.0%25.0%+6.0
CyberGym資安任務79.0%81.8%+2.8
GDPval (wins/ties)44 種職業的知識工作83.0%84.9%+1.9

GPT-5.5 Pro 版本在數學與工具輔助任務再往上一階(FrontierMath Tier 4 拉到 39.6%、GeneBench 33.2%)。

再看橫向,對 Claude Opus 4.7 與 Gemini 3.1 Pro 的外部交叉比較:

GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro(數據來源:OpenAI 官方發表)

兩張表給出三個觀察:

  1. Terminal-Bench 2.0:GPT-5.5 以 82.7% 大幅領先 Opus 4.7 的 69.4%,差距 13.3 點。這是考驗「AI 在 shell 裡規劃、執行、從失敗中恢復、自行驗證」的長任務測試,差距不小。獨立 leaderboard tbench.ai 在同一天收錄 Codex + GPT-5.5 拿 82.0%±2.2、排名第一,與官方回報的 82.7% 大致一致。
  2. SWE-Bench Pro:Opus 4.7 仍以 64.3% 領先 GPT-5.5 的 58.6%,差約 5.7 點。OpenAI 在 footnote 直接標註這個 benchmark「有記憶化證據」(連結到 Anthropic 自己的說明)——某種心照不宣的保留。如果你的工作流是「一次產出一個正確 patch」,Opus 4.7 很可能還是更好的選擇。
  3. GDPval:跨 44 個職業的實務生產力評估,GPT-5.5 的 84.9% 明顯領先。這是最接近「AI 能不能做你實際的工作」的數字。

但這些分數不是最有趣的部分。benchmark 戰爭打到 2026 年,單一數字早就決定不了什麼——得看下面這三個被低調放進技術描述裡的維度。

真正的躍進:同樣速度、更少 token、更長任務

第一,同樣 latency,更高智能。 OpenAI 明確寫了:「GPT-5.5 matches GPT-5.4 per-token latency in real-world serving」——每個 token 的產生速度和 GPT-5.4 一樣快,但智能層級顯著更高。

這在 frontier model 的歷史上是反常的。通常「更強」=「更大」=「更慢」。GPT-5.5 打破這個三角,靠的是與 NVIDIA GB200/GB300 NVL72 硬體的協同設計,以及更有效率的推理堆疊。過去在「更聰明但更慢」和「夠用但更快」之間的取捨,被砍掉了一個維度。

第二,Codex 任務顯著更少 token。 官方描述是「uses significantly fewer tokens to complete the same Codex tasks」。第三方整理(如 Jake Handy 的 Model Drop)估算 Codex 任務約減少 40% 的 output token,但官方沒給精確百分比,所以這裡保留「顯著更少」的表述。

定價上,GPT-5.5 是 API 輸入 5/M、輸出5/M、輸出 30/M、1M context window,比 GPT-5.4 貴。但這個「更少 token」的設計意味著:單看 pricing page 會覺得貴,Codex 這類 agent-heavy workload 的實際帳單卻可能持平甚至下降。訂閱用戶(Plus/Pro/Business/Enterprise)幾乎無感,API 開發者的「每個任務成本」反而下降。Artificial Analysis 的 Coding Index 數據是 GPT-5.5 達到 SOTA coding 智能,成本只有競品 frontier coding model 的一半(OpenAI 官方引用,未指名競品)。

第三,長 horizon 任務 dramatic 飆升。 這是最被低估的數據。OpenAI 自己的 MRCR v2 長 context 評測,在 512K–1M token 這一段:GPT-5.5 拿 74.0%、GPT-5.4 只有 36.6%、Claude Opus 4.6 是 32.2%。這不是漸進提升,是翻倍。當 context 超過 50 萬 token,GPT-5.5 才是唯一能有效使用的模型。對「AI 讀完整個 codebase、整份合約、整本財報」的工作流,這個差距直接決定能不能做。同樣脈絡還有 OpenAI 新設的 Expert-SWE,測「中位數由人類完成需 20 小時」的長任務——GPT-5.5 拿 73.1%,GPT-5.4 拿 68.5%。這個維度代表的是「AI 能不能做一天的工作而不迷路」。

被當成「研究夥伴」的模型

這次發表 GPT-5.5 和 Codex 綁得很緊。Codex 同步獲得 400K context window、Fast mode、computer use 能力、以及與 OpenAI Apps / ChatGPT 的深度整合。API「很快」跟進這個用詞也暗示:OpenAI 希望用戶先在 Codex 裡建立依賴,再把 API 推出去。GPT-5.5 的價值有很大一部分只在 Codex 裡才完全兌現。

最值得注意的是 OpenAI 第一次公開承認的一件事:他們用 GPT-5.5 + Codex 改寫了服務它自己的推理基礎設施。

GPT-5.5 helped find and implement key improvements in the stack itself. Put simply, the model helped improve the infrastructure that serves it.

Codex 吃完幾週的 production traffic 資料後,寫了一套 custom heuristic partitioning,把 token 生成速度提升超過 20%(官方 blog 原文數字)。這是 AI 自舉(self-bootstrapping)的第一個公開、可驗證的案例——不是「AI 設計下一代 AI」這種誇張敘事,是「AI 優化服務自己的基礎設施」這種可觀測、可衡量的具體工程場景。

科研端也有三個落地案例,把「co-scientist」敘事第一次坐實:

  • Ramsey number 新證明:OpenAI 用內部 harness + GPT-5.5 發現 off-diagonal Ramsey number 一個長期懸而未決的漸近性結果,用 Lean 驗證通過(PDF)。這是 AI 第一次在被驗證的前提下貢獻非平凡數學證明。
  • Jackson Laboratory 基因分析:免疫學教授 Derya Unutmaz 用 GPT-5.5 Pro 分析 62 個樣本、近 28,000 個基因的資料集,產出完整研究報告——他說原本需要團隊好幾個月。
  • Adam Mickiewicz 大學數學系:助理教授 Bartosz Naskręcki 用 11 分鐘、一次 prompt,讓 Codex 做出代數幾何視覺化 app(兩個二次曲面相交曲線 + Weierstrass 模型轉換),這類工作原本需要 Maple、Mathematica、SageMath。

三個案例的共通點是:研究者不再把 ChatGPT 當「一次回答」引擎,而是當研究夥伴——批判手稿、壓力測試論證、提出分析方案、跑程式、讀 PDF。

企業端也已經不是試用階段。OpenAI 內部超過 85% 員工每週使用 Codex,橫跨工程、財務、行銷、資料科學。具體案例:Finance 團隊用 Codex 審閱 24,771 份 K-1 稅表、總計 71,637 頁,比去年加速兩週;GTM 團隊自動化每週業務報告,每週省 5–10 小時。外部背書名單包含 NVIDIA、Cisco、Databricks、Harvey、Box、Cursor、Cognition、GitHub、JetBrains。Cursor 共同創辦人 Michael Truell 的評語很具體:「GPT-5.5 比 GPT-5.4 更聰明也更堅持,停得更晚,對使用者交給 Cursor 處理的複雜、長時間工作最重要。」

對應用層開發者的意義

把前面的事實收束成一句:GPT-5.5 不是「又一個更強的模型」,而是同時在智能、速度、token 效率三個軸上進步的模型。

過去兩年應用層做產品選型,常要在「品質」和「成本」間取捨。GPT-5.5 把取捨的座標軸往外推了一截。現在的問題從「能不能做出可用的 AI 產品」變成「能不能想清楚 AI 產品要做什麼」。基礎設施的護城河越深,應用層的差異化就越要往「產品判斷」和「使用者體驗」走——這對有觀點、有設計能力的 builder 友善,對「只會套 API」的團隊越來越不友善。

具體誰該動手:值得立刻換的是長任務 agent workflow(多步、跨工具、需要持續規劃)、Codex 重度使用者、研究型場景、做大型 migration/refactor 的專案;可以等的是短對話、單次問答、只用 API 的輕量應用(等「很快」的 API 發布後再看價格/延遲實測)。要注意 API 尚未開放、SWE-Bench Pro 單項仍由 Opus 4.7 領先、GPT-5.5 Pro 只有 ChatGPT Pro/Business/Enterprise 能用、Fast mode 是 1.5× 速度配 2.5× 價格。

值得補一句的是:GPT-5.5 的「更省 token」紅利集中在雲端 API,但 70B 級長 context 的本地推論與微調仍吃 VRAM。需要在本地跑 70B 全精度、做多 GPU 訓練的工作室,麗臺 RTX PRO 5000 Blackwell 的 48GB VRAM 是一個不用看 OOM 臉色的規格選項,適合把雲端推不動、或不想把資料往外送的長任務搬回本地的場景。

利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。硬體推薦僅就公開規格與適用情境描述,未代表本人長期實測。

GPT-5.5 把「更聰明」拆成三個可以分開驗證的維度——速度、token、horizon。看懂這三個軸怎麼動,比追逐下一個分數更重要。

參考資料

文章中引用的數據與事實均來自以下公開來源:

OpenAI 官方

NVIDIA 官方

第三方整理與評測

SWE-Bench Pro memorization 疑慮