AI 研究 2026 Q2:推理 token 少 11.6 倍、AI 贏東大理三、研究方向正在轉彎
三個訊號說的是同一件事:AI 研究的優先序正在重排。IBM 讓模型用「不是語言」的方式思考,省下 11.6 倍推理成本;GPT-5.2 在東大最難科系筆試贏過人類頂尖考生;十篇論文全部指向「可解釋、可驗證、可縮小」而不是「更強」。2026 Q2 的 AI 研究,不再只在問能做什麼,而是在問怎麼讓人敢用。
目錄+
三件事,分別發生在四月底和五月中。
IBM Research 讓模型用「不是語言」的符號來推理,省下 11.6 倍 token 消耗。GPT-5.2 在東大理三筆試拿到 503 分,比人類最高分高出整整 50 分。五月的 AI 論文清單裡,十篇有七篇不在問「模型更強了嗎」——它們在問「怎麼讓人敢用」。放在一起看,方向很清楚:2026 Q2 的研究優先序,正在從「能力」轉向「效率、可信度、可部署性」。
一、Abstract CoT:模型可以不用「說話」來思考,token 少 11.6 倍
語言模型思考的時候,一定要「說」出來嗎?
這是 Abstract Chain-of-Thought(Abstract-CoT)這篇論文在問的問題。答案是:不一定。而且「說出來」其實很貴。
推理 token 的問題
現在主流的推理模型——不管是 OpenAI o 系列還是 DeepSeek-R1——都用 verbalized CoT:模型把每一步推理過程以自然語言寫出來,再產生最終答案。這個方法有效,但每一步推理都是 token,而 token 就是錢和延遲。
長推理鏈的問題在 2025–2026 年已經是業界公認的效率瓶頸。有人用 token budget 強制截短、有人用 Draft-Thinking 做兩段式壓縮,但核心假設還是「推理必須在語言空間進行」。
IBM Research 的 Keshav Ramji 等人在 ICLR 2026 的 Latent & Implicit Thinking Workshop 提出了另一條路。
抽象 token:只在 post-training 階段引入
Abstract-CoT 的核心想法是:給模型一個「保留詞彙表」(reserved vocabulary),裡面的 token 是全新引入的抽象符號,不對應任何自然語言詞彙。訓練讓模型學會在產生答案前,先生成一小段由這些抽象 token 組成的序列——相當於用一種只有模型自己懂的語言來「想清楚」。
重點是:這整個機制只需要 post-training,不需要重新預訓練。這讓它比其他 latent reasoning 方法更容易部署到現有模型上。
訓練流程分三階段:
- Policy Iteration 暖機:交替做 bottlenecked SFT(用 masking 強迫模型把 verbalized CoT 壓縮成抽象 token)和 self-distillation(讓模型從 prompt 直接生成抽象序列)。
- RL 微調:用 GRPO 對抽象序列的生成做強化學習,constrained decoding 確保只生成保留詞彙。
- 結果:模型學會了一套「推理語言」,能在推理時用極短的抽象序列達到接近 verbalized CoT 的表現。
數字是多少
根據 arXiv 論文(arxiv.org/abs/2604.22709),Abstract-CoT 在 MATH-500、AlpacaEval、HotpotQA 上的表現與 verbalized CoT 相當,但推理 token 少最多 11.6 倍(有些測試顯示最高可達 12 倍)。
這不是用更簡單的題目換來的效率,而是在相同 benchmark 上做到同等準確率、但 token 消耗大幅下降。
和其他 latent reasoning 方法比較
這個研究領域不是 IBM 一家在做。Coconut(Meta,2025)用連續 latent vector 替換 CoT token,也達到了類似的效率提升,但走的是 continuous 路線。Abstract-CoT 選擇 discrete codebook,有個關鍵理由:discrete token 更容易做 constrained decoding,生成過程更可控,也更容易整合進現有的 RL 訓練框架。
另一個差異:Coconut 需要修改模型的前向傳播(把最後一層的 hidden state 當成下一個 token 的 embedding),而 Abstract-CoT 完全在 token 層面操作,對模型架構的侵入性更低。
但還沒有生產就緒的跡象
這篇論文是 workshop paper(ICLR 2026 的 Latent & Implicit Thinking Workshop),不是 main conference track,代表它還在研究探索階段。目前沒有公開的模型權重或開源實作,也沒有在 MMLU、GPQA-Diamond 這類主流 benchmark 上的完整評估。
另一個問題是可解釋性。模型思考的內容變成了人類看不懂的抽象符號序列,對需要稽核推理過程的應用場景(醫療、法律、金融)是潛在的合規障礙。這不是 Abstract-CoT 特有的問題——所有 latent reasoning 方法都面對這個取捨——但值得在評估時記入。
如果後續有完整模型發布,Abstract-CoT 最直接的應用場景是推理 API 的成本控制:相同效果、少一個數量級的 token 消耗,對高頻呼叫的企業用戶意義很大。但那之前,這還是一篇值得追蹤的研究方向,而不是可以馬上拿來用的工具。
二、AI 贏東大理三:503 分 vs 人類最高 453.6 分
2026 年 4 月 27 日,日本經濟新聞、AI 新創 LifePrompt、以及升學補習班河合塾聯合公布一份研究結果:OpenAI 的 GPT-5.2 Thinking 在東京大學理科三類入學考試拿到 503 分(滿分 550),比人類最高分 453.6 分高出約 50 分。
這是有史以來第一次,AI 在東大最難科系的筆試中全面超越人類頂尖考生。
具體數字
根據 LifePrompt 與河合塾的聯合評分(非 AI 自評,是補習班教師實際批改答卷):
東大理三 2026 入學考成績(滿分 550)
- GPT-5.2 Thinking:理三 503 分 / 550 分,文三 452 分 / 550 分
- Gemini 3 Pro Preview(Google):理三 496 分
- Claude Opus 4.5(Anthropic):通過理三門檻
- 人類最高分:理三 453.6 分;人類平均錄取分:377.7 分
三家 AI 同時通過京都大學醫學部所有科目門檻。
在數學方面,OpenAI 拿到東大(文組+理組)與京大數學共五科滿分,Google 拿到三科數學滿分,Anthropic 拿下東大物理滿分。
還是有弱點
分數很亮眼,但有一個地方讓評卷老師皺眉:OpenAI 的世界史申論題只拿了 25%。
這個差距揭示了一個仍然存在的結構性問題:AI 在封閉式邏輯(數學、物理、化學)上接近完美,但在需要歷史脈絡判斷、論證一致性的開放式申論,仍有明顯落差。河合塾的老師評語是,理科數學的解題過程「非常接近模範解答」,但論述類科目的論點深度不及頂尖人類考生。
這不是第一次,但這次意義不同
LifePrompt 從 2024 年就開始對東大出題:
- 2024 年:ChatGPT-4 未能達到最低入學門檻
- 2025 年:o1 首次通過門檻
- 2026 年:GPT-5.2 Thinking 理三拿到 503 分,超越人類最高分
兩年內從「不及格」到「超越狀元」,這個進步曲線本身比單次成績更值得注意。
但 AI 能「考進」東大,然後呢?
慶應大學教授、日本人工智能學會會長倉原茂明說了一句讓人停下來想的話:「人類和 AI 不應該在同一個賽場上競爭,因為 AI 擅長吸收大量既有資料。」
他的意思不是 AI 作弊,而是考試本身設計的初衷是篩選人類的記憶、理解與應用能力——AI 在這個框架下「獲勝」,並不等同於 AI 具備人類式的理解。數學滿分的 AI,能不能在東大醫學部的臨床判斷上也達到同等水準?這是完全不同的問題。
對教育體系而言,這份報告的真正衝擊不在於 AI 比學生聰明,而在於「考試能否繼續作為人才篩選工具」這個前提,開始動搖。
數據來源:LifePrompt、河合塾聯合研究;Straits Times、Xinhua、Kyodo News 報導(2026 年 4 月 27 日)
三、2026 Q2 論文集錦:十篇都在說同一件事
GPT 最便宜的版本,搭配「多寫幾個答案、跑測試、選最好的」這個超簡單的流程,在軟體工程的 bug 修復測試拿了 76.4%。
比很多貴很多的強模型直接回答還高。
這一個數字背後藏著一件很重要的事:AI 研究的方向正在改變。不再只是讓模型「更聰明」,而是讓模型「可以被檢查、被理解、被縮小還能用」。
今天整理了 X 上熱傳的 10 篇論文。這些論文來自不同領域——可解釋性、推理效率、醫療 AI、多代理系統——但全部都在解決同一個底層問題:AI 不是不夠強,是不夠「讓人敢用」。
為什麼 AI 研究的方向在改變?
過去幾年,AI 的發展主軸是「讓模型更大、更強、Benchmark 更高」。GPT-4、Claude 3、Gemini Ultra,比的都是在各種測試上的分數。
但現在越來越多人發現一個問題:模型夠強了,但企業不敢真的把它用在關鍵流程上。
原因很簡單:
- AI 給了一個答案,但你不知道它為什麼這樣回答
- AI 出錯了,但你不知道哪個部分出錯、怎麼修
- AI 很強,但要跑起來需要很貴的 GPU,部署成本高
這三個問題,對應到今天論文的三個方向:可解釋、可驗證、可縮小。
今日 10 篇論文的問題方向分佈
第一部分:AI 到底在幹嘛,能說清楚嗎?
VPD:史上第一次能「拆開」模型看裡面
一個大型語言模型有幾十億個參數。當它輸出一個有問題的答案,你根本不知道是哪個參數惹的禍。目前最常用的可解釋性方法是看「attention pattern」——但 attention 告訴你模型在「看」哪裡,不告訴你模型用那個資訊「做了什麼」。
VPD(Variational Parameter Decomposition)提出一個新框架:把模型的參數空間拆解成不同的「功能子空間」,每個子空間對應模型的某一類行為。白話版:把模型從「一個黑盒」變成「一棟有房間的大樓」。每個房間負責一件事,你可以直接走進那個房間改東西,不用整棟大樓拆掉重蓋。
實際能做到:追蹤行為來源、精準編輯特定功能、不需要重新訓練。對企業來說,這代表「AI 出問題可以修,而且知道在哪修」。
SAE 微調 CLIP:讓看圖的 AI 說清楚它在看什麼
CLIP 很準,但你不知道它為什麼準。它用幾千個「視覺特徵」來描述一張圖,這些特徵糾纏在一起,根本看不懂每個特徵代表什麼。
這篇論文在微調 CLIP 時,加入 Sparse Autoencoder(SAE)的稀疏化約束,強迫模型描述一張圖時只能用「少數幾個清楚的關鍵詞」。效果:從原本 1000 個糾纏特徵縮到 30 個可被人類理解的清楚特徵,出錯時可以直接定位問題所在。意外收穫是稀疏化之後模型對噪點干擾的抵抗力反而更強。
SAE 微調前後可解釋性分數對比(示意)
第二部分:怎麼讓 AI 回答更準、更有效率?
弱模型 + 跑測試:76.4% 的意外結果
不用強模型,改用 GPT-5.4 nano——GPT 家族裡最小、最便宜的版本。但不是直接讓它回答,而是:讓它針對同一個問題生成 N 個不同的解法,每個解法都實際跑一遍測試,選通過測試最多的那個當最終答案。
flowchart LR
A[GPT-5.4 nano] -->|生成 N 個方案| B[候選方案池]
B -->|執行每個方案| C[跑測試看結果]
C -->|哪個過最多測試| D[選出最佳方案]
D -->|最終答案| E[76.4% SWE-bench]
結果在 SWE-bench(讓 AI 修真實 GitHub issue 的測試)上拿到 76.4%:
SWE-bench 分數對比(%)
關鍵在於「驗證訊號」。跑測試給了一個客觀的、不需要人類判斷的評分標準。這個方法適用於任何答案「可以被客觀驗證」的場景:修 bug、解數學題、翻譯、寫 SQL。
RLVR:讓 AI 從失敗中學,而不是靠人類打分
RLHF(從人類反饋學習)的問題是:人類很難評估複雜推理的中間步驟。人類的打分偏向「答案看起來有沒有道理」,而不是「推理過程對不對」。
RLVR(Reinforcement Learning with Verifiable Rewards)把評分改成「客觀驗證」:數學題算答案、程式碼跑測試、邏輯推理用正式驗證器。不靠老師打分,靠「考試系統自動批改」。失敗的嘗試本身也是學習資料——AI 從「這個答案為什麼沒過測試」裡學習改進。
EffOPD:訓練小模型快 3 倍,還不會跑歪
on-policy distillation 最有效但最不穩定:學生模型在更新的過程中,生成分佈容易漂移,導致越訓練越差。
EffOPD(Efficient On-Policy Distillation)加了一個「軌跡穩定」的機制,讓學生模型的生成分佈在訓練過程中不會漂移太遠。結果:訓練速度快 3 倍、最終效果和不穩定的 on-policy 一樣好甚至更好、不需要大量超參數調整。
第三部分:醫療 AI 終於要認真整合了?
Nature 論文:AI 醫生要同時看 X 光、血報告、病歷
大多數醫療 AI 論文只處理一種資料——放射科 AI 只看影像,病歷 AI 只讀文字,檢驗 AI 只看數值。但真實的臨床判斷,醫生同時在看這三種。
這篇 Nature 論文提出多模態整合框架,讓 AI 能同時處理醫學影像(X 光、CT、病理切片)、結構化數值(血液報告、生命徵象)、非結構化文字(醫師問診記錄、出院摘要)。最難的部分是對齊機制——讓模型知道「這張 X 光」和「這份血報告」是同一個病人的資料。在跨科別多模態判斷任務上,都顯示比單模態方法更準確。
Padding + VAE:病人資料不完整?AI 幫你補
精準醫療訓練資料永遠不完整:每個病人有的組學資料不一樣(基因組、轉錄組、蛋白質組、代謝組),造成訓練資料嚴重不整齊。
這篇論文的解法:先用 Padding 把所有資料補齊到同樣維度,再用 VAE 根據現有的組學資料生成「缺少的那份組學的合理版本」。在癌症分類任務上,F1 分數超過 0.95。
癌症分類 F1 分數對比(示意)
F1 超過 0.95 在醫療領域意味著準確率和召回率都很高,已接近可以進入臨床試驗評估的門檻。
第四部分:多個 AI 一起工作,怎麼確保不亂來?
MetaAgent-X:讓一群 AI 真正「合作」而不是「各做各的」
現在的多代理框架(AutoGen、CrewAI)的根本問題:每個 AI 優化的是自己的子任務,不是整體目標。就像一個團隊,每個人只管自己的 KPI,但整個專案還是可能失敗。
MetaAgent-X 用端到端強化學習,讓整個多代理系統「一起訓練」。評分標準是整個系統的最終輸出,而不是每個代理的子任務表現。副產品:你現在有一個明確的 reward signal 告訴你「這群代理的協作有沒有在往目標走」,可以監控協作品質而不是靠感覺判斷。
LLM 仿失智症患者語音:合成資料也要被驗證
失智症篩查需要分析病患語音,但這類資料收集成本極高,大多數研究訓練資料只有幾百份。
這篇論文讓 LLM 學習失智症患者語音的語言特徵,生成合成的語音轉錄文字擴充訓練集。加入合成資料後分類模型效能確實提升。但更值得注意的問題是:合成資料「在統計上看起來像病患」,但這不代表它真的反映病患的語言分佈。
這篇論文的做法是對的:用「臨床預測效能」來驗證合成資料品質。不問「合成資料像不像真實資料」,而問「加了合成資料之後,模型在真實病患上的表現有沒有進步」。可驗證的訊號比主觀判斷更可靠。
HuggingFace 今天整理了 42 篇:兩篇特別值得看
今天 HuggingFace Daily Papers 彙整了 42 篇論文。兩篇特別值得記:
CiteVQA:視覺問答(Visual QA)AI 在回答「圖片裡有什麼」的同時,標注「這個答案是根據圖片的哪個區域」,相當於給每個答案附上引用來源。直接解決了「AI 說圖片裡有什麼,但你不知道它在看哪裡」的問題。
PhysBrain:具身 AI(機器人、虛擬人)做決策時,加入物理模擬來增強對「如果我這樣做,世界會怎麼變」的預測能力,讓 AI 在做決策前可以在「虛擬物理世界」裡先試看看。
10 篇論文放在一起,說的是什麼?
10 篇論文主題分佈
把這 10 篇並排看,有一條很清楚的主線:
研究者不再只問「模型能做什麼」,而是開始問「模型在做什麼、為什麼做對、做錯時能不能被抓住、能不能縮小還能用」。
| 問題 | 對應論文 | 解法 |
|---|---|---|
| AI 出錯,不知道在哪裡 | VPD、SAE-CLIP | 可解釋性:拆開模型看內部 |
| AI 的答案,不知道對不對 | 弱模型搜尋、RLVR | 可驗證:用客觀測試當評分 |
| 強模型太貴跑不起來 | EffOPD | 可縮小:蒸餾快 3 倍還穩 |
| 醫療資料不完整 | Nature 整合、多組學 VAE | 補齊資料再訓練 |
| 多 AI 協作沒有共同目標 | MetaAgent-X | 端到端訓練整體 reward |
模型已經夠強了。GPT-4、Claude 3、Gemini Ultra 的能力,已經超過大多數應用場景的需求。真正阻止 AI 被廣泛部署的,是可信任度、可解釋性、和部署成本。
三個訊號合起來看,方向一致:能力已經不是 2026 年 AI 研究的主戰場。接下來的競爭,在效率(token 少 11.6 倍)、可信度(能驗證、能解釋)、可部署性(縮小還能用、醫療整合)。IBM 的 Abstract-CoT 是效率那條線;東大考試是能力有了人類可比基準之後的下一個問題——然後呢;十篇論文是那個「然後呢」的方向。
想在本地跑 LLM、自己驗證推理結果,麗臺 RTX PRO 4000 Blackwell 24GB 是目前跑 Llama 3 70B Q4 的合理選擇。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。