PerceptionBench 是什麼?Kimi 發現 AI 看圖不穩
PerceptionBench 是 Kimi 用來拆解多模態模型視覺感知的開源評測,含 3,000 道題與 10 種原子能力。本文解釋資料怎麼建立、Kimi K3 為何拿到 58.5%,以及總分穩定卻不代表每一題都看得可靠。
目錄+
16 個前沿多模態模型接受一套只考看圖、不考背景知識的測試,沒有一個答對 60%。
Kimi K3 以 58.5% 排第二。這個總分在四次測試裡只波動 0.6 個百分點,看起來很穩。可是把同一道題連問四次,K3 每次都答對的比例只有 42.7%。
總分穩定,不等於每次都看清楚。
PerceptionBench 是 Moonshot AI 開源的多模態視覺感知評測。它把定位、計數、OCR、深度與視覺幻覺等能力拆開,每一道題只測一種能力,答案不需要外部知識或多步推理。
這是 Kimi K3 開源系列的第四篇。模型與授權邊界可先看 Kimi K3 開放權重整理,架構背景在 Kimi K3 技術報告拆解,訓練和 Agent 系統則整理在 FlashKDA、MoonEP 與 AgentENV 基礎設施專文。
PerceptionBench 是什麼?
一般多模態 benchmark 只看最後答案。模型答錯一道圖表題,原因可能是數字沒看清楚,也可能是公式推錯,甚至是缺少領域知識。最後的零分無法告訴開發者該修 vision encoder、推理能力,還是提示詞。
PerceptionBench 改看最早出錯的步驟。研究團隊收集模型在 42 個既有 benchmark 上的失敗,將錯誤分成感知、推理、知識、題目前提與其他五大類,再細分成 22 種錯誤。這次公開的評測只保留感知分支的 10 種能力。
這 10 種能力是:
| 能力 | 題目在測什麼 |
|---|---|
| 視覺關係 | 物件、線條與路徑之間的關係 |
| 視覺計數 | 數出符合條件的物件 |
| 視覺屬性 | 顏色、形狀、材質與局部特徵 |
| 深度與 3D | 前後、遮擋與立體結構 |
| 視覺定位 | 找出指定物件或區域 |
| 視覺比較 | 比較大小、粗細與差異 |
| 細粒度辨識 | 分辨相近物件與微小特徵 |
| 上下文整合 | 合併多張圖或圖中多處資訊 |
| OCR | 讀取文字、大小寫與標點 |
| 視覺幻覺 | 判斷圖中不存在的物件,答案常是零 |
視覺幻覺不是一般的知識性幻覺。題目會問圖中有幾張白色桌子,正確答案可能是零。模型若因為辦公室通常有桌子就猜一張,問題出在它把合理情境當成眼前證據。
3,000 道題怎麼建立?
研究團隊先建立超過 17,000 道人工驗證的內部題庫,再公開其中 3,000 道。公開資料有兩個來源:
- 1,800 題來自既有 benchmark 的模型失敗,占 60%。標註員把原本需要多步解題的問題,拆成只測單一感知能力的子問題。
- 1,200 題使用補充圖片重新命題,占 40%,用來補齊較少見的能力與圖片類型。
每一題都要有短而唯一的答案。自動驗證先檢查題目是否真的只考指定能力,接著確認答案能直接從圖中取得,最後交由人類標註員獨立複查。論文表示,資料處理由超過 10 位有多模態評測經驗的專業標註員完成。
團隊也用 Image Similarity Challenge descriptor 比對 LAION 與 Common Crawl。圖片相似度超過 0.95 就移除,用來降低近似重複與資料洩漏的機會。
這種建法有一個好處。分類不是研究者先想好再找題目填入,而是從目前模型確實答錯的地方往回整理。
但它也有時效性。論文明確承認,這套 taxonomy 受目前模型世代與 42 個來源 benchmark 的覆蓋範圍影響。當模型的失敗型態改變,10 種能力分類也可能需要重做。
Kimi K3 在 PerceptionBench 表現如何?
論文用統一提示詞與各模型可用的最高 reasoning budget 測試 16 個模型。所有問題都是開放式短答,再由 GPT-oss-120B 對照標準答案給 0 或 1。研究團隊抽查 300 個答案,自動評分與人工判斷有 299 個一致,agreement 是 99.7%。
以下是整體準確率前六名:
PerceptionBench 整體準確率前六名,資料來源:官方論文
Kimi K3 的 58.5% 比第一名少 1.2 個百分點,也是論文測試中分數最高的開放權重模型。它在視覺定位拿到 70.3%,視覺關係 68.2%,OCR 61.2%。相對弱項是視覺幻覺 41.7%、深度與 3D 52.4%,以及上下文整合 53.3%。
總分相近的模型,弱點可能完全不同。GPT-5.5 與 Gemini-3.1-Pro 只差 0.4 個百分點,但前者的定位高出 13.1 點,後者的 OCR 高出 7.8 點。產品若需要讀掃描文件,和需要點擊畫面按鈕,選型答案不一定相同。
另一個反差出現在視覺幻覺。整體第一的 GPT-5.6-Sol 在這一類只有 26.9%,中段的 Gemini-3.5-Flash 卻拿到全榜最高的 50.6%。論文推測,偏向積極作答的模型在一般題目可能得分較高,遇到圖中根本沒有目標的題目時,也更容易硬猜。
為什麼平均分穩定,模型仍然不可靠?
研究團隊把 Kimi K3、GPT-5.6-Sol 與 Gemini-3.5-Flash 各跑四次。K3 的四次準確率是 58.2%、58.2%、58.8% 與 58.7%,標準差只有 0.32。就排行榜而言,58.5% 很穩。
接著換一種算法:
pass@4只要求四次裡至少答對一次。pass4要求同一道題四次都答對。
Kimi K3 同題重複四次的可靠度,資料來源:官方論文
兩者差了 31.2 個百分點。這表示 K3 有一批題目偶爾能答對,卻沒有穩定掌握對應的視覺能力。排行榜每次都會在不同題目上答對與答錯,互相抵銷後,平均分仍然很接近。
如果 Agent 要靠截圖操作網頁,這個差別很實際。一次看錯按鈕位置,不會因為模型在另外三張圖答對而消失。產品需要指定任務反覆成功,大量題目的漂亮平均還不夠。
PerceptionBench 有哪些限制?
這套評測比單一總分更能診斷問題,但仍不能直接當成產品選型答案。
第一,錯誤 taxonomy 的初步歸因與標籤合併使用了更強的 frontier model。最終題目經過人類複查,但分類過程仍會帶入歸因模型的判斷。
第二,公開的 3,000 題來自超過 17,000 題內部題庫的 constructed portion。論文報告公開集與完整集在 10 種能力上的 Pearson correlation 是 0.84,仍不等於兩者完全相同。
第三,各模型雖然使用最高 reasoning budget,實際模式並不一致。Claude-Fable-5 還有 1.1% 的答案因安全過濾而改由 Claude-Opus-4.8 fallback。這些設定會影響跨模型比較。
所以 PerceptionBench 適合回答「模型在哪種視覺能力容易失敗」,不適合單獨回答「哪個模型最適合我的產品」。
開發者怎麼使用這套評測?
官方 GitHub提供 Apache 2.0 授權的評測程式,能連接 OpenAI 相容端點。資料則放在 Hugging Face,每筆包含問題、答案、圖片、錯誤類別與來源 benchmark。
實作時可以先跑完整榜單,再依產品需求拆開看:
- 文件 Agent 優先看 OCR、定位與上下文整合。
- GUI Agent 優先看定位、視覺關係與視覺幻覺。
- 3D 或遊戲工作流要多看深度、比較和細粒度辨識。
公開 benchmark 只能做第一層篩選。下一步仍要用產品自己的截圖、文件與錯誤案例做小型 golden set,然後重複執行,記錄同題成功率。平均分與一致性要分開。
如果要在本地測試較小的開放權重多模態模型,麗臺 RTX PRO 4000 Blackwell 24GB可作為單卡實驗設備,但不能在單卡上運行 Kimi K3。
常見問題
PerceptionBench 是什麼?
PerceptionBench 是 Moonshot AI 開源的多模態視覺感知評測。它用 3,000 道人工驗證的題目,分別測量定位、計數、OCR 與視覺幻覺等 10 種原子能力。
Kimi K3 在 PerceptionBench 排第幾?
Kimi K3 以 58.5% 排第二,也是論文測試中成績最高的開放權重模型。第一名 GPT-5.6-Sol 是 59.7%,但全部 16 個模型都沒有超過 60%。
pass@4 和四次全對有什麼差別?
pass@4 代表一道題在四次測試中至少答對一次;四次全對則要求每次都正確。Kimi K3 分別是 73.9% 與 42.7%,顯示不少正確答案無法穩定重現。
PerceptionBench 可以測自己的模型嗎?
可以。官方 GitHub 提供評測程式,可連接 OpenAI 相容端點,預設使用 GPT-oss-120B 比對模型答案與標準答案。產品上線前仍應補做貼近自身圖片與任務的評測。
我的判斷
PerceptionBench 最實用的地方,是把最終答案往前拆。模型可能在第一步就數錯、看漏或憑空補出物件,後面寫再長的推理也救不回來。
Kimi K3 的 58.5% 說明它已經接近這套評測的第一名。42.7% 的四次全對率則提醒我們,它的單題視覺判斷仍有很大的隨機性。多模態 Agent 要走進瀏覽器、桌面與 3D 工具,下一輪競爭會看模型能否反覆看對,而非偶爾看對。
接下來應該觀察的是:模型訓練能否在不犧牲一般題目準確率的情況下,同時提高視覺幻覺分數與四次全對率。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。
資料來源:PerceptionBench 論文、Kimi 官方介紹、PerceptionBench GitHub、Hugging Face 資料集、Kimi K3 官方文章。