跳到主要內容
「不會幻覺」的 Jev 是什麼?7 張圖拆開 TypeSafe 的話術
/閱讀約 22 分鐘/

「不會幻覺」的 Jev 是什麼?7 張圖拆開 TypeSafe 的話術

Jev 是什麼?TypeSafe AI 在 2026 年 9 月發布的 System One Model,不生成文字,只回傳選項、分數和機率,每百萬 input token 0.042 美元、延遲 70 到 500 毫秒。這篇用 7 張圖整理它的 API、官方 benchmark 該怎麼讀、「不會幻覺」這句話少講了哪一格,以及中文團隊決定要不要用之前該問的四個問題。

目錄+

9 月 15 日,一家叫 TypeSafe AI 的新創放出一個不會寫字的 AI 模型,名字叫 Jev。官網首頁寫它比一般 LLM 快 193.6 倍、便宜 444.6 倍,而且「數學上不可能幻覺」。

前兩個數字有條件,第三句話少講了一格。

這篇用 7 張圖把 Jev 拆開:它怎麼運作、官方數字該怎麼讀、行銷沒提的是哪一格,最後給你四個問題,判斷自己的系統該不該接。先說清楚,這篇沒有自己實測,Jev 還在排 waitlist。數字都來自官方文件和媒體報導,出處寫在句子裡;已經拿到 API key 的人在 X 上貼出來的實測,中間收了六則,有誇的也有潑冷水的。

Jev 是什麼?一個只回答選擇題的模型

想像你的客服後台。工單一張一張進來,每一張都要先決定丟給哪個團隊、急不急。你現在的做法大概是呼叫一次 LLM,請它回一段 JSON,然後祈禱那段 JSON 是合法的。

Jev 是 TypeSafe AI 在 2026 年 9 月發布的 System One Model:你給它一段程式狀態和幾個型別化的問題,它不生成文字,直接回傳選項、分數或機率,程式不用解析就能接著跑。

用生活一點的講法。一般 LLM 像請一位教授寫報告,你再自己從報告裡翻答案。Jev 像機場的分流員,看你一眼,手一指:「3 號櫃檯,我九成把握。」他不解釋,也不會寫報告。

左欄是一般 LLM 做一個判斷要走的五步:組 prompt、逐 token 生成文字、解析 JSON、驗證型別(失敗要重試)、程式拿到決策。右欄是 Jev 的三步:送出狀態與型別化問題、單次平行 pass、直接拿到型別化決策與機率。
圖 1:同一個判斷,LLM 要生成、解析、驗證、重試;Jev 一次 pass 就結束

「System One」這個名字來自 Kahneman 的《快思慢想》:系統一是直覺,系統二是推理。TypeSafe 的說法是,大家都在蓋會慢慢想的系統二,但軟體裡大部分的決策只需要一個夠快的直覺。

公司背景也是這次受關注的原因。TechCrunch 報導,創辦人 Diogo Almeida 是前 OpenAI 研究員,參與過 ChatGPT 與 RLHF;TypeSafe 隱身開發兩年,種子輪募到 4,000 萬美元。模型名字取自經濟學家 Jevons,也就是「東西越便宜,用量越大」那個悖論。

訓練方式有兩個重點。TechCrunch 提到它全部用合成資料訓練;官方則把演算法叫做 RLCD(Reinforcement Learning for Calibrated Decisions)。RLHF 教模型講人類喜歡聽的話,RLCD 教模型把機率講老實:它說九成把握的事,就該真的有九成會對。

Jev 的 API 怎麼用:三種問題,一次問完

整個 API 只有三種問題型別。

型別你在問什麼它回什麼
choice從這份清單選一個選項、每個選項的機率、confidence
score照這個 rubric 打幾分分數、機率分布、confidence
noul這句話成立嗎一個 0 到 1 的機率

三種可以塞在同一個 request 裡。官方文件說這些問題是平行、而且彼此隔離地評估,所以多問幾題,延遲幾乎不變,也不會因為問題變多就互相干擾。

一個 request 帶著 state 與多個問題送進 Jev;choice、score、noul 三種問題平行且彼此隔離地評估,各自回傳選項與機率、分數與機率分布、0 到 1 的機率,最後合併成一個 response。
圖 2:一個 request 可以同時帶三種問題,Jev 各自獨立回答

官方文件裡最短的例子長這樣,問一張工單急不急:

{
  "state": "Help! My payouts have been failing for 3 days.",
  "model": "jev-latest",
  "questions": {
    "is_urgent": { "type": "noul", "instructions": "Does this convey urgency?" }
  }
}

回來的東西只有一個數字:"noul": 0.92。沒有「好的,我來幫你分析」,也沒有需要剝掉的 markdown。

幾個你接之前要知道的規格,都出自官方 Models 頁:

  • 版本:Jev 1.13.0,jev-latestjev-preview 目前指向同一版
  • 價格:每百萬 input token 0.042 美元,output 免費
  • 長度:每個 request 64k tokens,其中 state 加最長那一題不能超過 32k
  • 輸入:只吃文字(字串、JSON、陣列),圖片和音訊要自己先轉
  • 流量:每秒 25 萬 tokens、每分鐘 1,200 個 request,官方註明還在動態調整

官方 benchmark 該怎麼讀

TypeSafe 自己設計了一組 4 個 workflow 的測試,DataCamp 把結果整理成表。兩張圖看完你就懂它的定位。

散佈圖,橫軸是每案延遲(對數刻度),縱軸是準確率。Jev 0.4 秒、67.8%;GPT-5.6 Terra 10.1 秒、67.9%;GPT-5.6 Sol 23.3 秒、74.1%;Claude Opus 5 37.8 秒、73.1%。Jev 與 Terra 準確率幾乎相同,但快約 25 倍。
圖 3:準確率和 GPT-5.6 Terra 只差 0.1 個百分點,延遲差約 25 倍(TypeSafe 官方 benchmark)

Jev 的準確率是 67.8%,跟 GPT-5.6 Terra 的 67.9% 幾乎一樣,比 GPT-5.6 Sol(74.1%)和 Claude Opus 5(73.1%)低 5 到 6 個百分點。它沒有比較聰明。

那它贏在哪?看成本。

橫條圖比較每處理一個案例的成本(美元):Claude Opus 5 為 0.1761、GPT-5.6 Sol 為 0.0836、GPT-5.6 Terra 為 0.0304、Jev 為 0.0004。在同一個線性刻度上,Jev 的長條不到一個像素。
圖 4:同一個線性刻度上,Jev 的每案成本 0.0004 美元畫出來不到 1 個像素(TypeSafe 官方 benchmark)

Jev 賣的是同樣聰明,便宜兩個零。

不過這組數字有三個要打折的地方。

第一,出題的是 TypeSafe 自己。kingy.ai 的評測整理了幾個問題:題目是官方設計的,官方也承認測試框架可能有偏誤,公開的只有摘要統計,沒有完整的標註資料集和原始預測。

第二,首頁那個 193.6 倍和 444.6 倍,用上面這張表算不出來。同一篇評測建議把它當成「特定工作負載下的宣稱」,別當成通用倍數。

第三,第三方跑出來的數字保守得多。TechCrunch 引用的兩個案例:Vercel 測到比 OpenAI Luna 5.6 快 5 到 18 倍;Bryo AI 拿 email 分類來比,Jev 比 Gemini 便宜 10 到 20 倍,但 Gemini 的準確率略高。快很多、便宜很多都是真的,只是離「兩百倍」有一段距離。

還有一個容易漏掉的觀察,來自 Anthony Maio 的分析:在那組測試裡,所有對照模型只要被放進拆好步驟的 workflow,都變得更準、更快、更便宜。也就是說,這個實驗在替 Jev 說話之前,先替「把大判斷拆成小問題」說了話。這件事你今天用 LLM 就能做。

X 上的實測:拿到 API key 的人測出什麼?

官方數字看完,來看已經排到 early access 的人跑出來的結果。六則,前四則是好消息,後兩則是提醒。

先是 Vercel。CTO Malte Ubl 拿一組原本給 Gemini 2.5 Flash Lite 跑的分類 eval 來測,Jev 品質把那組 eval 打滿,速度快 6 倍。

同一家公司的另一個場景。Vercel 的 fx 在 auto 模式下,每一道指令都要先過一個安全審查器,現在跑的是 GPT Luna。執行長 Guillermo Rauch 說換成 Jev 之後 p95 最多快 18 倍,而且更準,之後會進 Vercel AI Gateway。前面 TechCrunch 引用的「5 到 18 倍」就是這一組。

再來是成本。Hassan El Mghari 用 Jev 把 1,018 篇 AI 論文分進 24 個主題,總共花 0.08 美元,每篇的端到端延遲中位數 256 毫秒。摘要那一步還是用 LLM 做,Jev 只負責分類,這正是圖 7 那種分工。

速度快到一個程度,用法會跟著變。這段示範把 Jev 接上 opencode 的瀏覽器操作 CLI 來測 app,每一步「接下來點哪裡」都交給 Jev 判斷。

接下來是兩則提醒。

有人用 Cerebras 加上 Qwen 3.8 27B 硬做了一個 LLM 版的替代品來對照。這位作者的結論是品質和速度都差不多,Jev 在表現上小贏,真正拉開的是成本,Jev 便宜很多。講直接一點,Jev 的速度用夠快的推論硬體配開源模型追得上,價格追不上。

最後這一則最值得中文團隊看。一個本來就有微調分類模型的團隊,把 Jev 指向自己的內部 benchmark:Jev 零樣本的 recall 在相同 precision 下,跟他們的微調模型差距在 5 個百分點以內,全部流量跑下來一個月大約 70 美元。但他們自己微調的 Qwen 還是贏。

六則放在一起看,形狀很清楚。你本來用 LLM 做分類,換 Jev 多半又快又省;你本來就養了一個微調模型,Jev 零樣本追得很近,但還沒追上。

Jev 贏的是 LLM,還沒贏你自己的微調模型。

要注意的是,這六則測的全是英文任務,而且會貼出來的人本來就偏向測得不錯的那一群。

「不會幻覺」少講了哪一格?

換一個場景。你的 agent 準備執行一個它沒被授權的動作,你先問 Jev 該不該放行。Jev 回了 approve

型別對,schema 對,機率欄位也在。你的程式照跑,沒有任何地方報錯。

Hacker News 的發布討論串裡,有人就用這個例子質疑 TypeSafe:官方在圖表上把幻覺率標成 0%,理由是輸出保證符合 schema,可是一個放行了未授權動作的 approve 同樣符合 schema。那則留言裡有一句話很值得記:「Type safety is not factual correctness.」The Register 的報導講的是同一件事,Jev 的輸出被限制在你定義的選項裡,當然不會編造法律引文,但這不代表它不會選錯。

把「錯」拆成兩個維度,事情就清楚了。

二乘二矩陣,橫軸是輸出格式對或錯,縱軸是判斷對或錯。Jev 在設計上消滅了格式錯的左欄,但右下角「格式對、判斷錯」仍然存在:官方 benchmark 準確率 67.8%,代表約三成案例落在這一格,而且程式不會報錯。
圖 5:Jev 消滅的是「格式錯」那一欄,「格式對、判斷錯」那一格還在

左邊那一欄是 LLM 的老問題。DataCamp 引用的官方數字是:OpenAI 的 Luna 和 Terra 結構錯誤率 0.58%,Claude Opus 5 是 5.73%,Claude Haiku 4.5 高達 45.5%。Jev 把這一欄歸零,這是真本事,對沒人盯著的自動化流程來說很有感。

右下角那一格才是問題。準確率 67.8% 的意思是,大約三成的案例會拿到一個格式完美的錯答案。而且比起 JSON 壞掉,這種錯更難抓:JSON 壞了程式會炸給你看,選錯了程式會安靜地繼續跑。

格式錯會報警,判斷錯不會。

替 Jev 講句公道話,它真正的賣點是機率有校準過。DataCamp 的評測認為這是最實用的功能:一般 LLM 就算你叫它報機率,也常常過度自信;Jev 讓你能設一個門檻,有把握的自動執行,沒把握的交給別人。只是 HN 上也有人補了一刀:每一題各自校準,不代表你把好幾題組合起來做的那個決定也是校準的。

中文團隊要多看一眼的地方

官方 Models 頁有一段話,英文媒體幾乎沒人提:英文是主要的訓練語言,準確率也最好;其他語言包含 CJK 都支援,但比較不準,建議自己測。

想一下你真實的工單長什麼樣。不會是「My payouts have been failing for 3 days」這種教科書英文,比較像「欸我錢咧 三天了 客服都不回」。注音文、中英夾雜、沒有標點。圖 3 那個 67.8% 是在英文任務上量的,搬到這種輸入上會掉多少,目前沒有任何公開數字。

所以中文團隊的第一步是自己量,別急著接 API。不用多,照先讀 20 到 50 筆真實失敗案例的 evals 做法,把你自己的工單標成對錯,跑一輪就知道了。Jev 的輸出本來就是選項和機率,剛好是最容易自動評分的那種。

我該不該用 Jev?先問四個問題

決策流程圖:答案選項事先列不出來就用 LLM;判斷量不大、不趕時間也用 LLM;每個判斷都要附理由就讓 Jev 先篩、LLM 補理由;輸入主要是中文就先拿自己的資料測過;四關都過才直接用 Jev 並設定 confidence 門檻。
圖 6:四個問題由上往下問,任何一關卡住就先別急著換

如果你在做客服分流、內容審核、模型路由這類事,每天幾十萬次判斷、選項固定、要快,這條路適合你。Jev 的定價和延遲就是為這種場景設計的。

如果你在金融、醫療這類要稽核的領域,第三關會卡住你。Jev 只給機率,不給理由,DataCamp 的評測直接點名這對合規稽核是實際的限制。你還是可以用,但得搭一個會解釋的東西在旁邊。

如果你的 LLM 帳單本來就不高,現在什麼都不用做。要重新考慮的時間點是:你發現帳單裡有一大塊,其實是在叫一個會寫論文的模型回答「是」或「不是」。

怎麼接進現有系統:Jev 當反射神經

比較務實的接法,是把 Jev 放在 LLM 前面當第一道篩子,別想著整組換掉。

架構圖:事件先交給 Jev 判斷並回傳 confidence;高於門檻的由程式直接執行,低於門檻的轉給 LLM 補判斷與理由,再交人工覆核;兩條路最後都寫進稽核紀錄。
圖 7:有把握的直接執行,沒把握的交給 LLM 和人,兩條路都留紀錄

事件進來先過 Jev。confidence 高於你訂的門檻,程式直接執行;低於門檻,轉給 LLM 補判斷、順便寫出理由,再讓人做最後決定。這樣大部分的量走便宜的那條路,而圖 5 右下角那一格,至少有一部分會被門檻攔下來。

TechCrunch 整理的早期用法也都是這個形狀:監控 LLM agent 有沒有亂來、做模型路由、審查指令安不安全。LangChain 已經出了整合,用 TypeSafeClassifier 把 Jev 包成 agent 迴圈裡的一個判斷元件。這跟把 harness 當成模型的身體是同一個思路,也呼應之前寫過的在 agent 迴圈裡加閘門:閘門本身要夠快夠便宜,你才捨得每一步都放一個。

另一條路也值得放在桌上,前面那則微調 Qwen 還是贏的實測就是例子。如果你的分類任務很固定、資料又不能送出公司,自己微調一個小型分類模型、跑在本地,同樣可以做到輸出永遠合法、延遲很低。代價是你得自己養模型,換一個任務就要重訓一次。Jev 的賣點在於不用重訓,改問題就好。

利益揭露:以下是聯盟連結。想走本地微調這條路的人,規格上 24GB VRAM 的 麗臺 RTX PRO 4000 Blackwell 這個級距的工作站顯卡,足夠應付小型分類模型的微調和推論。

常見問題

Jev 是什麼?跟 ChatGPT 這類 LLM 差在哪?

Jev 是 TypeSafe AI 的 System One Model,它不生成文字。你給它一段狀態和幾個問題,它回傳選項、分數或 0 到 1 的機率,程式可以直接拿去用。LLM 是逐 token 寫出一段字,你再從字裡面解析答案。

Jev 真的不會幻覺嗎?

它不會回傳你沒定義的值,但會選錯。官方 benchmark 的準確率是 67.8%,代表約三成案例拿到的是格式正確的錯答案。

Jev 多少錢?現在用得到嗎?

每百萬 input token 0.042 美元,output 免費。目前是 early access,要在 typesafe.ai 排 waitlist。

Jev 支援中文嗎?

支援,但官方文件寫明英文最準、CJK 較弱,建議自己測。導入前先拿 20 到 50 筆自己的真實案例跑過。

Jev 可以取代 GPT 或 Claude 嗎?

只能取代分類、路由、打分、是非判斷這類呼叫。寫文章、寫程式、解釋理由它都做不到,常見做法是 Jev 先篩,沒把握的再交給 LLM。

把選擇題還給選擇題

Jev 值得看,因為它點出一件大家默默在做的浪費:我們一直拿會寫論文的模型來回答選擇題,然後為了把論文變回選項,再寫一堆解析和重試。

但「不會幻覺」這四個字請自動翻譯成「不會格式錯」。剩下那三成,還是得靠門檻、靠第二道模型、靠人來接。

打開你的 LLM 帳單看一眼:裡面有多少次呼叫,其實只是在回答「是」或「不是」?

資料來源TypeSafe AI 官網API referenceModelsTechCrunchThe RegisterDataCampHacker News 討論串kingy.ai 評測Anthony MaioLangChain