AI 幫你審程式碼、記住習慣、自動分工——Anthropic 這次升了四個功能
Anthropic 在 2026 年 5 月一口氣推出四個 Agent 新功能:/ultrareview、Dreaming、Outcomes、Multiagent Orchestration。本文用白話帶你看懂每個功能在解決什麼問題,並附上實際操作指令,適合剛開始學 AI 工具的讀者。
目錄+
你叫 AI 做事,它做完了,但你不確定做對了沒。下次要用同一個 agent,還得重頭說明一遍背景和習慣。出了問題,也搞不清楚是哪個環節出錯。
這是現在 AI Agent 的三個核心痛點:輸出品質不穩、記憶不跨對話、複雜任務容易漏洞。
Anthropic 在 2026 年 5 月,圍繞這三個問題一次推出四個新功能。這篇文章用白話帶你看懂每一個在解決什麼,並附上你可以跟著試的指令。
一、/ultrareview:送出前,先讓 AI 自己抓問題
是什麼
/ultrareview 是 Claude Code 裡的斜線指令。執行後,它會把你目前的程式碼變更送到雲端,同時啟動多個 reviewer agent,分別從不同角度並行審查——邏輯正確性、邊界情況、安全漏洞、效能問題——最後整合成一份結構化報告。
不是走一遍,是四個 reviewer 同時走,各看各的,最後比對結果。
怎麼用
在 Claude Code 的工作階段裡直接輸入:
/ultrareview
如果要針對特定的 GitHub PR 審查,可以加上 PR 編號:
/ultrareview 42
也可以從終端機非互動地跑,適合 CI 環境:
claude ultrareview --json
幾個注意事項:
- 需要 Claude Code v2.1.111 以上(跑
claude update升級) - Pro 和 Max 用戶有 3 次免費試用額度(Anthropic 官方說法)
- 適合在 PR merge 前跑一次,當最後一道把關
解決什麼問題
以前 code review 靠自己或等同事;現在 AI 先幫你過一遍,明顯問題不會帶著上 production。
二、Dreaming:Agent 會做夢,也會記住教訓
是什麼
Dreaming 是一個排程流程,在 agent 閒置時自動回顧過去的工作階段,找出跨對話的規律、整理成記憶筆記和標準流程(playbook),讓下次執行時直接參考。
幾個重點:
- 它不修改模型本身的權重,只是把學到的東西寫成純文字筆記,存在 memory store 裡
- 它能找出單一 agent 看不到的規律——比如多個 agent 反覆犯的同一個錯、不同人對相同任務的偏好差異
- 你可以選「自動更新」或「先給我看再更新」,控制程度由你決定
法律 AI 公司 Harvey 在開啟 Dreaming 後,agent 的任務完成率提升了約 6 倍。他們的用法:讓 agent 記住各種文件格式的細節和工具操作習慣,不用每次靠提示詞重新說明。
怎麼開啟
Dreaming 目前是 Managed Agents API 的 research preview,需要申請存取權。設定範例:
{
"dreaming": {
"enabled": true,
"review_before_apply": true
}
}
review_before_apply: true 代表 Dreaming 整理出的記憶更新,會先給你確認再寫入——適合剛開始使用、還想掌控的人。
解決什麼問題
以前每次開新對話,AI 都從零開始;Dreaming 讓 agent 真正「學習」你的工作習慣,越用越省力,不用每次重新說明背景。
三、Outcomes:你定標準,它自己重做直到達標
是什麼
你寫一份成功標準(rubric),agent 執行完後,一個獨立的 grader agent 會對照你的標準打分。分數不到,grader 指出哪裡不對,agent 重做,直到達標為止。
設計上有一個重要細節:grader 是在自己獨立的 context window 裡評分,不知道 agent 是怎麼推理的——這樣可以避免 agent 「自我說服」grader,讓評分結果更客觀。
官方數字(已查核)
Anthropic 的內部測試:
- 整體任務成功率比標準提示詞流程高出最多 10 個百分點
- docx 文件生成任務成功率提升 8.4%
- pptx 簡報生成任務成功率提升 10.1%
越難的任務,Outcomes 的效益越明顯。
怎麼用(API 範例)
response = client.beta.messages.create(
model="claude-opus-4-7",
max_tokens=4096,
messages=[{"role": "user", "content": "幫我寫一份季度報告摘要"}],
outcomes={
"rubric": "報告需包含:關鍵指標、問題分析、下季建議,每項至少 100 字",
"max_retries": 3
}
)
max_retries 讓你控制最多重試幾次,避免成本失控。
你也可以結合 webhook:讓 agent 執行完後通知你,不用盯著等結果。
解決什麼問題
以前你要自己判斷 AI 的輸出夠不夠好;現在讓另一個 AI 幫你把關,而且會自動重做到你設定的標準為止。
四、Multiagent Orchestration:主 Agent 當主管,派工給專家團隊
是什麼
一個任務太複雜、一個 agent 做不完?現在可以讓一個主 agent 把工作拆開,派給多個有各自專長的子 agent 並行執行。子 agent 共用一個檔案系統,結果統一回報給主 agent,全程在 Claude Console 可追蹤每一步。
實際情境:調查系統故障
你要找出昨晚線上系統故障的原因。以前你可能得自己一個一個翻 log,或等工程師逐一排查。現在主 agent 可以同時派出四個子 agent:
- Agent A:查 deploy 歷史和版本變更
- Agent B:分析 error log 和異常模式
- Agent C:看系統 metrics 和流量圖
- Agent D:翻 support ticket 找使用者回報
四個同時跑,最後主 agent 整合所有發現,給你一份完整的事後報告。
API 設定概念
response = client.beta.messages.create(
model="claude-opus-4-7",
messages=[{"role": "user", "content": "調查昨晚的系統異常,列出可能原因"}],
multiagent={
"enabled": True,
"specialists": [
{"role": "deploy_analyzer", "tools": ["git_log", "deploy_api"]},
{"role": "log_analyst", "tools": ["log_reader"]},
{"role": "metrics_watcher", "tools": ["grafana_api"]},
{"role": "ticket_reader", "tools": ["support_api"]}
]
}
)
Netflix 的平台工程團隊用 Multiagent Orchestration 分析數百個 build 的 log,讓子 agent 並行處理不同來源的資料,找出跨應用程式的重複性問題。
解決什麼問題
以前一個 agent 做太複雜的任務容易遺漏細節;現在可以分工,每個子 agent 專注自己的領域,效率更高,結果更完整。
這四個功能放在一起,Anthropic 在做什麼
| 功能 | 解決的問題 |
|---|---|
/ultrareview | 送出前先自我審查 |
| Dreaming | 記住工作習慣,越用越好用 |
| Outcomes | 知道「什麼叫做夠好」,自動重做到達標 |
| Multiagent Orchestration | 任務太大時懂得找幫手,分工完成 |
這不只是功能升級。Anthropic 在做的事情是讓 AI Agent 從「執行指令的工具」走向「能自我改進、自我評估、協作完成任務的工作夥伴」。
目前 Dreaming 是 research preview,需要申請;Outcomes、Multiagent Orchestration 和 webhook 都已進入 public beta,開發者可以直接開始用。如果你正在用 Claude 做事,這四個功能值得現在就開始認識。
想讓自己的工作流更有條理、不容易出差錯?一台穩定的開發環境是基礎,我用的是蝦皮編輯選物的桌面 4 件套,鍵盤、Hub、掛燈、書架都是用了三個月以上才放進推薦清單的。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。我只推薦自己用過 3 個月以上的工具;未實際長期使用的硬體一律以規格與適用情境客觀描述。