跳到主要內容

AI 幫你審程式碼、記住習慣、自動分工——Anthropic 這次升了四個功能

Anthropic 在 2026 年 5 月一口氣推出四個 Agent 新功能:/ultrareview、Dreaming、Outcomes、Multiagent Orchestration。本文用白話帶你看懂每個功能在解決什麼問題,並附上實際操作指令,適合剛開始學 AI 工具的讀者。

目錄+

你叫 AI 做事,它做完了,但你不確定做對了沒。下次要用同一個 agent,還得重頭說明一遍背景和習慣。出了問題,也搞不清楚是哪個環節出錯。

這是現在 AI Agent 的三個核心痛點:輸出品質不穩記憶不跨對話複雜任務容易漏洞

Anthropic 在 2026 年 5 月,圍繞這三個問題一次推出四個新功能。這篇文章用白話帶你看懂每一個在解決什麼,並附上你可以跟著試的指令。


一、/ultrareview:送出前,先讓 AI 自己抓問題

是什麼

/ultrareview 是 Claude Code 裡的斜線指令。執行後,它會把你目前的程式碼變更送到雲端,同時啟動多個 reviewer agent,分別從不同角度並行審查——邏輯正確性、邊界情況、安全漏洞、效能問題——最後整合成一份結構化報告。

不是走一遍,是四個 reviewer 同時走,各看各的,最後比對結果。

怎麼用

在 Claude Code 的工作階段裡直接輸入:

/ultrareview

如果要針對特定的 GitHub PR 審查,可以加上 PR 編號:

/ultrareview 42

也可以從終端機非互動地跑,適合 CI 環境:

claude ultrareview --json

幾個注意事項:

  • 需要 Claude Code v2.1.111 以上(跑 claude update 升級)
  • Pro 和 Max 用戶有 3 次免費試用額度(Anthropic 官方說法)
  • 適合在 PR merge 前跑一次,當最後一道把關

解決什麼問題

以前 code review 靠自己或等同事;現在 AI 先幫你過一遍,明顯問題不會帶著上 production。


二、Dreaming:Agent 會做夢,也會記住教訓

是什麼

Dreaming 是一個排程流程,在 agent 閒置時自動回顧過去的工作階段,找出跨對話的規律、整理成記憶筆記和標準流程(playbook),讓下次執行時直接參考。

幾個重點:

  1. 不修改模型本身的權重,只是把學到的東西寫成純文字筆記,存在 memory store 裡
  2. 它能找出單一 agent 看不到的規律——比如多個 agent 反覆犯的同一個錯、不同人對相同任務的偏好差異
  3. 你可以選「自動更新」或「先給我看再更新」,控制程度由你決定

法律 AI 公司 Harvey 在開啟 Dreaming 後,agent 的任務完成率提升了約 6 倍。他們的用法:讓 agent 記住各種文件格式的細節和工具操作習慣,不用每次靠提示詞重新說明。

怎麼開啟

Dreaming 目前是 Managed Agents API 的 research preview,需要申請存取權。設定範例:

{
  "dreaming": {
    "enabled": true,
    "review_before_apply": true
  }
}

review_before_apply: true 代表 Dreaming 整理出的記憶更新,會先給你確認再寫入——適合剛開始使用、還想掌控的人。

解決什麼問題

以前每次開新對話,AI 都從零開始;Dreaming 讓 agent 真正「學習」你的工作習慣,越用越省力,不用每次重新說明背景。


三、Outcomes:你定標準,它自己重做直到達標

是什麼

你寫一份成功標準(rubric),agent 執行完後,一個獨立的 grader agent 會對照你的標準打分。分數不到,grader 指出哪裡不對,agent 重做,直到達標為止。

設計上有一個重要細節:grader 是在自己獨立的 context window 裡評分,不知道 agent 是怎麼推理的——這樣可以避免 agent 「自我說服」grader,讓評分結果更客觀。

官方數字(已查核)

Anthropic 的內部測試:

  • 整體任務成功率比標準提示詞流程高出最多 10 個百分點
  • docx 文件生成任務成功率提升 8.4%
  • pptx 簡報生成任務成功率提升 10.1%

越難的任務,Outcomes 的效益越明顯。

怎麼用(API 範例)

response = client.beta.messages.create(
    model="claude-opus-4-7",
    max_tokens=4096,
    messages=[{"role": "user", "content": "幫我寫一份季度報告摘要"}],
    outcomes={
        "rubric": "報告需包含:關鍵指標、問題分析、下季建議,每項至少 100 字",
        "max_retries": 3
    }
)

max_retries 讓你控制最多重試幾次,避免成本失控。

你也可以結合 webhook:讓 agent 執行完後通知你,不用盯著等結果。

解決什麼問題

以前你要自己判斷 AI 的輸出夠不夠好;現在讓另一個 AI 幫你把關,而且會自動重做到你設定的標準為止。


四、Multiagent Orchestration:主 Agent 當主管,派工給專家團隊

是什麼

一個任務太複雜、一個 agent 做不完?現在可以讓一個主 agent 把工作拆開,派給多個有各自專長的子 agent 並行執行。子 agent 共用一個檔案系統,結果統一回報給主 agent,全程在 Claude Console 可追蹤每一步。

實際情境:調查系統故障

你要找出昨晚線上系統故障的原因。以前你可能得自己一個一個翻 log,或等工程師逐一排查。現在主 agent 可以同時派出四個子 agent:

  • Agent A:查 deploy 歷史和版本變更
  • Agent B:分析 error log 和異常模式
  • Agent C:看系統 metrics 和流量圖
  • Agent D:翻 support ticket 找使用者回報

四個同時跑,最後主 agent 整合所有發現,給你一份完整的事後報告。

API 設定概念

response = client.beta.messages.create(
    model="claude-opus-4-7",
    messages=[{"role": "user", "content": "調查昨晚的系統異常,列出可能原因"}],
    multiagent={
        "enabled": True,
        "specialists": [
            {"role": "deploy_analyzer", "tools": ["git_log", "deploy_api"]},
            {"role": "log_analyst", "tools": ["log_reader"]},
            {"role": "metrics_watcher", "tools": ["grafana_api"]},
            {"role": "ticket_reader", "tools": ["support_api"]}
        ]
    }
)

Netflix 的平台工程團隊用 Multiagent Orchestration 分析數百個 build 的 log,讓子 agent 並行處理不同來源的資料,找出跨應用程式的重複性問題。

解決什麼問題

以前一個 agent 做太複雜的任務容易遺漏細節;現在可以分工,每個子 agent 專注自己的領域,效率更高,結果更完整。


這四個功能放在一起,Anthropic 在做什麼

功能解決的問題
/ultrareview送出前先自我審查
Dreaming記住工作習慣,越用越好用
Outcomes知道「什麼叫做夠好」,自動重做到達標
Multiagent Orchestration任務太大時懂得找幫手,分工完成

這不只是功能升級。Anthropic 在做的事情是讓 AI Agent 從「執行指令的工具」走向「能自我改進、自我評估、協作完成任務的工作夥伴」。

目前 Dreaming 是 research preview,需要申請;Outcomes、Multiagent Orchestration 和 webhook 都已進入 public beta,開發者可以直接開始用。如果你正在用 Claude 做事,這四個功能值得現在就開始認識。

想讓自己的工作流更有條理、不容易出差錯?一台穩定的開發環境是基礎,我用的是蝦皮編輯選物的桌面 4 件套,鍵盤、Hub、掛燈、書架都是用了三個月以上才放進推薦清單的。


利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。我只推薦自己用過 3 個月以上的工具;未實際長期使用的硬體一律以規格與適用情境客觀描述。