Claude 浮水印是 Anthropic 依歐盟 AI 法在文字生成時埋入的統計標記,用的是 Google DeepMind 的 SynthID-Text。本文說明它怎麼運作、偵測不到什麼、跟 Pangram 差在哪,以及對寫作、程式碼、翻譯的實際影響。
目錄+
2026 年 8 月 14 日,Anthropic 宣布未來的 Claude 模型會在文字裡加上浮水印。八天前,歐盟 AI 法第 50 條已開始要求生成式 AI 業者標記產出——這不是新功能,是合規。這篇拆三件事:它怎麼藏進句子、什麼情況偵測不到、對每天用 Claude 寫東西的人差在哪。
Claude 浮水印是什麼?
Claude 浮水印是一種統計標記:模型在「下一個詞有好幾個差不多好的選項」時,用金鑰決定選哪一個,從而在整段文字裡留下只有持有金鑰的人才能驗的圖案。
它不是紙鈔那種肉眼看得見的紋路,也不是檔案裡塞進去的隱藏字元。Anthropic 在官方說明裡寫得很乾脆:不加字、不加 token、不漲價、不拖慢、不能追溯到特定使用者、組織或對話。讀者分不出有浮水印和沒浮水印的差別。
白話版:模型本來就要擲骰子。浮水印只是把骰子換成一本只有自己知道規則的亂數表。
它怎麼藏進句子?
大型語言模型一次生一個詞。遇到「今天天氣又冷又……」後面,「陰沉」和「灰濛」差不多都能用;「甜膩」幾乎不會出現。低風險的選擇一天發生幾百次,浮水印就住在這些縫裡。
方法來自 Google DeepMind 2024 年 10 月發表在 Nature 的 SynthID-Text,再往上可追到 Scott Aaronson 2022 年在 OpenAI 提出的統計浮水印構想。核心原則一樣:只改「隨機性從哪裡來」,不把模型推向它本來不會選的怪詞。
DeepMind 當年把這個方法接到 Gemini 的一部分流量上,對照了將近 2000 萬則回覆的讚與倒讚,兩邊差距落在 0.01% 到 0.02%,統計上不顯著。Anthropic 說內部測試也沒看到內容、創意或可讀性受影響。要注意:這是官方自述加上 Gemini 的論文數據,不是獨立第三方對 Claude 的評測。
事實性句子幾乎沒縫可鑽。「牛頓最有名的著作叫《Principia》……」下一個詞只能是 Mathematica。程式碼也一樣:2 + 2 = 後面不是 4 就是錯。浮水印在這些地方會自動放手,註解裡還有一點空間,但對真正會跑的程式幾乎沒影響。
為什麼現在才做?
不是 Anthropic 突然想當內容警察。歐盟 AI 法第 50 條的透明度義務從 2026 年 8 月 2 日起適用,要求生成式 AI 系統的提供者用機器可讀的方式標記產出。歐盟執委會在 7 月底公布,約 190 個組織簽署了《AI 生成內容透明度行為準則》;Section 1 的簽署方包括 Anthropic、Google、Meta、Microsoft、OpenAI、Mistral、Cohere。準則本身自願,第 50 條是法律義務。
Google 早在 2024 年就把 SynthID 接到 Gemini。Anthropic 現在公開講清楚實作細節,比較像補上合規說明,不是搶先發明。它也承認:目前沒有穩定的區域分流方式,所以全球一起開;2026 年 8 月 2 日前上線的舊模型有過渡期,會在未來幾個月補上。
這跟 Anthropic 過去幾個月把安全研究寫成政策文件是同一條線。想看他們怎麼把技術主張包裝成公共論述,可以對照 Anthropic Institute 的研究議程,以及那篇時機剛好卡在 Trump 訪中的 《2028》領導權論文。
浮水印證明的是碰過,不是寫過
這句話值得單獨拿出來。
有金鑰的人只能回答:「這段文字有多少機率曾被 Claude 處理過?」它不能證明是人寫的,也不能證明是別家 AI 寫的——就算對方也做浮水印,金鑰不同、方法也可能不同。短文本選擇太少,信心上不去;愈長愈穩。
Anthropic 自己列的盲區:
- 校對人類稿:幾乎所有字都是你的,浮水印沒地方住。
- 事實段落與程式碼:正確答案只有一個時,標記會放手。
- 整篇改寫:每個字都換掉,圖案就沒了。輕改通常去不掉。
- 翻譯:每個字都是 Claude 選的,所以會帶標記。
圖片、PNG、JPG、SVG 走另一條路:檔案 metadata 裡加一則經過密碼學簽署的 C2PA 內容憑證,註明 Claude 參與過製作或處理。這不是浮水印,檔案本體不變,任何支援 C2PA 的工具都能讀。文字偵測 API 則「即將推出」,細節還沒公布。
學校、媒體、法務如果把「驗到浮水印」當成「這篇是 AI 代寫」,會誤傷一堆用 Claude 改過文法的人。驗不到也不等於人寫的——開源模型、沒進歐盟市場的模型、整篇改寫過的輸出,本來就不在這把鑰匙的射程裡。
跟 Pangram 這類偵測軟體差在哪?
Pangram 這類工具沒有 Anthropic 的金鑰。它們靠的是文風指紋:AI 很愛寫「這不是 X,而是 Y」,也很愛用 quietly。那是事後分類器,會隨模型改口而失效,也比較容易誤傷非母語寫作者。
浮水印是生成當下就埋進去的約定。沒有金鑰,你驗不到;有金鑰,你驗的是統計一致性,不是「像不像 AI」。兩者可以並用,但回答的問題不一樣。前者猜文風,後者對答案。
所有權和法律責任也不變。Anthropic 寫明:浮水印不改變使用者在服務條款下的權利,只用來測試 Claude 是否參與過處理。
對每天產出大量文字的人,真正要改的不是「要不要繼續用 Claude」,而是把「Claude 起草、人改結構」和「人先講、工具只幫忙順稿」分開。後者浮水印幾乎附著不上。通勤時先把想法講成草稿,再用模型修順,是同一條思路;Typeless 這類語音轉錄就是把「人先產出字」這一步做掉。(文內含聯盟連結,點擊可能產生分潤。)
對使用者實際差在哪?
速度和價格:官方說可忽略。DeepMind 論文裡,Gemma 7B 加上 30 層 Tournament sampling,每 token 延遲從 15.527 毫秒變成 15.615 毫秒,大約多 0.57%。這是論文數字,不是 Claude 正式延遲保證。
隱私:金鑰裡沒有使用者、組織或對話資訊。它標記的是 Claude,不是你。
程式碼:註解可能帶一點標記,可執行的符號幾乎不受影響。用 Claude 寫註解很勤的專案,理論上比「只生函式本體」更容易被驗到;實務上,過一次 formatter、再被人改過變數名,訊號會再稀一層。
企業合規:歐盟要的是「機器可讀的標記」,不是「法庭級鑑識」。學校抓代寫、媒體抓通稿、平台抓垃圾內容,都會想接即將推出的偵測 API。在 API 細節出來之前,把浮水印當成鐵證,是超前使用。
同一週的產業新聞裡,Apple 和 OpenAI 還在為前員工與商業機密打架。大公司現在同時打三場:人才、算力、以及「產出能不能被追溯」。浮水印屬於第三場,而且是被歐盟日程表逼出來的。
改寫就能繞過。Anthropic 不否認。它也反問:每個字都換過之後,這還算不算 AI 生成?法律要的是標記義務,不是防破解競賽。把浮水印想像成防偽油墨,會失望;把它當成合規貼紙,邏輯就通了。
偵測 API 還沒上線。在那之前,任何人拿「這篇像 AI」或「這篇沒浮水印」做人事或成績處分,都是在用尚未公開的工具做已經會傷人的判斷。等 API 出來,先看它給的是機率還是是非題——官方整篇文章都在講 likelihood,不是鐵證。
歐盟要的是標記,不是鑑識。你的下一篇稿,是要 Claude 從頭寫,還是自己先把句子講完?
常見問題
Claude 浮水印是什麼?
它是埋在用詞選擇裡的統計圖案,不是隱藏字元、也不是檔案浮水印。有金鑰的人可以估計「這段文字有多少機率曾被 Claude 處理過」,一般讀者看不出差別。
Claude 浮水印能證明這篇是 AI 寫的嗎?
不能。它只能回答「Claude 是否可能碰過這段文字」,分不出「整篇代寫」和「大幅改寫」,也偵測不到其他模型。
改寫之後浮水印還在嗎?
輕改通常去不掉。每個字都換掉就沒了。Anthropic 自己也說,後者還算不算 AI 生成,本來就有爭議。
用 Claude 改文法會被抓到嗎?
多半不會。浮水印只附著在 Claude 自己選的字上,校對、改標點這類輕修,可標記的選擇太少,通常偵測不到。