Anthropic首次公開Claude文字浮水印技術細節,最新模型已内建、舊版将适配;但2026年7月研究顯示,59篇可檢出浮水印文章經AI改寫後58篇無法再檢出,比例達98.3%,重新處理每千字成本約4美分。
觀點網訊:近日,Anthropic首次公開說明Claude文字浮水印的技術細節,最新一批Claude模型已内建相關機制,舊版模型也将陸續适配。這項技術的核心,是在模型生成文字時調整選詞所使用的随機機制,讓文字表面上與一般輸出沒有明顯差異,但持有密鑰的一方可以進一步驗證其中是否存在浮水印訊号。
Anthropic表示,這項機制不會刻意改變Claude生成文字的品質。文字浮水印透過預先植入的訊号進行驗證,與依賴文字風格及語言特征的傳統AI偵測器不同。
Claude生成文字時,會逐步選擇下一個詞。當多個候選詞的生成機率相近時,模型原本可以透過随機機制決定最終選項。Anthropic的做法,是在這個選詞階段調整随機數産生方式,利用密鑰推導出具有特定規律的數值,取代原本無法預測的随機數。因此,從使用者閱讀的角度來看,生成結果不會因此變得明顯不自然,也不會刻意加入特殊詞匯。然而,掌握密鑰的一方,則可以透過分析文字中的選詞規律,确認其中是否存在浮水印訊号。
浮水印只會作用于Claude實際選擇的詞匯,在翻譯、程式碼、短篇文字、事實陳述等選詞空間受限的場景下效果有限。Anthropic承認,浮水印最多只能判斷Claude「可能參與過」某段文字,無法确認其參與程度。
2026年7月一項研究發現,59篇原本能被檢測出浮水印的文章經AI釋義工具改寫後,有58篇無法再檢測出浮水印,比例達98.3%。按照當時的服務價格,重新處理一篇約1000字文章的成本約4美分。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。
審校:楊嘉英
