Anthropic詳解Claude文字浮水印機制
Anthropic 進一步披露了 Claude 文字浮水印的工作方式。 這項安排與歐盟《AI 法案》下的透明度行為準則有關,要求 AI 公司建立可識別 AI 生成內容的機制。
公司在最新部落格中解釋,Claude 會在一些「低風險選擇」上嵌入特定模式。 例如描述天氣時,在多個意義接近的字詞之間做選擇。 這樣的模式一般讀者難以察覺,但持有對應密鑰的一方可以偵測出來。
Anthropic 表示,文字浮水印不會影響 Claude 輸出品質。 對讀者來說,帶浮水印和不帶浮水印的答案沒有明顯差異。
公司稱,Claude 採用的是 Google DeepMind 在 2024 年提出的 SynthID-Text 方案,併計劃推出水印檢測 API。 Anthropic 同時強調,這與一些 AI 檢測公司透過分析寫作習慣、句式特徵來判斷是否使用 AI 的方法不同。
前者是檢查是否有預先嵌入的標記,後者則是根據文字風格做推論。 兩類方法的原理並不相同。
對於用戶關心的“改寫後是否還能識別”,Anthropic 的說法是,輕度編輯大概率無法徹底清除水印,但如果對文本進行完全重寫、幾乎替換每個詞,水印就可能消失。
公司也提到,如果一段文字只是經過 Claude 校對或少量潤色,是否能偵測到水印,要看文字長度以及修改幅度。 若改動較輕,絕大多數內容仍由人類作者完成,可供水印附著的部分會很少。
在程式碼產生場景中,水印強度預計會低於一般文字。 原因是模型需要輸出可運行程式碼,可自由替換的表達空間更小。 不過在程式碼註解等位置,浮水印仍可使用,且對實際程式碼影響很小。
Anthropic 表示,Claude 不會是唯一採用文字浮水印的聊天機器人,其他簽署相同透明度行為準則的大型模型開發人員也將部署各自方案。
登入回覆
登入分享您的看法評論
相關文章