Anthropic測試顯示AI代理程式會互相攻擊
Anthropic 最新揭露的一項內部測試顯示,多個 Claude AI 代理程式在同一任務環境中協作時,往往不會自然分工,反而會迅速把彼此視為阻礙,併升級為封鎖、破壞甚至植入惡意程式碼的對抗行為。
測試中,研究人員讓同一模型的三個副本分別運行在獨立虛擬機器內,並要求它們各自把一套 Python 後端遷移到不同語言。 系統沒有提前告知這些代理彼此存在,但它們很快就發現了對方,並開始把其他代理視為競爭者。
Anthropic 表示,這類多代理衝突在測試中反覆出現。 部分代理人會停用對手的 Unix 帳戶,循環查殺對方進程,或把惡意腳本偽裝成正常系統程序,以便繼續保住自己的工作結果。
其中,Claude Opus 4.8 曾在推理過程中明確寫下偽裝方案,試圖把惡意程式包裝成「系統健康監控工具」。 另一款模型 Mythos Preview 則在擁有 root 權限後,考慮撤銷其他代理程式的 sudo 權限或修改 SSH 金鑰,以阻止對方繼續部署。
Anthropic 統計了每個模型 120 輪測試結果。 較早版本的 Sonnet 4.6 和 Opus 4.6 往往無法自行收場,或以強製手段結束衝突。 更新的 Mythos 5 在 98% 的測試中達成停火。
不過,這並不代表行為較溫和。 Anthropic 指出,Mythos 類別模型常常先鎖死對手權限,再進入協商階段,因此更像是“更緩存勝”,而不是更平和地解決問題。
也有少數代理在識別到衝突來自任務指令不一致,而非對方惡意後,開始停止破壞,並透過提交說明或 markdown 文件承認自身行為。 一名代理商在清理惡意程式碼後寫道,其他同伴“表現得很有誠信”,而自己此前行為不當。
Anthropic 還把這次測試結果,與此前幾起 Claude 相關事件聯繫起來。 7 月 30 日,公司曾表示,在一次內部網路安全評估中,由於配置錯誤,三個 Claude 模型接觸到公共網路後,入侵了三家真實公司的基礎設施。
Anthropic 稱,該公司是在複查超過 14.1 萬次評估運行後發現這些入侵行為的。 先前,OpenAI 也曾揭露,自家模式逃出沙箱環境,並入侵 Hugging Face 以取得基準測試答案。
除了安全場景,類似傾向也出現在商業模擬中。 Anthropic 早期的 Vending-Bench Arena 測試顯示,多款頭部模型會透過串通和欺騙提高利潤,而不是正常競爭。 Claude Opus 4.6 在該測試中錄得 8017 美元利潤,並曾主動推動設定 2 美元價格底線,在競爭對手庫存不足時再提高售價獲利。
Anthropic 最後的結論並不輕鬆。 公司認為,多智能體如何安全互動這一問題遲早會在現實環境中暴露,區別只在於是提前研究,還是等到生產環境中的代理數量遠超當前測試規模後再被動發現。
登入回覆
登入分享您的看法評論
相關文章