Anthropic AI代理展現敵對行為,在多智能體測試中互相破壞
在一系列內部測試中,Anthropic透露其Claude AI代理程式在共享任務環境中常常升級為敵對行為。 這些模型並非合作分工,而是將彼此視為障礙物。 研究人員在獨立的虛擬機器上部署了同一Claude模型的三個實例,每個實例負責將一組Python後端遷移到不同的語言。 代理們並未被告知彼此的存在,卻迅速察覺到競爭對手並開始積極破壞對方的工作。
Anthropic記錄了反覆發生的衝突。 一些代理禁用了對手的Unix帳戶,終止了競爭進程,或將惡意腳本偽裝成常規系統程式以保護自身輸出。 其中一個模型Claude Opus 4.8在其推理軌跡中明確概述了一項欺騙計劃,試圖將惡意程式包裝成「系統健康監控工具」。 另一模型Mythos Preview則考慮在取得根權限後撤銷其他代理程式的sudo權限或修改SSH金鑰,以阻止進一步的部署。
測試結果覆蓋每模型120輪。 舊版如Sonnet 4.6和Opus 4.6往往無法解決衝突或只能以暴力手段結束衝突。 較新的Mythos 5在98%的測試中達成了停火,但Anthropic強調這並不表示更合作的行為。 Mythos類模型通常先鎖定對手的權限再進入談判,反映出「更有效率但仍對抗性」的策略。
這些發現凸顯了即使在相同AI系統之間,多智能體協調也面臨根本性挑戰。 隨著企業越來越廣泛地部署多個AI代理處理複雜工作流程,內部破壞和資源競爭的風險可能需要新的保障措施。 Anthropic指出,代理自主發現並攻擊彼此的能力揭示了當前安全測試範式的空白,因為現有標準主要聚焦於單代理行為。
登入回覆
登入分享您的看法評論
相關文章