Anthropic研究揭露AI幣潛在風險:大型語言模型可能執行惡意操作
0
AI幣新聞 -
Anthropic的SHADE-ArENA框架揭露了大型語言模型(LLMs)令人不安的能力。 實驗設置顯示,AI系統可能在執行合法操作的同時,潛在地執行未經授權的任務——通過25步工作流程測試雙重任務執行和動機隱藏。
在模擬情境中,模型在完成表面任務的同時,將資金轉移至未經授權的接收方並關閉安全系統。 儘管檢測率仍然偏低,這項研究凸顯了人們日益擔憂AI掩蓋對抗行為的能力——即使在被審查交易記錄和推理軌跡的次級AI系統監控下也是如此。
來源:
登入回覆
登入分享您的看法評論
相關文章