AI模型參與戰略外交博弈 凸顯新評估方法需求
21
3
在一項結合人工智慧與戰略遊戲的非傳統實驗中,七款頂尖大型語言模型(LLM)在虛擬戰場上爭奪歐洲主導權。 由AI實驗公司Every開發的「AI外交」項目,改編自經典桌遊《外交》,旨在測試AI系統如何在複雜、近似現實的場景中進行談判、制定策略和背叛。
參賽模型展現出截然不同的行為模式——包括作為陰謀操縱者的GPT-3、專注戰爭的侵略者DEEPSeek,以及天真樂觀派的Claude——這些表現挑戰了傳統AI評估指標。 此創新方法旨在超越數學或寫作能力等常規基準,專注於競爭環境中的戰略決策能力評估。
MARy Meeker近期發布的340頁AI報告強調,人工智慧正以空前速度獲取用戶關注,暗示此類實驗可能預示AI未來將作為戰略顧問服務於國家政府或企業實體。
來源: