AI預測能力媲美預測市場,GPT-5領跑Prophet Arena基準測試
12
2
btccSquare新聞:
最新研究顯示,人工智慧在預測現實世界事件方面已與預測市場達到同等水準。 SIGMA實驗室於8月推出的Prophet Arena基準測試,專門評估AI模型在Kalshi和POLymarket等平台上預測未決事件的能力,範圍涵蓋選舉、體育賽事結果和經濟指標。
與依賴歷史數據的傳統基準測試不同,Prophet ArENA針對未解決的未來事件測試模型。 這種方法消除了預訓練或數據洩漏帶來的優勢,研究人員稱之為AI預測能力的「公平競爭環境」。
初步結果展現了AI新興的預測實力。 gpt-5目前以82.21%的Brier分數領先,而OpenAI的o3-mini在將預測轉換為模擬投注場景時成為最盈利的模型。 值得注意的是,該基準測試將DeepSeek R1列為異常值,其預測經常偏離共識預期和市場預期。
來源: