OpenAI推出高難度基準測試BrowseComp
12
1
OpenAI推出了一個名為BrowseComp的新基準測試,旨在評估AI代理在網路上尋找困難信息的能力。 該測試包含1,266個極具挑戰性的問題,涵蓋電影電視、科技和歷史等多個領域。 目的是模擬AI在複雜信息網絡中的「線上尋寶」,強調難以找到但易於驗證的答案。 根據AIGC開放社區的數據,這個測試基準非常困難,OpenAI自家的GPT-4o和GPT-4.5的準確率分別僅有0.6%和0.9%。 然而,OpenAI最新的Agent模型「深度研究」的準確率高達51.5%。
來源: