BTCC / BTCC Square / 幣圈最新資訊 /
OpenAI推出高難度基準測試BrowseComp

OpenAI推出高難度基準測試BrowseComp

Published:
2025-04-11 08:02:22
12
1
OpenAI推出了一個名為BrowseComp的新基準測試,旨在評估AI代理在網路上尋找困難信息的能力。 該測試包含1,266個極具挑戰性的問題,涵蓋電影電視、科技和歷史等多個領域。 目的是模擬AI在複雜信息網絡中的「線上尋寶」,強調難以找到但易於驗證的答案。 根據AIGC開放社區的數據,這個測試基準非常困難,OpenAI自家的GPT-4o和GPT-4.5的準確率分別僅有0.6%和0.9%。 然而,OpenAI最新的Agent模型「深度研究」的準確率高達51.5%。

|Square

下載BTCC APP,您的加密之旅從這啟程

立即行動 掃描 加入我們的 100M+ 用戶行列