BTCC / BTCC Square / PanewslabTW /
OpenAI推出高難度基準測試BrowseComp,挑戰AI上網搜索能力

OpenAI推出高難度基準測試BrowseComp,挑戰AI上網搜索能力

PanewslabTW
發佈時間:
2025-04-11 07:54:50
0

PANews 4月11日消息,OpenAI已開源全新基準測試BrowseComp,用於評估AI代理在互聯網上查找難以獲取信息的能力。 該測試包含1266個極具挑戰性的題目,設計初衷為模擬AI在復雜信息網絡中的“在線尋寶”,強調答案難找但易驗證。 測試中問題涵蓋影視、科技、歷史等多個領域,難度顯著高於現有如SimpleQA等測試。

據AIGC開放社區稱,這個測試基準非常有難度,連OpenAI自己的GPT-4o、GPT-4.5準確率只有0.6%和0.9%幾乎為0,即便使用帶瀏覽器功能的GPT-4o也只有1.9%。 但OpenAI最新發布的Agent模型Deep Research準確率高達51.5%。

本站轉載文章皆來自公開網絡,部分由AI整理,僅為傳遞產業訊息,不代表BTCC立場。原創權益歸原作者所有。如發現版權問題,請透過[email protected]聯絡我們,我們將依法處理。 BTCC不對資訊準確性、時效性及完整性作任何保證,不承擔因依賴資訊而產生的任何責任。內容僅供參考,不構成投資、法律或商業建議。