OpenAI開源BrowseComp,重塑Agent瀏覽器評測
0
金色財經報導,今天凌晨2點,OpenAI開源了專門用於智能體瀏覽器功能的測試基準——BrowseComp。 這個測試基準非常有難度,連OpenAI自己的GPT-4o、GPT-4.5準確率只有0.6%和0.9%幾乎為0,即便使用帶瀏覽器功能的GPT-4o也只有1.9%。 但OpenAI最新發布的Agent模型Deep Research準確率高達51.5%,在自主搜索、信息整合、準確性校準方面非常優秀。 (AIGC開放社區)
來源:
登入回覆
登入分享您的看法評論
相關文章
|Square
下載BTCC APP,您的加密之旅從這啟程
立即行動 掃描 加入我們的 100M+ 用戶行列