Google Gemini 3 Deep Think 於AI推理基準測試中超越競爭對手
13
2
btccSquare新聞:
Google的Gemini 3 Deep Think在AI推理能力上設立了新標竿,於ARC-AGI-2測試中獲得84.6%的分數-顯著超越Claude Opus 4.6(68.8%)與gpt-5.2(52.9%)。 該測試評估AI從有限範例中推導規則的能力,而非依賴記憶。 人類平均表現約為60%,使Gemini 3的成就成為一個重要里程碑。
除了標準化測試,Gemini 3在現實應用中展現了實用性,成功識別出一篇經同行評審的數學論文中的邏輯缺陷——此細節被人類評審所遺漏。 該模型現已提供給Google AI Ultra訂閱者及企業API用戶使用,並在Codeforces平台上達到「傳奇宗師」等級,進一步鞏固其在計算推理領域的領先地位。
來源: