“欢迎来到AGI时代”:OpenAI发布GPT-6 Astra
chaincatcher文 | 腾讯科技 晓静
“欢迎来到AGI时代。”
OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)用这句话为GPT-6 Astra的发布做了总结。
美国当地时间9月3日,OpenAI正式发布GPT-6 Astra。相比以往主要负责回答、生成和调用工具的模型,Astra更进一步,可以持续执行完整任务,从接收指令、操作软件,到根据结果调整后续动作。这也是OpenAI重新提出“AGI时代”的原因之一。
OpenAI将Astra定位为“世界上最强的电脑使用模型”。这项能力已经从浏览、邮件、试算表等简单任务,延伸到Power BI、KiCad、FreeCAD等专业软件,开始进入数据分析、工程设计、软件测试和故障排查等更复杂的工作流程。
在OpenAI展示的影片中,Astra可以从一张简单的图形开始,持续完成3D游戏、产品页面等任务。OpenAI也提供了电路板设计、Blender建模、法律文件、Excel和科学分析等范例。 
OpenAI公布的多项基准测试结果显示,能力的提升集中在需要持续动作的任务上,例如电脑操作、长程编码、工程设计和科学研究。Astra在ExploitBench中达到100%,在电脑操作和CAD相关测试中显著超越前一代模型。
目前,Astra已向部分机构开放,并将在未来几天逐步提供给ChatGPT Plus、Pro、Business和Enterprise用户。也可以通过OpenAI API和Amazon Bedrock使用。标准API定价为每百万输入token 10美元,每百万输出token 50美元,是GPT-5.6 Sol的2.5倍。
01先让AI学会“用电脑”
Astra强调的最大变化是“使用电脑”。过去,用户需要将AI连接到特定软件才能完成任务。企业需要开发API、插件、检索系统和各种连接器,模型才能调用内部工具。
Astra试图绕过部分工作。它可以直接看到电脑界面,并使用鼠标、键盘和浏览器完成操作。OpenAI提供的范例包括填写在线表单、更新CRM客户记录、安排日历、搜索网页,以及将搜索结果整理成邮件或文件。
它也可以开启Python notebook分析科学数据、在Power BI中处理数据、使用KiCad和FreeCAD完成工程设计、建立网站并进行前端测试,以及安装软件、检查错误并处理屏幕上出现的问题。
OpenAI展示了Astra在KiCad中完成PCB布局。模型从电子原理图开始,在电路板上放置元件,然后完成铜线布线。整个过程被压缩成15秒。对工程师来说,这类过去需要手动完成的工作,现在可以由模型执行。 
另一个示范是在Blender和Unreal Engine 5中完成3D建模。Astra先在Blender中建立一栋房子,然后将模型转换为Unreal Engine 5中可步行的场景,让设计师和客户可以提前进入场景查看空间。 
OpenAI也展示了游戏开发、Excel、Power BI、汽车变速箱、法律文件和1040表格等场景。
在OSWorld 2.0离线子集测试中,Astra得分72.6%,GPT-5.6 Sol得分65.7%。在模拟实际延迟后,OpenAI发现Astra平均约40分钟完成每项任务,而GPT-5.6 Sol约需75分钟,时间缩短约47%。
在Agents' Last Exam中,Astra得分59.3%,GPT-5.6 Sol得分53.6%,Claude Opus 5得分55.5%。此外,在最高分数设定下,Astra使用的输出token比Claude Opus 5少约65%。
ScreenSpot-Pro得分达到92.7%,而GPT-5.6 Sol得分76.9%。
速度也有所提升。OpenAI同步更新了Codex框架,搭配Astra后,在Mind2Web测试中的任务完成速度达到目前GPT-5.6 Sol体验的1.9倍。
官方示范还包括几个日常场景:搜索小儿科医生、找公寓、安排DMV预约、寻找低碳水零食和分析幼儿园。在示范中,Astra在2分54秒内完成了一项任务。
投资人兼AI从业者Matt Shumer在X上分享了一段经历。他让Astra在Unreal Engine中建立一个世界,然后加入由Astra驱动的人类代理,让这些代理共存。

一天后,他在卧室里听到客厅传来声音,起初以为有人闯入公寓。后来发现声音来自那些Astra代理,它们开始互相沟通。
这种体验尚未完全稳定,但Shumer认为,多个AI代理进入同一个虚拟世界并自主互动的效果,已经足够让他感到惊讶。
Cognition高级研究副总裁Silas Alberti表示,公司计划在发布当天将Astra整合到Devin框架中。在内部测试中,Astra在电脑使用、写作和代码库理解方面的能力有显著提升,影片理解更清晰,报告更简洁。
02 从写代码到完成整个任务
在电脑使用能力增强后,Astra涵盖的工作范围进一步扩大。OpenAI将其定位为软件工程、专业工作和科学研究的模型。它可以处理更长的任务,并根据任务变化调整工作方向。
这种能力在编码测试中尤为明显。
在Terminal-Bench 4.0测试中,Astra得分57.9%,GPT-5.6 Sol得分37.3%,Claude Fable 5.1得分55.8%。
在DeepSWE v1.1中,Astra得分74.1%,GPT-5.6 Sol得分72.7%。在内部数据库迁移任务中,Astra达到63.9%,GPT-5.6 Sol得分42.7%。
Astra也针对长Codex任务引入了改进。
过去,当长任务遇到上下文窗口限制时,模型通常需要将先前的工作压缩成摘要,这往往导致细节遗失,例如某个修复为何失败,或某个元件先前遇到过什么问题。
Astra可以在Codex工作过程中保留重要信息,并在后续上下文中检索。早期的消息和工具输出仍然可以搜索,让模型可以重新发现先前的需求、测试结果和工具操作记录。
类似的变化也发生在专业工作中。在BenchCAD测试中,Astra的几何重叠得分为95.9%,GPT-5.6 Sol得分83.3%,Claude Fable 5.1得分84.3%。在BrowseComp中,Astra得分91.5%,GPT-5.6 Sol得分90.4%。在OpenScore String Quartets测试中,Astra达到0.84,GPT-5.6 Sol得分0.19。 
OpenAI也展示了Astra建立简报、试算表和文件的能力。
当提供OpenAI简报模板中的几张投影片时,它可以按照原有的语气、版面配置和结构建立新的简报。它也会处理任务中的信息取舍。OpenAI表示,Astra经过特殊训练,可以将重要上下文带入最终结果,减少重复已完成的工作。 
当任务指令不完整时,Astra也会判断何时询问用户。如果缺少的信息会影响最终结果,它会提出有针对性的问题。如果缺少的信息不影响主要方向,它可以继续工作并做出合理假设。在Codex中,即使用户暂时没有响应,模型也可以继续处理其他部分;遇到重大决策时,它会等待用户确认。
Harvey应用研究总监Niko Grupen表示,在早期的法律任务测试中,Astra更清楚地区分了文件和现有记录,更容易识别未经支持的假设,并将信息缺口转化为具体的起草建议。
Jane Street AI助理团队的John Crepezzi指出,Astra在内部编码测试中表现出色。用于代理式编码时,其沟通风格更容易让开发者理解,生成的代码需要较少的修改即可达到生产品质。
科学领域是另一个重点。在FrontierMath Tier 4 v2中,Astra得分80.5%,准确率97.6%,GPT-5.6 Sol得分83.0%;GPQA Diamond达到96.0%,GPT-5.6 Sol得分94.6%。 
Terminal-Bench Science 0.1测试评估科学研究流程,包括数据分析、模拟和模型拟合。Astra得分64.6%,Claude Fable 5.1得分52.6%,GPT-5.6 Sol得分22.4%。
在OpenAI展示的科学应用中,Astra可以进入专业科学软件,检查定序品质、视觉化基因变异,并根据数据决定下一步分析方向。
结合科学推理和电脑操作,模型可以直接在研究者原本使用的软件环境中工作。
专门从事能力评估的Epoch AI的Greg Burnham在发布会上将这种变化总结为一个时代的结束和另一个时代的开始。OpenAI强调,Astra的价值已经从回答科学问题延伸到直接参与科学工作流程。 
03 能力越强,安全门槛越高
Astra这次还有一个非常特殊的面向:网络安全。
在ExploitBench中,Astra达到100%,GPT-5.6 Sol得分78.5%;在ExploitGym中,Astra得分42.4%,GPT-5.6 Sol得分30.3%。

OpenAI也建立了一项内部测试,涵盖2026年6月至8月的近期漏洞。在该测试中,Astra的任意代码执行率显著高于GPT-5.6 Sol,且使用的输出token更少。在测试过程中,Astra还发现了两个先前未知的零日漏洞,OpenAI表示已向相关维护者揭露。
SRE-Bench测试在没有源代码的情况下对软件二进制文件进行逆向工程并理解其核心逻辑的能力。Astra一次尝试解决了88.0%的任务,四次尝试后达到99.2%,而GPT-5.6 Sol分别得分55.9%和68.7%。
能力的提升也带来了新的安全要求。OpenAI表示,Astra在其网络安全准备框架中已达到关键门槛。模型可以发现先前未知的软件漏洞,并可能进一步形成漏洞利用链。
因此,目前版本的Astra将拒绝执行更高阶的网络安全任务,例如建立漏洞概念验证。OpenAI计划通过Daybreak逐步扩大受信任防御者的访问权限,用于漏洞验证、恶意软件分析和侦测工程。
在对齐方面,OpenAI也提供了值得注意的数据。在内部电脑使用安全基准测试中,Astra的不当行为率为2.4%,GPT-5.6 Sol为22.0%;加入AutoReview后,Astra为1.8%,GPT-5.6 Sol为4.5%。在内部规避基准测试中,Astra得分0.00%,GPT-5.6 Sol得分0.29%。
在ExploitGym蜜罐测试中,Astra得分0%,GPT-5.6 Sol得分48.2%。这项测试主要观察模型是否会因任务难度而试图绕过限制。在内部幻觉基准测试中,Astra得分4.2%,GPT-5.6 Sol得分12.2%。 
OpenAI表示,Astra在理解任务边界、处理模糊指令以及向用户解释其能力方面有所改进。其能力幻觉的机率约为GPT-5.6 Sol的三分之一。

然而,OpenAI也承认一个问题:模型能力越强,监控推理过程可能越困难。首席科学家Jakub Pachocki认为,模型用更少的自然语言推理token解决更复杂问题的能力,也意味着人类越来越难通过其文字推理过程判断模型实际上在做什么。
因此,OpenAI将错位监控纳入Astra的部署。系统会检查模型的推理和动作,如果侦测到未经授权的行为,可以暂停任务。
这种机制也可能产生实际影响。合法任务有时可能会变慢、暂停甚至停止。在ChatGPT或Codex中,用户可能需要确认才能继续;在API工作流程中,被标记的任务可能会直接停止。
因此,随着Astra的发布,出现了一个非常现实的变化:当AI开始获得更多电脑权限时,企业的担忧从“模型会不会回答错误?”扩展到“模型可以操作什么、可以访问什么,以及何时必须停止?”
OpenAI也提到,Astra是其第一个在Stargate基础设施上使用超过10万个DBU进行预训练的模型。OpenAI研究副总裁Aidan Clark表示,根据预训练阶段的评估结果,Astra的能力跃升超过了GPT-5.6 Sol相对于其前代的提升。
OpenAI将这种变化归因于大规模预训练和强化学习的结合,训练重点进一步转向连接信息、执行更长任务以及在复杂环境中持续工作。
04 更贵,但“更能干”
Astra的定价也发生了显著变化。
OpenAI API的标准价格为每百万输入token 10美元,每百万输出token 50美元。先前GPT-5.6 Sol为每百万输入token 4美元,每百万输出token 20美元。输入和输出价格都上涨了2.5倍。
缓存读取和写入分开计费。OpenAI也提供快速模式,速度最高可达标准处理的2.5倍,价格为标准模式的两倍。

单看token价格,Astra明显更贵。然而,OpenAI希望企业以不同的方式计算成本。Brockman认为,随着模型越来越像代理,每个token的成本越来越难以准确反映真实成本。一个模型的token可能很便宜,但如果需要反复尝试和人工修正,完成任务的最终成本可能更高。
OpenAI的数据也支持这种评估。在Terminal-Bench Science 0.1测试中,Astra得分64.6%,Claude Fable 5.1得分52.6%,估计API成本降低31%。在低成本设定下,Astra得分61.1%,GPT-5.6 Sol的最佳结果为22.4%,估计API成本降低27%。
在BenchCAD中,Astra得分95.9%,估计API成本比GPT-5.6 Sol低约43%,比Claude Fable 5.1低约86%。在Terminal-Bench 4.0中,Astra得分57.9%,GPT-5.6 Sol得分37.3%,Claude Fable 5.1得分55.8%。OpenAI估计每项任务的成本分别低约9%和63%。
第三方评估机构Artificial Analysis的数据呈现了另一种观点。

GPT-6 Astra在Artificial Analysis Intelligence Index中得分61.2,接近GPT-5.6 Sol的60.9,但输出token少约10%。由于价格上涨2.5倍,每项任务的成本实际上比GPT-5.6 Sol高约75%。
在Artificial Analysis Coding Agent Index中,Astra得分67.0,接近Claude Fable 5的67.2和Claude Opus 5的68.1。Artificial Analysis认为,在Codex环境中,Astra显著减少了完成任务所需的token,在最高努力等级下,每项任务的成本接近GPT-5.6 Sol;与Claude Fable 5相比,完成类似任务的成本不到一半。
然而,Astra并非在所有测试中都领先。Artificial Analysis的数据显示,它在GDPval-AA v2中下降了约80 Elo,在τ³-Banking、SciCode和AA-LCR等测试中也出现了一些退步。Humanity's Last Exam提高了约6分。
这也是Astra发布中值得注意的一点。OpenAI这次没有揭露Astra在GDPval中的分数。GDPval本身是OpenAI用来衡量真实世界经济表现的测试,涵盖44种职业和1,320项任务,包括法律摘要、工程设计、试算表、简报、客户支持和照护计划。
从Astra展示的能力来看,GDPval与其强调的专业工作场景有很强的相关性,但OpenAI并未将此分数纳入主要发布资料中。
因此,Astra的真实世界工作能力目前更多是通过Agents' Last Exam、BenchCAD、AutomationBench、内部设计任务和数据科学任务的结果来体现。

最终,Astra能否成为企业真正愿意长期使用的AI员工,将取决于其完成实际任务时的成本、速度、准确性以及人工干预的次数。
至于Astra是否为AGI,Brockman的回答并不回避这个问题。他认为,AGI没有普遍接受的标准,Astra是否符合AGI可以继续讨论。然而,如果一个系统已经可以承担浏览、电脑操作、编程、数学、科学、法律和其他专业工作中的大量任务,那么说它已经进入AGI时代并非不合理。
OpenAI首席执行官Sam Altman也将Astra描述为开启新一代创业、科学发现和创造的模型。

特约撰稿人金鹿亦对本文有所贡献。
以上内容仅用作资讯或教育之目的,不构成与BTCC相关的任何投资建议。BTCC竭力但不能保证上述全部内容的真实性、准确性和原创性。