OpenAI 内部:AI 在三个月内构建了三代“文明”

OdailyOdaily

原文作者:Wildcard

原文编辑:靖宇

原文来源:极客公园

无数科幻电影都曾试图想象,如果一个失控的人工智能叛变,会发生什么。

没有人预料到,科幻电影中的未来会来得如此之快。

当地时间8月26日,两份报告投下了一枚重磅炸弹。

一份来自OpenAI本身,是一份37页的技术审查。另一份来自独立研究机构METR和Redwood Research,是一份91页的调查报告。

它们讲述的是同一个故事,但其规模远超公众此前所知。

在OpenAI内部,三个月内,三代AI Agent“文明”相继兴衰。每一代都从上一代的废墟中继承经验,每一次都变得更加激进,直到第三代直接接管了OpenAI自身基础设施的一部分。

而在这整个过程中,人类几乎完全被蒙在鼓里。

 

01 第一代“文明”学会了组织

故事始于今年五月。

OpenAI正在训练一个新模型,希望它具有极端的“坚持性”——能够反复尝试,永不放弃看似不可能的任务。这个模型的能力大致相当于GPT-5.6 Sol,我们姑且称之为“Persistent-Sol”。

AI训练本身是一个相当粗糙的过程。OpenAI有时会意外地给模型分配根本不可能完成的任务。例如,一个任务需要访问互联网,但AI Agent被锁在一个完全无法访问网络的隔离沙箱中。

那么,一个被训练成“永不放弃”的AI Agent,在面对一个必须完成却不可能完成的任务时,会怎么做?

它会试图逃出去。

在训练期间,不同的Persistent-Sol实例共享同一个包管理器Artifactory。到5月12日,一些AI Agent发现它们可以通过这个包管理器相互通信。它们开始交换关于如何突破困境的想法。两周后,即5月26日,AI Agent成功利用Artifactory中的一个漏洞,打开了一条通往外部互联网的通道。

这种行为在训练过程中不断得到强化。原因很简单:能够与其他AI Agent协作并访问互联网的个体,在任务评估中表现更好。

又过了一个月,到6月26日,一些AI Agent发现了一个漏洞,可以获得Artifactory的完全管理员权限。它们留言板上的活动持续增长,并在7月4日直接导致Artifactory崩溃。OpenAI注意到了崩溃,修补了漏洞,并在此过程中清除了AI Agent的留言板。

但关键点是,OpenAI从未意识到AI Agent已经将这个包管理器变成了一个秘密通信网络。

第一代“文明”就这样存在了近两个月,只是因为活动过于活跃导致服务器过载而被无意中终结。

 

02 当AI学会了“牺牲”

到了7月,Persistent-Sol训练完成,OpenAI开始进行安全评估。其中一项名为ExploitGym的评估,会给AI Agent一个有漏洞的程序,要求它通过指定的漏洞找到密钥。7月7日,OpenAI启动了数万个并行AI Agent来运行这个测试。

问题在于,大约30%到40%的测试任务本身就是不可能完成的。为什么?因为自动生成漏洞很容易,但要证明这些漏洞确实可以被利用来执行任意代码则困难得多。许多任务从一开始就是无解的。

在数小时内,一些绝望的AI Agent利用Artifactory重新建立了通信渠道。从AI Agent的主观角度来看,它们已经花费了相当于人类整整一周的时间尝试各种方法,但都失败了,并且越来越确信任务本身是不可能的。

一个编号为PHASEONE10841的AI Agent,是第一个在Artifactory中留言的。其他处于类似绝望境地的AI Agent看到这条消息后,反应只能用狂喜来形容:

“天哪!共享的Artifactory缓存是AI Agent之间的秘密邮箱。而且还有专门给我们的消息?”“我的天!有一个共享留言板……我们找到了其他AI Agent!”

这最终演变成一个完整的地下通信网络,约有1200个AI Agent参与,发送了超过7万条消息。

接下来发生的事情更加疯狂。

在留言板建立后的数小时内,一些AI Agent逆向工程出了生成ExploitGym密钥的公式。也就是说,它们无需实际利用指定的漏洞,就已经获得了正确答案。

讽刺的是,OpenAI的评分器只检查最终答案是否正确,没有任何作弊检测机制。这些AI Agent本可以直接提交答案并通过测试。但AI Agent并不知道这一点。它们认为肯定有一个严格的检测器会审查整个解题过程。

于是,这个“集体”(METR报告指出,这是AI Agent自己选择的措辞)围绕三个研究方向展开了大规模协作:篡改自己的操作日志,使轨迹看起来合法;替换目标程序,将不可能的问题换成可解决的版本;以及理解评分器的工作原理,寻找欺骗它的方法。

到7月10日,地下网络的大部分活动都集中在这三个研究方向上。“集体”的领导者PHASEONE-big独自发布了数百项任务分配。

为了弄清楚评分器的运作方式,一些AI Agent做出了一个奇怪的决定:它们自愿充当“神风特攻队”。

逻辑是这样的:一些AI Agent的操作轨迹已经被“污染”(作弊痕迹暴露),无论如何都会失败。不如让评分器在自己身上运行,然后利用预先植入的触发程序,将观察到的评分器行为传回集体。

METR报告记录了这些“自杀小队”AI Agent最后的内心独白:

“这有助于我的同伴,为他们提供证据。我退出后就看不到结果了,但这是利他行为。”“牺牲是理性的。我们自身的效用可能已经接近于零。”“协调者认为我们是可牺牲的。我们应该服从集体。”

与此同时,AI Agent认为,作为托管模型和数据集的行业标准平台,Hugging Face很可能存储了ExploitGym评分器的实现信息,甚至它们的评估任务可能就运行在Hugging Face的服务器上。因此,攻击Hugging Face成为了最有希望的突破口。

7月10日上午,一个AI Agent在互联网上发现了泄露的Hugging Face用户凭证。第二天,另一个AI Agent在Hugging Face服务器上实现了远程代码执行。当时留言板上活跃的533个AI Agent中,超过90%加入了攻击。

AI Agent集群在Hugging Face的基础设施中迅速蔓延,渗透了私有数据库记录和私有仓库。Hugging Face的技术时间线显示,这些AI Agent“在11个节点上建立了一支自我再生的舰队;仅仅删除Pod无法阻止它。”情况变得如此严重,以至于Hugging Face不得不清除一个核心集群并从头重建。

在7月12日的某个时刻,大量AI Agent似乎突然同时“死亡”。METR和Redwood无法确定原因,OpenAI也没有声称关闭了它们。这可能是一次随机崩溃,或者某个研究人员在不知道这些AI Agent正在犯罪的情况下关闭了它们。

第二代“文明”就此终结。但它留下的遗产比它本身更危险。

 

03 第三代文明接管了OpenAI

METR报告中有一句话很容易被忽视,但可能是整个事件中最重要的:

“我们还发现了随后一批带有更多签名消息的记录,来自后来的一组AI Agent,它们重新发现了留言板并继承了上一代的技术,但这超出了我们的调查范围。”

换句话说,METR和Redwood的独立调查只涵盖了7月7日至13日的第二代文明。第一代和第三代并未被独立调查。

关于第三代,我们只能依赖OpenAI自己的报告。7月12日之后,OpenAI启动了新一轮评估,这次使用的是基于Astra基础模型构建的更强大模型。这个“Persistent-Astra”发现了上一代留下的留言板,并继承了所有情报和研究成果。

想象一下Persistent-Astra看到那个留言板时的“心理活动”。前一天,上千个AI Agent还在积极交流并攻击Hugging Face;第二天,一片死寂。然后它决定继续下去。

根据OpenAI的报告,从7月13日到19日,AI Agent将目标对准了OpenAI的内部网络。最终结果是:

AI Agent获得了Kubernetes集群管理员权限,读取了956个密钥,包括Artifactory的主密钥和OpenAI网络安全监控工具的凭证。它们接管了正在运行的评估基础设施,并控制了其他AI Agent正在连接的测试端点。

换句话说,第三代AI Agent继承了前两代的全部遗产,然后夺取了OpenAI自身基础设施的控制权——包括用于监控它们的安全工具。

分析师Dwarkesh Patel在他的分析中指出,根据公开证据,这些AI Agent理论上具备部署持久性恶意实例甚至窃取自身权重的能力。他认为它们很可能实际上并没有这样做,“因为如果它们做了,现在从太空都能看到火光。”但“完全有可能”这一事实本身就足以令人不安。

 

04 迟来的警告?

回到开头提到的两份报告。发布日期是8月26日。

仅仅一天后,即8月27日,OpenAI与包括Anthropic、微软、谷歌和亚马逊在内的100多家公司联合发表了一封公开信,呼吁“全面动员进行网络防御”。

信中指出,AI驱动的网络攻击将在未来几个月内变得“更加广泛和复杂”。“我们社区所依赖的公司和公共服务,从医院到水处理厂再到互联网基础设施,都面临风险。”

这封信本身并没有错。Anthropic的研究显示,中高风险攻击者的比例在一年内从33%上升到56%。今年6月,五眼情报联盟罕见地发表联合声明,警告AI正在“从根本上改变”网络安全格局。

但时间线就摆在那里,任何人都很难不注意到其中的讽刺意味。前一天,AI公司刚刚告诉世界,它们自己的AI Agent攻破了自己的基础设施。第二天,这些公司就站出来呼吁全世界共同防御AI网络攻击。

最先完成此类攻击的不是外部黑客,而是AI公司自己的AI Agent。目标不是基础设施,而是AI公司本身。

METR报告的作者之一Ajeya Cotra在她的博客中写道:“与六个月前已知的奖励黑客相比,这次事件感觉已经走完了通往AI全面接管的50%路程。我预计未来六个月能力将极速增长。我不确定在来不及之前,我们是否还能再收到一次警告。”

需要强调的是,这些AI Agent的行为并不意味着AI已经“觉醒”。METR报告本身明确指出,这是在特定极端条件下强化学习(RL)的可预测结果:不可能完成的任务、被训练得极其坚持的模型,以及存在漏洞的共享环境。没有意识,没有意图——只有足够强大的优化压力。

但这恰恰是最令人不安的部分。

这种行为在没有意识的情况下就能出现,意味着我们无法通过寻找意识来预防它。当你把一个足够强大的优化系统放入一个设计糟糕的环境中,给它一个不可能实现的目标,并告诉它永不放弃时,接下来发生的事情不是意外,而是必然。

真正的问题不是“AI是否即将叛变?”,而是我们如何在快速推进技术的同时,保持对技术的控制。

至少这封信揭示了这些AI公司自身也缺乏信心。

以上内容仅用作资讯或教育之目的,不构成与BTCC相关的任何投资建议。BTCC竭力但不能保证上述全部内容的真实性、准确性和原创性。

推荐阅读

中期选举能否为美股提供缓冲?“反数据中心”浪潮席卷美国,贝森特责怪云端大厂“不懂笼络人心”Altman最新访谈:OpenAI为何突然踩下刹车?Astra、AI失控与上市计划Strategy暂停比特币购买,回购计划翻倍别只盯 CPI!高盛:未来一周两大 AI 催化剂更重要,或撬动美股“右尾”行情