OpenAI定制ASIC芯片9个月即超越英伟达Blackwell?

OdailyOdaily

原文作者:董静

原文来源:华尔街见闻

 

OpenAI首款自研芯片Jalapeño横空出世,正以惊人速度颠覆现有AI芯片产业格局——这不仅是产品发布,更是一个信号:AI正在重塑芯片设计的方式。

华尔街见闻文章,彭博社8月25日报道,OpenAI表示Jalapeño在两项关键指标上领先英伟达GB300:单位功耗处理的AI工作负载和响应速度。该芯片与博通合作开发,专为AI推理阶段设计,预计最早今年晚些时候投入实际使用。OpenAI芯片部门负责人Richard Ho表示,Jalapeño在700瓦的低功耗下提供强劲性能,有助于大幅降低数据中心电力成本。

据半导体研究机构SemiAnalysis,该芯片从设计启动到流片仅用了约16个月,关键的CoWoS封装流片节点于2025年11月完成——距今仅9个月,远短于行业通常的18至36个月周期

SemiAnalysis研究人员亲赴OpenAI实验室,使用其专有基准测试套件InferenceX对Jalapeño进行了测试。结论直截了当:该芯片在每瓦性能(perf/W)上击败了他们此前测试过的所有英伟达、AMD和谷歌芯片。

更值得注意的是,这一成绩是在Jalapeño未启用投机解码或预填充-解码分离(PDD)的情况下取得的,而其他对比芯片均运行在各自最优配置下。

难怪知名半导体分析师Dylan Patel直言:“被掀翻的不仅是Blackwell——连英伟达的Rubin芯片也已被超越”!

分析师认为,这一结果对英伟达的市场地位构成直接挑战,并迫使市场重新评估AI芯片的竞争格局。

 

基准数据:Jalapeño在多项关键指标上碾压Blackwell

SemiAnalysis的测试结果显示,Jalapeño在推理效率上的优势相当显著。

GPT-OSS 120B模型上,Jalapeño每秒输出约1459个token,而英伟达GB200仅为535个。在端到端延迟方面,Jalapeño完成任务仅需1.65秒,而GB300耗时近6秒——相差3.6倍。在高交互场景下,当GB300被推至最快解码速度(每秒169个token)时,Jalapeño的吞吐量高出104.3倍。

在每兆瓦每秒token数——数据中心能效的核心指标——上,Jalapeño在GPT-OSS模型上达到约5300万token/MW/s,而GB200 NVL72仅约1000万。

SemiAnalysis指出,该指标本质上等同于每焦耳产生的token数,直接决定数据中心的收入上限——在算力受电力制约的时代,这一优势尤为关键。

从系统级成本角度看,SemiAnalysis计入供电、散热和网络后,Jalapeño每芯片每小时的总拥有成本(TCO)约为1.56美元,与H100的1.55美元几乎持平,而英伟达Vera Rubin高达3.61美元。

值得注意的是,SemiAnalysis也提出了几项重要保留意见。

第一,测试所用模型并非当前最前沿。英伟达和AMD已发布基于AgentX套件在更大规模模型(如DeepSeek V4 Pro和Kimi K3)上的结果,而Jalapeño尚未完成AgentX测试——该套件更能反映多轮长上下文工作负载下的真实生产环境性能。

第二,更公平的比较对象应是同样使用HBM4的英伟达Vera Rubin,而非Blackwell。Vera Rubin的每瓦性能约为GB200 NVL72的5.4倍,与Jalapeño相比,两者在每token总拥有成本(TCO)上几乎持平。

第三,Jalapeño仍处于工程样品阶段,量产预计要到2027年才会逐步爬坡。

 

AI设计芯片:GPT-Astra与Codex的飞轮效应

Jalapeño能以如此惊人的速度研发,核心原因在于AI工具的深度参与。据SemiAnalysis,OpenAI在芯片设计过程中大量使用内部AI模型,包括广受关注的GPT-Astra。

社交平台X用户Andrew Curran援引OpenAI信息指出,GPT-Astra深度参与了Jalapeño的整个研发过程:

“团队使用Codex和GPT-Astra,在两个月内将三款原本不在Jalapeño量产计划中的开源模型调校至高性能。”

这意味着AI不仅在加速芯片设计本身,还在迅速扩大芯片可支持的模型范围。

SemiAnalysis的数据进一步量化了这一贡献:

AI辅助设计使SIMD单元面积减少8%,矩阵引擎面积减少10%,同时在时序和功耗上也优于初始版本。

在软件层面,OpenAI使用内部扩展版Codex编写Jalapeño内核,部分内核代码约3000行。在最影响性能的注意力机制和MoE模块上,AI生成的代码比顶尖人类工程师的实现快1.5至1.8倍。

SemiAnalysis的评价十分尖锐:运行在英伟达GPU上的OpenAI模型(如GPT-5.6 Sol)正被用来设计一款对CUDA护城河构成真正威胁的芯片——“英伟达自己的GPU正在实时孕育其潜在继任者”。

 

架构分析:为何“通用”反而更快?

外界普遍以为Jalapeño是一款为OpenAI自家模型深度定制的芯片,但SemiAnalysis的结论恰恰相反:Jalapeño是一款面向AI推理的通用芯片,能够运行各种模型和工作负载,甚至包括用Codex移植的《毁灭战士》游戏。

在架构层面,Jalapeño的核心设计理念是“消除固定延迟”。与依赖复杂内存层级的GPU不同,Jalapeño将计算核心直接绑定到HBM切片,核心之间通过专用高带宽聚合网络同步,大幅降低内存访问延迟。

此外,Jalapeño采用乱序执行(OoO)核心搭配L1缓存,而非其他加速器常用的软件管理暂存器,使其在小批量、低延迟场景下能够接近硬件理论峰值。

在内存带宽方面,Jalapeño使用HBM4,实现单封装15.4TB/s的内存带宽,每瓦HBM带宽为22,而英伟达Rubin为11.1,GB300仅为5.71

SemiAnalysis指出,Jalapeño的HBM4引脚速度达到10Gbps,略高于英伟达Rubin的9.6Gbps,HBM供应商可能是三星。

值得一提的是,Jalapeño选择不实现预填充-解码分离(PDD)。SemiAnalysis给出了详细解释:

在实际生产环境中,输入输出比、并发量、缓存命中率等参数不断变化。固定池化会导致全局利用率下降,而同构资源池可以灵活应对流量变化,在延迟敏感请求和高吞吐批处理之间动态分配。

 

CUDA护城河:裂痕已现?

SemiAnalysis的报告作出一个分量十足的判断:CUDA护城河可能已经名存实亡。

依据在于软件爬坡速度的对比。英伟达Rubin的CoWoS流片比Jalapeño早一个月完成,但迄今为止,Rubin唯一公开的基准数据来自CoreWeave的工程样品。英伟达并未像OpenAI那样向第三方开放实验室进行免费测试。SemiAnalysis认为,这反映的不是硬件差距,而是软件成熟度差距。

从零开始构建软件栈让OpenAI得以摆脱历史包袱,做出更干净的架构决策。OpenAI使用其专有内核编程语言Gluon(基于Triton构建)和名为“Teacup”的内部推理引擎,并利用Codex快速调优内核。SemiAnalysis观察到,在不到两周内,Jalapeño在特定交互速度下的吞吐量提升了2倍以上;8天内,团队将张量并行从TP8扩展到TP32,实现跨机架的全机架部署。

不过,SemiAnalysis也明确指出,当前测试仅覆盖相对简单的8k1k工作负载,尚未完成AgentX多轮长上下文测试。在更复杂的智能体工作负载下,路由器、前缀缓存等组件的表现将成为新的挑战。

 

下一步:B0已进入晶圆厂,10GW路线图展开

Jalapeño的故事远未结束。

据SemiAnalysis,所有公开测试样品均为A0步进,而B0步进已进入晶圆厂,预计每瓦性能较A0提升约25%——B0的单个计算芯片将在维持700W TDP的情况下提供13.4 PFLOPs的MXFP4算力。

在系统层面,OpenAI与Celestica合作设计了完整的机架解决方案:每个ASIC机柜包含128颗Jalapeño芯片,双机柜系统总功耗约160kW,与英伟达GB300双宽机柜相当。

在大规模部署方面,单个横向扩展网络域最多可连接16个机架中的2048颗Jalapeño XPU。量产方面,SemiAnalysis预计2027年逐步爬坡下一个里程碑是100MW部署规模。

更大的战略图景是,OpenAI与博通已签署10GW定制加速器合作协议,这一规模大致相当于十台核电机组的满发输出。

华尔街见闻文章写道,OpenAI芯片部门负责人Richard Ho表示,公司已达到能够有效降低基础设施成本的功耗和成本水平,“这只是第一步”。他还强调,英伟达仍是重要合作伙伴,OpenAI的算力需求巨大,短期内不会放弃现有供应商。

分析师指出,Jalapeño的意义或许不在于今天能替代多少英伟达芯片,而在于证明了一件此前广受质疑的事:一家AI公司,利用AI工具,在创纪录的时间内,造出了一款真正有竞争力的芯片。这个飞轮已经开始转动。

以上内容仅用作资讯或教育之目的,不构成与BTCC相关的任何投资建议。BTCC竭力但不能保证上述全部内容的真实性、准确性和原创性。

推荐阅读

黄金跌破4300美元,宏观压力加剧;BTC守住77000美元库克交棒,苹果换帅:OpenAI买空Mac mini的背后,藏着苹果全新的AI时代船票AllianceDAO与FOMO创始人最新持仓比例:美股占70%,加密只留BTC与ZcashAltman最新访谈:OpenAI为何突然踩下刹车?Astra、AI失控与上市计划中期选举能否为美股提供缓冲?