OpenAI 自研晶片 Jalapeño 僅 9 個月超越 Nvidia Blackwell?
原文作者:董靜
原文來源:華爾街見聞
OpenAI 首款自研晶片 Jalapeño 橫空出世,以驚人速度顛覆 AI 晶片產業既有格局——這不僅是一款產品發布,更是一個訊號:AI 正在重塑晶片設計的方式。
根據華爾街見聞文章,彭博社 8 月 25 日報導,OpenAI 表示 Jalapeño 在兩項關鍵指標上領先 Nvidia 的 GB300:每單位功耗處理的 AI 工作負載量與回應速度。該晶片與 Broadcom 合作開發,專為 AI 推論階段設計,預計最快今年稍晚投入實際應用。OpenAI 晶片部門主管 Richard Ho 表示,Jalapeño 在 700 瓦的低功耗下提供強勁效能,有助於大幅降低資料中心電力成本。

根據半導體研究機構 SemiAnalysis,該晶片從設計啟動到完成下線僅花費約 16 個月,其中關鍵的 CoWoS 封裝下線節點於 2025 年 11 月完成——距今僅 9 個月,遠短於業界典型的 18 至 36 個月週期。

SemiAnalysis 研究人員親自造訪 OpenAI 實驗室,並使用其專有基準測試套件 InferenceX 對 Jalapeño 進行測試。結論直接了當:該晶片在每瓦效能(perf/W)上擊敗了他們先前測試過的所有 Nvidia、AMD 和 Google 晶片。
更值得注意的是,這項成果是在 Jalapeño 未啟用推測解碼或預填-解碼分離(PDD)的情況下達成,而其他比較晶片均在其最佳配置下運行。
難怪知名半導體分析師 Dylan Patel 直言:「被推翻的不只是 Blackwell——連 Nvidia 的 Rubin 晶片也被超越了」!

分析師認為,這項結果對 Nvidia 的市場地位構成直接挑戰,並迫使市場重新評估 AI 晶片的競爭格局。
基準測試數據:Jalapeño 在多項關鍵指標上碾壓 Blackwell
SemiAnalysis 的測試結果顯示,Jalapeño 在推論效率上的優勢相當顯著。
在 GPT-OSS 120B 模型上,Jalapeño 每秒輸出約 1,459 個 token,而 Nvidia 的 GB200 僅達 535 個。在端到端延遲方面,Jalapeño 僅需 1.65 秒完成任務,而 GB300 耗時近 6 秒——差距達 3.6 倍。在高互動性場景中,當 GB300 被推至最快解碼速度(每秒 169 個 token)時,Jalapeño 的吞吐量高出 104.3 倍。

在每兆瓦每秒 token 數——資料中心能源效率的核心指標——上,Jalapeño 在 GPT-OSS 模型上達到約 5,300 萬 token/MW/s,而 GB200 NVL72 僅約 1,000 萬。

SemiAnalysis 指出,此指標本質上等同於每焦耳產生的 token 數,直接決定資料中心的營收上限——在算力受電力制約的時代,這項優勢尤為關鍵。
從系統級成本角度來看,SemiAnalysis 計入供電、散熱和網路後,Jalapeño 每顆晶片每小時的總擁有成本(TCO)約為 1.56 美元,與 H100 的 1.55 美元幾乎持平,而 Nvidia 的 Vera Rubin 高達 3.61 美元。

值得注意的是,SemiAnalysis 也提出了幾項重要保留意見。
首先,測試使用的模型並非目前最先進的模型。Nvidia 和 AMD 已公布基於 AgentX 套件在更大規模模型(如 DeepSeek V4 Pro 和 Kimi K3)上的結果,而 Jalapeño 尚未完成 AgentX 測試——該套件更能反映多輪對話和長上下文工作負載的真實生產環境效能。
其次,更公平的比較對象應是同樣使用 HBM4 的 Nvidia Vera Rubin,而非 Blackwell。Vera Rubin 的每瓦效能約為 GB200 NVL72 的 5.4 倍,與 Jalapeño 相比,兩者在每 token 總擁有成本(TCO)上幾乎持平。
第三,Jalapeño 仍處於工程樣品階段,預計要到 2027 年才會逐步量產。
AI 設計晶片:GPT-Astra 與 Codex 的飛輪效應
Jalapeño 能以如此驚人速度開發的核心原因,在於 AI 工具的深度參與。根據 SemiAnalysis,OpenAI 在晶片設計過程中大量使用內部 AI 模型,包括備受關注的 GPT-Astra。
社群平台 X 用戶 Andrew Curran 引用 OpenAI 資訊指出,GPT-Astra 深度參與了 Jalapeño 的整個研發過程:
「團隊使用 Codex 和 GPT-Astra,在兩個月內將三款原本不在 Jalapeño 量產計畫中的開源模型調校至高效能。」

這意味著 AI 不僅加速了晶片設計本身,也快速擴展了晶片可支援的模型範圍。
SemiAnalysis 的數據進一步量化了這項貢獻:
AI 輔助設計使 SIMD 單元面積減少 8%,矩陣引擎面積減少 10%,同時在時序和功耗上也優於初始版本。

在軟體層面,OpenAI 使用內部擴展版 Codex 編寫 Jalapeño 核心程式,部分核心程式碼長達約 3,000 行。在最關鍵的注意力機制和 MoE 模組上,AI 生成的程式碼比頂尖人類工程師的實作快 1.5 至 1.8 倍。
SemiAnalysis 的評價十分尖銳:在 Nvidia GPU 上運行的 OpenAI 模型(如 GPT-5.6 Sol)正被用來設計一款對 CUDA 護城河構成真實威脅的晶片——「Nvidia 自己的 GPU 正在即時孕育其潛在的繼任者」。

架構分析:為何「通用」反而更快?
外界普遍認為 Jalapeño 是一款針對 OpenAI 自家模型深度客製化的晶片,但 SemiAnalysis 的結論恰恰相反:Jalapeño 是一款通用 AI 推論晶片,能運行各種模型和工作負載,甚至包括用 Codex 移植的遊戲《毀滅戰士》。
在架構層面,Jalapeño 的核心設計理念是「消除固定延遲」。與依賴複雜記憶體階層的 GPU 不同,Jalapeño 直接將運算核心綁定至 HBM 切片,核心之間透過專用高頻寬聚合網路同步,大幅降低記憶體存取延遲。
此外,Jalapeño 採用亂序執行(OoO)核心搭配 L1 快取,而非其他加速器常用的軟體管理暫存器,使其能在小批次、低延遲場景中接近硬體理論峰值。
在記憶體頻寬方面,Jalapeño 使用 HBM4,實現單一封裝 15.4TB/s 的記憶體頻寬,每瓦 HBM 頻寬為 22,相較之下 Nvidia Rubin 為 11.1,GB300 僅 5.71。

SemiAnalysis 指出,Jalapeño 的 HBM4 接腳速度達到 10Gbps,略高於 Nvidia Rubin 的 9.6Gbps,HBM 供應商可能是三星。
值得一提的是,Jalapeño 選擇不實作預填-解碼分離(PDD)。SemiAnalysis 提供了詳細解釋:
在真實生產環境中,輸入輸出比、並發性和快取命中率等參數持續變化。固定池化會導致全域利用率降低,而同質資源池能靈活應對流量變化,並在延遲敏感請求和高吞吐量批次處理之間動態分配。
CUDA 護城河:裂痕已現?
SemiAnalysis 的報告做出重量級判斷:CUDA 護城河可能已經死亡。
其依據在於軟體成熟速度的比較。Nvidia Rubin 的 CoWoS 下線比 Jalapeño 早一個月完成,但迄今為止,Rubin 唯一公開的基準測試數據來自 CoreWeave 的工程樣品。Nvidia 並未像 OpenAI 那樣向第三方開放實驗室進行免費測試。SemiAnalysis 認為,這反映的不是硬體差距,而是軟體成熟度差距。
從零開始建構軟體堆疊,讓 OpenAI 得以擺脫歷史包袱,做出更乾淨的架構決策。OpenAI 使用其專有核心程式語言 Gluon(基於 Triton 建構)和內部推論引擎「Teacup」,並利用 Codex 快速調校核心程式。SemiAnalysis 觀察到,在不到兩週內,Jalapeño 在特定互動速度下的吞吐量提升了超過 2 倍;在 8 天內,團隊將張量平行從 TP8 擴展至 TP32,實現跨機架的整櫃部署。
然而,SemiAnalysis 也明確指出,目前測試僅涵蓋相對簡單的 8k1k 工作負載,尚未完成 AgentX 多輪長上下文測試。在更複雜的代理工作負載下,路由器、前綴快取等元件的效能將成為新的挑戰。
下一步:B0 已進入晶圓廠,10GW 路線圖展開
Jalapeño 的故事遠未結束。
根據 SemiAnalysis,所有公開測試的樣品均為 A0 步進,而 B0 步進已進入晶圓廠,預計每瓦效能較 A0 提升約 25%——B0 的單一運算晶粒將提供 13.4 PFLOPs 的 MXFP4 運算能力,TDP 維持在 700W。
在系統層面,OpenAI 與 Celestica 合作設計了完整的機櫃解決方案:每個 ASIC 機櫃包含 128 顆 Jalapeño 晶片,雙機櫃系統總功耗約 160kW,與 Nvidia 的 GB300 雙寬機櫃相當。

在大規模部署方面,單一橫向擴展網路域最多可連接 16 個機架中的 2,048 顆 Jalapeño XPU。在量產方面,SemiAnalysis 預計2027 年將逐步提升產量,下一個里程碑是 100MW 部署規模。
更大的戰略藍圖是,OpenAI 與 Broadcom 已簽署 10GW 客製化加速器合作協議,此規模大致相當於十座核電機組的總輸出。
華爾街見聞文章寫道,OpenAI 晶片部門主管 Richard Ho 表示,公司已達到能有效降低基礎設施成本的功耗和成本水準,且「這只是第一步」。他同時強調,Nvidia 仍是重要合作夥伴,OpenAI 的算力需求龐大,短期內不會放棄現有供應商。
分析師指出,Jalapeño 的意義或許不在於今天能取代多少 Nvidia 晶片,而在於證明了先前廣受質疑的一件事:一家 AI 公司,利用 AI 工具,在破紀錄的時間內,打造出一款真正具有競爭力的晶片。這個飛輪已經開始轉動。
以上內容僅用作資訊或教育之目的,不構成與BTCC相關的任何投資建議。 BTCC竭力但無法保證上述全部內容的真實性、準確性和原創性。