Chip ASIC của OpenAI vượt Nvidia Blackwell chỉ trong 9 tháng?

OdailyOdaily

Tác giả gốc: Dong Jing

Nguồn gốc: Wallstreetcn

 

Chip tự phát triển đầu tiên của OpenAI, Jalapeño, đã xuất hiện đầy bất ngờ, đảo lộn cục diện hiện tại của ngành chip AI với tốc độ chóng mặt—đây không chỉ là một buổi ra mắt sản phẩm, mà còn là tín hiệu: AI đang định hình lại chính cách thiết kế chip.

Theo một bài viết trên Wallstreetcn, Bloomberg đưa tin vào ngày 25 tháng 8 rằng OpenAI cho biết Jalapeño dẫn trước GB300 của Nvidia ở hai chỉ số chính: tải công việc AI xử lý trên mỗi đơn vị điện năng và tốc độ phản hồi. Con chip này, được phát triển hợp tác với Broadcom, được thiết kế riêng cho giai đoạn suy luận AI và dự kiến sẽ được đưa vào sử dụng thực tế sớm nhất vào cuối năm nay. Richard Ho, người đứng đầu bộ phận chip của OpenAI, cho biết Jalapeño mang lại hiệu năng mạnh mẽ ở mức tiêu thụ điện năng thấp 700 watt, giúp giảm đáng kể chi phí điện của trung tâm dữ liệu.

Theo công ty nghiên cứu bán dẫn SemiAnalysis, con chip này mất chỉ khoảng 16 tháng từ khi bắt đầu thiết kế đến khi hoàn tất tape-out, với nút tape-out CoWoS quan trọng được hoàn thành vào tháng 11 năm 2025—chỉ 9 tháng, ngắn hơn nhiều so với chu kỳ 18 đến 36 tháng thông thường của ngành.

Các nhà nghiên cứu của SemiAnalysis đã trực tiếp đến thăm phòng thí nghiệm của OpenAI và kiểm tra Jalapeño bằng bộ tiêu chuẩn độc quyền InferenceX. Kết luận rất trực tiếp: con chip này đánh bại tất cả các chip Nvidia, AMD và Google mà họ từng kiểm tra về hiệu năng trên mỗi watt (perf/W).

Đáng chú ý hơn nữa là kết quả này đạt được khi Jalapeño chưa bật tính năng giải mã dự đoán (speculative decoding) hoặc phân tách prefill-decode (PDD), trong khi các chip khác được so sánh đều đang chạy ở cấu hình tối ưu của chúng.

Không ngạc nhiên khi nhà phân tích bán dẫn nổi tiếng Dylan Patel thẳng thắn tuyên bố, "Không chỉ Blackwell bị lật đổ—ngay cả chip Rubin của Nvidia cũng đã bị vượt qua"!

Các nhà phân tích tin rằng kết quả này đặt ra thách thức trực tiếp đến vị thế thị trường của Nvidia và buộc thị trường phải đánh giá lại cục diện cạnh tranh của chip AI.

 

Dữ liệu chuẩn: Jalapeño nghiền nát Blackwell trên nhiều chỉ số chính

Kết quả kiểm tra của SemiAnalysis cho thấy lợi thế của Jalapeño về hiệu quả suy luận là khá đáng kể.

Trên mô hình GPT-OSS 120B, Jalapeño xuất ra khoảng 1.459 token mỗi giây, trong khi GB200 của Nvidia chỉ đạt 535. Về độ trễ end-to-end, Jalapeño hoàn thành một tác vụ chỉ trong 1,65 giây, trong khi GB300 mất gần 6 giây—chênh lệch 3,6 lần. Trong các kịch bản tương tác cao, khi GB300 được đẩy lên tốc độ giải mã nhanh nhất (169 token mỗi giây), thông lượng của Jalapeño cao hơn 104,3 lần.

Về token trên mỗi MW mỗi giây—một chỉ số cốt lõi cho hiệu quả năng lượng của trung tâm dữ liệu—Jalapeño đạt khoảng 53 triệu token/MW/s trên mô hình GPT-OSS, trong khi GB200 NVL72 chỉ đạt khoảng 10 triệu.

SemiAnalysis chỉ ra rằng chỉ số này về cơ bản tương đương với số token tạo ra trên mỗi joule, trực tiếp quyết định trần doanh thu của một trung tâm dữ liệu—một lợi thế đặc biệt quan trọng trong thời đại mà sức mạnh tính toán bị giới hạn bởi điện năng.

Từ góc độ chi phí ở cấp hệ thống, sau khi SemiAnalysis tính đến nguồn điện, làm mát và mạng, tổng chi phí sở hữu (TCO) mỗi chip mỗi giờ của Jalapeño là khoảng 1,56 đô la, gần ngang bằng với 1,55 đô la của H100, trong khi Vera Rubin của Nvidia lên tới 3,61 đô la.

Đáng lưu ý là SemiAnalysis cũng nêu ra một số lưu ý quan trọng.

Thứ nhất, các mô hình được sử dụng trong kiểm tra không phải là những mô hình tiên tiến nhất hiện có. Nvidia và AMD đã công bố kết quả dựa trên bộ AgentX trên các mô hình quy mô lớn hơn (như DeepSeek V4 Pro và Kimi K3), trong khi Jalapeño chưa hoàn thành kiểm tra AgentX—một bộ phản ánh tốt hơn hiệu năng trong các kịch bản sản xuất thực tế với khối lượng công việc đa lượt và ngữ cảnh dài.

Thứ hai, một so sánh công bằng hơn sẽ là với Vera Rubin của Nvidia, cũng sử dụng HBM4, thay vì Blackwell. Hiệu năng trên mỗi watt của Vera Rubin cao hơn khoảng 5,4 lần so với GB200 NVL72, và so với Jalapeño, hai chip gần như ngang bằng về tổng chi phí sở hữu (TCO) trên mỗi token.

Thứ ba, Jalapeño vẫn đang ở giai đoạn mẫu kỹ thuật, với sản xuất hàng loạt dự kiến chỉ tăng dần vào năm 2027.

 

Chip do AI thiết kế: Hiệu ứng bánh đà của GPT-Astra và Codex

Lý do cốt lõi khiến Jalapeño được phát triển với tốc độ đáng kinh ngạc như vậy là sự tham gia sâu rộng của các công cụ AI. Theo SemiAnalysis, OpenAI đã sử dụng rộng rãi các mô hình AI nội bộ trong quá trình thiết kế chip, bao gồm cả GPT-Astra được chú ý rộng rãi.

Người dùng mạng xã hội X Andrew Curran, trích dẫn thông tin từ OpenAI, chỉ ra rằng GPT-Astra đã tham gia sâu vào toàn bộ quá trình R&D của Jalapeño:

"Nhóm đã sử dụng Codex và GPT-Astra để tinh chỉnh ba mô hình nguồn mở vốn không nằm trong kế hoạch sản xuất hàng loạt của Jalapeño lên hiệu năng cao trong vòng hai tháng."

Điều này có nghĩa là AI không chỉ tăng tốc quá trình thiết kế chip mà còn nhanh chóng mở rộng phạm vi mô hình mà chip có thể hỗ trợ.

Dữ liệu của SemiAnalysis còn định lượng thêm đóng góp này:

Thiết kế có sự hỗ trợ của AI đã giảm diện tích khối SIMD 8% và diện tích động cơ ma trận 10%, đồng thời vượt trội hơn phiên bản ban đầu về thời gian và mức tiêu thụ điện năng.

Ở cấp độ phần mềm, OpenAI đã sử dụng phiên bản Codex mở rộng nội bộ để viết các kernel của Jalapeño, với một số mã kernel đạt khoảng 3.000 dòng. Trên các cơ chế chú ý và mô-đun MoE quan trọng nhất về hiệu năng, mã do AI tạo ra nhanh hơn 1,5 đến 1,8 lần so với các triển khai của các kỹ sư hàng đầu.

Đánh giá của SemiAnalysis rất sắc bén: Các mô hình OpenAI chạy trên GPU Nvidia (như GPT-5.6 Sol) đang được sử dụng để thiết kế một con chip đe dọa thực sự đến rào cản CUDA—"GPU của chính Nvidia đang nuôi dưỡng kẻ kế nhiệm tiềm năng của họ trong thời gian thực."

 

Phân tích kiến trúc: Tại sao "đa năng" lại nhanh hơn?

Bên ngoài thường cho rằng Jalapeño là một con chip được tùy chỉnh sâu cho các mô hình riêng của OpenAI, nhưng kết luận của SemiAnalysis thì ngược lại: Jalapeño là một con chip đa năng cho suy luận AI, có khả năng chạy nhiều mô hình và khối lượng công việc khác nhau, thậm chí bao gồm cả trò chơi Doom được chuyển đổi bằng Codex.

Ở cấp độ kiến trúc, triết lý thiết kế cốt lõi của Jalapeño là "loại bỏ độ trễ cố định." Không giống như GPU dựa vào hệ thống phân cấp bộ nhớ phức tạp, Jalapeño liên kết trực tiếp các lõi tính toán với các lát HBM, với các lõi được đồng bộ hóa thông qua một mạng tổng hợp băng thông cao chuyên dụng, giảm đáng kể độ trễ truy cập bộ nhớ.

Ngoài ra, Jalapeño sử dụng các lõi thực thi không theo thứ tự (OoO) kết hợp với bộ nhớ đệm L1, thay vì các bộ nhớ tạm do phần mềm quản lý thường thấy ở các bộ tăng tốc khác, cho phép tiến gần đến đỉnh lý thuyết phần cứng trong các kịch bản lô nhỏ, độ trễ thấp.

Về băng thông bộ nhớ, Jalapeño sử dụng HBM4, đạt băng thông bộ nhớ 15,4TB/s trên mỗi gói, với băng thông HBM trên mỗi watt là 22, so với 11,1 của Nvidia Rubin và chỉ 5,71 của GB300.

SemiAnalysis lưu ý rằng tốc độ chân HBM4 của Jalapeño đạt 10Gbps, cao hơn một chút so với 9,6Gbps của Nvidia Rubin, và nhà cung cấp HBM có thể là Samsung.

Đáng nói là Jalapeño đã chọn không triển khai phân tách prefill-decode (PDD). SemiAnalysis đã đưa ra giải thích chi tiết:

Trong môi trường sản xuất thực tế, các tham số như tỷ lệ đầu vào-đầu ra, mức độ đồng thời và tỷ lệ trúng bộ nhớ đệm liên tục thay đổi. Việc gộp cố định dẫn đến hiệu suất sử dụng toàn cục thấp hơn, trong khi một nhóm tài nguyên đồng nhất có thể phản ứng linh hoạt với các thay đổi lưu lượng và phân bổ động giữa các yêu cầu nhạy cảm với độ trễ và xử lý lô thông lượng cao.

 

Rào cản CUDA: Đã xuất hiện vết nứt?

Báo cáo của SemiAnalysis đưa ra một nhận định nặng ký: rào cản CUDA có thể đã chết.

Cơ sở nằm ở sự so sánh tốc độ hoàn thiện phần mềm. Tape-out CoWoS của Nvidia Rubin được hoàn thành sớm hơn một tháng so với Jalapeño, nhưng cho đến nay, dữ liệu chuẩn công khai duy nhất cho Rubin đến từ các mẫu kỹ thuật của CoreWeave. Nvidia chưa mở phòng thí nghiệm của mình cho bên thứ ba kiểm tra miễn phí như OpenAI đã làm. SemiAnalysis tin rằng điều này phản ánh không phải khoảng cách phần cứng mà là khoảng cách về độ trưởng thành phần mềm.

Việc xây dựng một chồng phần mềm từ đầu cho phép OpenAI loại bỏ gánh nặng lịch sử và đưa ra các quyết định kiến trúc sạch sẽ hơn. OpenAI sử dụng ngôn ngữ lập trình kernel độc quyền Gluon (xây dựng trên Triton) và một công cụ suy luận nội bộ gọi là "Teacup", đồng thời tận dụng Codex để nhanh chóng tinh chỉnh kernel. SemiAnalysis quan sát thấy rằng trong chưa đầy hai tuần, thông lượng của Jalapeño ở các tốc độ tương tác cụ thể đã cải thiện hơn 2 lần; trong vòng 8 ngày, nhóm đã mở rộng song song tensor từ TP8 lên TP32, đạt được triển khai toàn bộ giá đỡ trên các giá đỡ.

Tuy nhiên, SemiAnalysis cũng chỉ rõ rằng kiểm tra hiện tại chỉ bao gồm khối lượng công việc 8k1k tương đối đơn giản và chưa hoàn thành kiểm tra AgentX nhiều lượt ngữ cảnh dài. Dưới các khối lượng công việc tác nhân phức tạp hơn, hiệu năng của các thành phần như bộ định tuyến và bộ nhớ đệm tiền tố sẽ trở thành thách thức mới.

 

Các bước tiếp theo: B0 đã vào nhà máy, lộ trình 10GW đang mở ra

Câu chuyện của Jalapeño còn lâu mới kết thúc.

Theo SemiAnalysis, tất cả các mẫu được kiểm tra công khai đều là phiên bản A0, trong khi phiên bản B0 đã vào nhà máy và dự kiến cải thiện hiệu năng trên mỗi watt khoảng 25% so với A0—một khuôn tính toán đơn của B0 sẽ cung cấp 13,4 PFLOPs tính toán MXFP4 với TDP duy trì ở mức 700W.

Ở cấp hệ thống, OpenAI hợp tác với Celestica để thiết kế một giải pháp giá đỡ hoàn chỉnh: mỗi tủ ASIC chứa 128 chip Jalapeño, với tổng công suất tiêu thụ của hệ thống hai tủ khoảng 160kW, tương đương với tủ kép rộng GB300 của Nvidia.

Đối với triển khai quy mô lớn, một miền mạng mở rộng quy mô đơn có thể kết nối tới 2.048 XPU Jalapeño trên 16 giá đỡ. Về sản xuất hàng loạt, SemiAnalysis kỳ vọng sẽ tăng dần vào năm 2027, với cột mốc tiếp theo là quy mô triển khai 100MW.

Bức tranh chiến lược tổng thể là OpenAI và Broadcom đã ký một thỏa thuận hợp tác bộ tăng tốc tùy chỉnh 10GW, quy mô tương đương với sản lượng đầy đủ của mười tổ máy điện hạt nhân.

Bài viết trên Wallstreetcn viết rằng Richard Ho, người đứng đầu bộ phận chip của OpenAI, cho biết công ty đã đạt đến mức điện năng và chi phí có thể giảm hiệu quả chi phí cơ sở hạ tầng, và "đây chỉ là bước đầu tiên." Ông cũng nhấn mạnh rằng Nvidia vẫn là đối tác quan trọng, và nhu cầu về sức mạnh tính toán của OpenAI là rất lớn, vì vậy họ sẽ không từ bỏ các nhà cung cấp hiện tại trong ngắn hạn.

Các nhà phân tích chỉ ra rằng ý nghĩa của Jalapeño có thể không nằm ở việc nó có thể thay thế bao nhiêu chip Nvidia ngày hôm nay, mà ở việc chứng minh một điều trước đây bị nghi ngờ rộng rãi: một công ty AI, sử dụng các công cụ AI, trong thời gian kỷ lục, đã xây dựng một con chip thực sự cạnh tranh. Vòng xoáy này đã bắt đầu quay.

Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.

Đề xuất

Trái phiếu Mỹ mới là 'sát thủ tối thượng' của bong bóng AI? Cảnh báo: Lợi suất 10 năm phá 5% có thể là điểm kích nổZuckerberg từng gọi riêng cho Trump: Đừng lập cơ quan quản lý AIPhỏng vấn mới nhất với Altman: Vì sao OpenAI đột ngột phanh lại? Astra, AI mất kiểm soát và kế hoạch IPOYên đạt đỉnh bảy tháng, Ethereum lên kế hoạch kháng lượng tử L1 vào năm 2029MicroStrategy Biến Bản Sắc Bitcoin Thành Đôi Giày Jordan 250 USD