¿El chip ASIC personalizado de OpenAI supera a Nvidia Blackwell en solo 9 meses?
Autor original: Dong Jing
Fuente original: Wallstreetcn
El primer chip desarrollado por OpenAI, Jalapeño, ha irrumpido en escena, alterando el panorama actual de la industria de chips de IA a un ritmo vertiginoso: no es solo el lanzamiento de un producto, sino una señal de que la IA está transformando la forma en que se diseñan los chips.
Según un artículo de Wallstreetcn, Bloomberg informó el 25 de agosto que OpenAI afirmó que Jalapeño supera al GB300 de Nvidia en dos métricas clave: carga de trabajo de IA procesada por unidad de potencia y velocidad de respuesta. El chip, desarrollado en colaboración con Broadcom, está diseñado específicamente para la etapa de inferencia de IA y se espera que entre en uso práctico a finales de este año. Richard Ho, director de la división de chips de OpenAI, afirmó que Jalapeño ofrece un rendimiento sólido con un bajo consumo de 700 vatios, lo que ayuda a reducir significativamente los costes de electricidad de los centros de datos.

Según la firma de investigación de semiconductores SemiAnalysis, el chip tardó solo unos 16 meses desde el inicio del diseño hasta el tape-out, y el nodo crítico de tape-out de empaquetado CoWoS se completó en noviembre de 2025, hace solo 9 meses, mucho menos que el ciclo típico de la industria de 18 a 36 meses.

Los investigadores de SemiAnalysis visitaron personalmente el laboratorio de OpenAI y probaron Jalapeño con su suite de benchmarks propietaria InferenceX. La conclusión fue directa: el chip superó a todos los chips de Nvidia, AMD y Google que habían probado anteriormente en rendimiento por vatio (perf/W).
Aún más notable es que este resultado se logró sin que Jalapeño habilitara la decodificación especulativa ni la desagregación de prefill-decode (PDD), mientras que los otros chips comparados funcionaban con sus configuraciones óptimas.
No es de extrañar que el renombrado analista de semiconductores Dylan Patel afirmara sin rodeos: "No solo Blackwell ha sido derrocado, ¡incluso el chip Rubin de Nvidia ha sido superado"!

Los analistas creen que este resultado supone un desafío directo a la posición de mercado de Nvidia y obliga al mercado a reevaluar el panorama competitivo de los chips de IA.
Datos de referencia: Jalapeño aplasta a Blackwell en múltiples métricas clave
Los resultados de las pruebas de SemiAnalysis muestran que la ventaja de Jalapeño en eficiencia de inferencia es bastante significativa.
En el modelo GPT-OSS 120B, Jalapeño genera aproximadamente 1.459 tokens por segundo, mientras que el GB200 de Nvidia solo alcanza 535. En términos de latencia de extremo a extremo, Jalapeño completa una tarea en solo 1,65 segundos, mientras que el GB300 tarda casi 6 segundos, una diferencia de 3,6 veces. En escenarios de alta interactividad, cuando el GB300 se lleva a su velocidad de decodificación más rápida (169 tokens por segundo), el rendimiento de Jalapeño es 104,3 veces mayor.

En tokens por megavatio por segundo, una métrica central para la eficiencia energética de los centros de datos, Jalapeño alcanza aproximadamente 53 millones de tokens/MW/s en el modelo GPT-OSS, mientras que el GB200 NVL72 solo llega a unos 10 millones.

SemiAnalysis señala que esta métrica equivale esencialmente a tokens producidos por julio, lo que determina directamente el techo de ingresos de un centro de datos, una ventaja especialmente crítica en una era en la que la potencia de cálculo está limitada por la electricidad.
Desde una perspectiva de costes a nivel de sistema, después de que SemiAnalysis tuviera en cuenta la alimentación, la refrigeración y las redes, el coste total de propiedad (TCO) por chip y hora de Jalapeño es de aproximadamente 1,56 dólares, casi a la par con los 1,55 dólares del H100, mientras que el Vera Rubin de Nvidia alcanza los 3,61 dólares.

Cabe señalar que SemiAnalysis también planteó varias advertencias importantes.
En primer lugar, los modelos utilizados en las pruebas no son los más avanzados disponibles actualmente. Nvidia y AMD han publicado resultados basados en la suite AgentX en modelos a mayor escala (como DeepSeek V4 Pro y Kimi K3), mientras que Jalapeño aún no ha completado las pruebas de AgentX, una suite que refleja mejor el rendimiento en escenarios de producción reales con cargas de trabajo de múltiples turnos y contexto largo.
En segundo lugar, una comparación más justa sería con el Vera Rubin de Nvidia, que también utiliza HBM4, en lugar de Blackwell. El rendimiento por vatio de Vera Rubin es aproximadamente 5,4 veces el del GB200 NVL72, y en comparación con Jalapeño, ambos son casi iguales en coste total de propiedad (TCO) por token.
En tercer lugar, Jalapeño todavía se encuentra en la fase de muestra de ingeniería, y se espera que la producción en masa aumente gradualmente solo para 2027.
Chips diseñados por IA: el efecto volante de GPT-Astra y Codex
La razón principal por la que Jalapeño se desarrolló a una velocidad tan asombrosa es la profunda participación de herramientas de IA. Según SemiAnalysis, OpenAI utilizó ampliamente modelos de IA internos en el proceso de diseño del chip, incluido el muy observado GPT-Astra.
El usuario de la plataforma social X Andrew Curran, citando información de OpenAI, señaló que GPT-Astra participó profundamente en toda la I+D de Jalapeño:
"El equipo utilizó Codex y GPT-Astra para ajustar tres modelos de código abierto que originalmente no estaban en el plan de producción en masa de Jalapeño a un alto rendimiento en dos meses".

Esto significa que la IA no solo está acelerando el diseño de chips en sí, sino que también está ampliando rápidamente la gama de modelos que el chip puede soportar.
Los datos de SemiAnalysis cuantifican aún más esta contribución:
El diseño asistido por IA redujo el área de la unidad SIMD en un 8% y el área del motor matricial en un 10%, al tiempo que superó a la versión inicial en temporización y consumo de energía.

A nivel de software, OpenAI utilizó una versión ampliada internamente de Codex para escribir los kernels de Jalapeño, con algunos códigos de kernel que alcanzan unas 3.000 líneas. En los mecanismos de atención y módulos MoE más críticos para el rendimiento, el código generado por IA fue entre 1,5 y 1,8 veces más rápido que las implementaciones de los mejores ingenieros humanos.
La evaluación de SemiAnalysis es contundente: los modelos de OpenAI que se ejecutan en GPU de Nvidia (como GPT-5.6 Sol) se están utilizando para diseñar un chip que representa una amenaza real para el foso de CUDA: "las propias GPU de Nvidia están criando a su potencial sucesor en tiempo real".

Análisis de arquitectura: ¿Por qué lo "de propósito general" es más rápido?
El mundo exterior asumía en general que Jalapeño es un chip profundamente personalizado para los propios modelos de OpenAI, pero la conclusión de SemiAnalysis es la contraria: Jalapeño es un chip de propósito general para inferencia de IA, capaz de ejecutar varios modelos y cargas de trabajo, incluido incluso el juego Doom portado con Codex.
A nivel arquitectónico, la filosofía de diseño central de Jalapeño es "eliminar la latencia fija". A diferencia de las GPU que dependen de jerarquías de memoria complejas, Jalapeño vincula directamente los núcleos de cálculo a porciones de HBM, con los núcleos sincronizados a través de una red de agregación de alto ancho de banda dedicada, lo que reduce significativamente la latencia de acceso a memoria.
Además, Jalapeño utiliza núcleos de ejecución fuera de orden (OoO) emparejados con caché L1, en lugar de los scratchpads gestionados por software comúnmente utilizados en otros aceleradores, lo que le permite acercarse a los picos teóricos de hardware en escenarios de lotes pequeños y baja latencia.
En términos de ancho de banda de memoria, Jalapeño utiliza HBM4, logrando 15,4 TB/s de ancho de banda de memoria por paquete, con un ancho de banda HBM por vatio de 22, en comparación con 11,1 del Rubin de Nvidia y solo 5,71 del GB300.

SemiAnalysis señala que la velocidad de pin de HBM4 de Jalapeño alcanza los 10 Gbps, ligeramente superior a los 9,6 Gbps del Rubin de Nvidia, y el proveedor de HBM puede ser Samsung.
Cabe mencionar que Jalapeño optó por no implementar la desagregación de prefill-decode (PDD). SemiAnalysis proporcionó una explicación detallada:
En entornos de producción reales, parámetros como la relación entrada-salida, la concurrencia y la tasa de aciertos de caché cambian continuamente. La agrupación fija conduce a una menor utilización global, mientras que un grupo de recursos homogéneo puede responder con flexibilidad a los cambios de tráfico y asignar dinámicamente entre solicitudes sensibles a la latencia y procesamiento por lotes de alto rendimiento.
Foso de CUDA: ¿Ya se ven grietas?
El informe de SemiAnalysis emite un juicio de peso: el foso de CUDA puede estar ya muerto.
La base reside en la comparación de la velocidad de puesta a punto del software. El tape-out de CoWoS del Rubin de Nvidia se completó un mes antes que el de Jalapeño, pero hasta ahora, los únicos datos de referencia públicos del Rubin provienen de las muestras de ingeniería de CoreWeave. Nvidia no ha abierto sus laboratorios a terceros para pruebas gratuitas como ha hecho OpenAI. SemiAnalysis cree que esto refleja no una brecha de hardware, sino una brecha de madurez de software.
Construir una pila de software desde cero permitió a OpenAI deshacerse del bagaje histórico y tomar decisiones arquitectónicas más limpias. OpenAI utiliza su lenguaje de programación de kernels propietario Gluon (basado en Triton) y un motor de inferencia interno llamado "Teacup", y aprovecha Codex para ajustar rápidamente los kernels. SemiAnalysis observó que en menos de dos semanas, el rendimiento de Jalapeño a velocidades de interacción específicas mejoró más del doble; en 8 días, el equipo escaló el paralelismo de tensores de TP8 a TP32, logrando un despliegue de rack completo en todos los racks.
Sin embargo, SemiAnalysis también señala claramente que las pruebas actuales solo cubren la carga de trabajo relativamente simple 8k1k y aún no han completado las pruebas de AgentX de múltiples turnos y contexto largo. Bajo cargas de trabajo de agentes más complejas, el rendimiento de componentes como enrutadores y cachés de prefijos se convertirá en nuevos desafíos.
Próximos pasos: B0 ya en fábrica, hoja de ruta de 10 GW en desarrollo
La historia de Jalapeño está lejos de terminar.
Según SemiAnalysis, todas las muestras probadas públicamente son de stepping A0, mientras que el stepping B0 ya ha entrado en la fábrica y se espera que mejore el rendimiento por vatio en aproximadamente un 25% sobre el A0: el dado de cálculo único de B0 ofrecerá 13,4 PFLOPs de cálculo MXFP4 con un TDP mantenido en 700 W.
A nivel de sistema, OpenAI colaboró con Celestica para diseñar una solución de rack completa: cada gabinete ASIC contiene 128 chips Jalapeño, con un consumo total de energía del sistema de doble gabinete de aproximadamente 160 kW, comparable al gabinete de doble ancho GB300 de Nvidia.

Para el despliegue a gran escala, un solo dominio de red de escalado horizontal puede conectar hasta 2.048 XPUs Jalapeño en 16 racks. En cuanto a la producción en masa, SemiAnalysis espera un aumento gradual en 2027, con el siguiente hito en una escala de despliegue de 100 MW.
El panorama estratégico más amplio es que OpenAI y Broadcom han firmado un acuerdo de cooperación de aceleradores personalizados de 10 GW, una escala aproximadamente equivalente a la producción total de diez unidades de energía nuclear.
El artículo de Wallstreetcn escribe que Richard Ho, director de la división de chips de OpenAI, dijo que la empresa ha alcanzado un nivel de potencia y coste que puede reducir eficazmente los costes de infraestructura, y "esto es solo el primer paso". También enfatizó que Nvidia sigue siendo un socio importante, y que la demanda de potencia de cálculo de OpenAI es enorme, por lo que no abandonará a los proveedores existentes a corto plazo.
Los analistas señalan que la importancia de Jalapeño puede no residir en cuántos chips de Nvidia puede reemplazar hoy, sino en demostrar algo que antes se dudaba ampliamente: una empresa de IA, utilizando herramientas de IA, en un tiempo récord, construyó un chip verdaderamente competitivo. Este volante ha comenzado a girar.
Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.