Al despertar, las noticias sobre OpenAI están por todas partes.
Primero, el usuario de X, Leo@synthwavedd, afirmó en exclusiva: OpenAI ha completado un nuevo preentrenamiento, con nombre en clave «Bel», cuyo número de parámetros se dice que supera los 10 billones, posible sucesor de Doug, y que podría ser el modelo base de Astra /GPT-6...

Tras una búsqueda, descubro que no hay información precisa. Pero lo que es indiscutible es que el primer chip de inferencia propio de OpenAI ha dado resultados.
Hace un momento, OpenAI anunció los últimos resultados de las pruebas de su primer chip de inferencia propio, Jalapeño: se han logrado avances importantes. Este chip está diseñado específicamente para la inferencia de modelos de lenguaje grande (LLM). A través de un nuevo diseño arquitectónico, puede aumentar simultáneamente el rendimiento y reducir la latencia, logrando ambas cosas manteniendo una alta eficiencia energética. Y en múltiples pruebas de modelos, superó la eficiencia de los sistemas NVIDIA GB200 y GB300.

Inmediatamente después, Sam Altman, CEO de OpenAI, también dijo en X: «Hemos fabricado un chip, y es muy rápido.»

Es importante señalar que, como primer chip de inferencia propio de OpenAI, Jalapeño no es un chip para entrenar la próxima generación de modelos GPT, sino que está optimizado para la fase de ejecución posterior al despliegue del modelo.
En términos simples: la fase de entrenamiento es donde el modelo aprende sus capacidades, mientras que la fase de inferencia es donde el modelo responde rápidamente a las solicitudes de los usuarios. Jalapeño aborda principalmente el segundo problema.
OpenAI señala que los sistemas de hardware tradicionales a menudo tienen que elegir entre dos métricas:
- Mayor rendimiento (throughput): procesar más solicitudes por unidad de tiempo;
- Menor latencia (latency): dar una respuesta más rápida al usuario.
Por ejemplo, el procesamiento por lotes a gran escala puede mejorar la eficiencia general, pero puede aumentar el tiempo de espera de una solicitud individual; mientras que perseguir una latencia extremadamente baja puede sacrificar la utilización de recursos. El objetivo de Jalapeño es optimizar ambos simultáneamente en una sola arquitectura.
En cuanto al rendimiento específico, OpenAI afirma que en múltiples pruebas de inferencia de modelos grandes, Jalapeño supera a los sistemas NVIDIA GB200 y GB300. Los modelos de prueba incluyen: OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T.

Llama especialmente la atención la aparición de DeepSeek R1 y Kimi K2.5, lo que parece indicar que Jalapeño no está optimizado solo para los modelos propios de OpenAI, sino que puede adaptarse a diferentes cargas de trabajo de modelos grandes.
Es interesante que Jalapeño pueda traducirse como «chile jalapeño», y tras la publicación de esta noticia, inmediatamente desató bromas y discusiones entre usuarios de Internet.
«¿Vas a nombrar a tu chip con el nombre de un chile? No puedo esperar para probarlo.»

Para OpenAI, el lanzamiento de Jalapeño demuestra que OpenAI está intentando integrar toda la cadena: «modelo — software — chip — centro de datos».
Vale la pena mencionar además que, para este chip Jalapeño, OpenAI colaboró en el hardware con Cerebras.
Tibo publicó: «Esta capacidad es el resultado de nuestra profunda colaboración con Cerebras y su arquitectura de hardware única. En el futuro, esta colaboración seguirá ampliando los límites de la experiencia «ultrarrápida».
Espero con interés que ambas partes continúen colaborando para superar constantemente los límites en la plataforma Cerebras, explorando cómo ejecutar nuestros modelos más potentes a la máxima velocidad y llevando esta experiencia a los clientes con los requisitos de rendimiento más exigentes.»

En realidad, OpenAI no es la primera empresa de IA que desarrolla su propio chip. Muchas grandes empresas de IA ya se han lanzado a fabricar chips. Por ejemplo, Google presentó TPU; Amazon desarrolló Trainium e Inferentia; Microsoft avanzó con Maia; Meta también está desarrollando su propio acelerador de IA...
La lógica subyacente es muy similar: las GPU genéricas son lo suficientemente flexibles, pero no están optimizadas para todas las cargas de trabajo de IA. Para las empresas que ejecutan una enorme cantidad de solicitudes de IA diariamente, si pueden diseñar chips adaptados a sus propios modelos, sistemas de software y formas de servicio, tienen la oportunidad de reducir aún más los costos...
Veamos ahora las capacidades de Jalapeño en detalle.
Más rápido, más eficiente energéticamente
La ventaja central de Jalapeño es realizar más trabajo de IA con el mismo consumo de energía, devolviendo respuestas más rápidamente. Los sistemas existentes suelen tener que elegir entre rendimiento y latencia, mientras que Jalapeño intenta lograr un mayor rendimiento y una menor latencia simultáneamente con la misma arquitectura.
OpenAI enfatiza que esta ventaja no solo aparece en sus propios modelos, sino que también cubre modelos desarrollados externamente, demostrando que Jalapeño es una arquitectura de inferencia más universal.
En los tres modelos públicos GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, Jalapeño logró entre 1.5 y 1.9 veces más trabajo de IA por vatio en el rendimiento máximo, reduciendo la latencia de extremo a extremo a 1/1.7~1/3.6 de la de los sistemas de comparación; para cargas de trabajo altamente interactivas, la ventaja de rendimiento alcanza entre 2.1 y 4.1 veces.

En GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, el rendimiento máximo por vatio de Jalapeño alcanzó 1.9 veces, 1.7 veces y 1.5 veces, respectivamente, el de los mejores sistemas existentes.
Entre ellos, en el modelo de mayor escala, Kimi K2.5, el rendimiento máximo por vatio de Jalapeño mejoró aproximadamente 1.5 veces, y la latencia de extremo a extremo se redujo aproximadamente 3.4 veces.

En Kimi K2.5 1T, a medida que aumenta la velocidad de decodificación por usuario, la ventaja de rendimiento por vatio de Jalapeño frente a GB300 se amplió desde 1.5 veces en el pico hasta un máximo de 56.1 veces.
OpenAI no solo comparó el rendimiento máximo de un solo chip, sino que se centró más en una métrica: cuánto trabajo útil de IA puede completarse por unidad de electricidad mientras se cumplen los requisitos de latencia de usuarios y agentes interactivos.
La razón también tiene que ver con los agentes. Los agentes a menudo necesitan completar múltiples pasos consecutivos, y una latencia aparentemente pequeña en una solicitud puede acumularse durante toda la ejecución de la tarea.
Este es también el punto donde Jalapeño se destaca más en el rango de baja latencia. Tomando DeepSeek R1 como ejemplo, bajo las condiciones correspondientes al mejor TBT previo del sistema de comparación, el rendimiento por kilovatio de Jalapeño alcanzó 12,258 TPS mixtos/kW, en comparación con 118 del GB300, una diferencia de aproximadamente 104.3 veces.

En DeepSeek R1 670B, el rendimiento máximo por vatio de Jalapeño es aproximadamente 1.7 veces el del GB300; a la misma velocidad de decodificación, la ventaja se amplía hasta un máximo de 104.3 veces.
OpenAI utilizó el punto de referencia público InferenceX de SemiAnalysis para las pruebas y lo comparó con los sistemas comerciales líderes actuales. Desde servicios de alto rendimiento hasta escenarios altamente interactivos y de baja latencia, Jalapeño logró una mejor combinación de rendimiento por vatio y latencia en los tres modelos públicos, situándose en la frontera de Pareto (Pareto frontier).

En diferentes puntos de ejecución de DeepSeek R1 670B, Jalapeño logra una combinación superior entre el rendimiento por vatio y la velocidad de interacción, y la latencia de extremo a extremo, situándose en la frontera de Pareto (Pareto frontier).
El consumo de energía nominal de Jalapeño es de 700W, aunque en las cargas de trabajo probadas en esta ocasión, el consumo de energía sostenido real siempre se mantuvo en 550W o menos.
Nacido para Agent
Jalapeño fue diseñado desde el principio pensando en los modelos de lenguaje grande actuales y futuros, especialmente en los agentes interactivos.
Las diferentes fases de la inferencia de LLM tienen diferentes cuellos de botella: Prefill depende más de la capacidad de cómputo, Decode está más limitado por el ancho de banda de la memoria, y el movimiento de datos entre núcleos y chips también aumenta la latencia.
Por lo tanto, OpenAI diseñó de manera coordinada el chip, la memoria, la red, el software y el sistema a nivel de rack. Los estados del modelo, incluida la caché KV, pueden ubicarse explícitamente y permanecer localmente en la medida de lo posible, permitiendo que Jalapeño se adapte tanto a Prefill como a Decode, y se ajuste a los cambios en la carga de trabajo de ambos.
OpenAI cree que esta es precisamente la característica clave de las cargas de trabajo de Agent.
Es interesante que la IA no solo sea el objeto al que Jalapeño sirve, sino que también haya participado directamente en el desarrollo de este chip.
Con la ayuda de modelos en diferentes etapas, el equipo de OpenAI tardó solo 9 meses desde el diseño inicial hasta la finalización del diseño para la fabricación (Tape-out). Los modelos se utilizaron para explorar diferentes implementaciones, acortar los ciclos de diseño, medición y verificación, y también participaron en la optimización de los circuitos aritméticos del chip.
Jalapeño también fue diseñado como un objetivo de programación claro y predecible tanto para humanos como para modelos. Utilizando Codex impulsado por GPT-Astra, el equipo tardó solo 2 meses en lograr un rendimiento alto en tres modelos de peso abierto que originalmente no estaban en el plan de producción inicial de Jalapeño.
En algunos módulos de Atención y MoE de GPT-OSS, la implementación generada por Codex fue incluso entre 1.5 y 1.8 veces más rápida que la versión original escrita manualmente por expertos humanos.
Despliegue a finales de año, la segunda y tercera generación ya están en camino
OpenAI planea comenzar a implementar Jalapeño en su propia infraestructura informática antes de finales de 2026. Actualmente, el equipo aún está realizando la validación de producción, perfeccionando el software, preparándose para la ejecución a gran escala y continuando validando el rendimiento en más modelos.
Los productos posteriores ya están en marcha; la Gen 2 está en una fase de desarrollo avanzado y la Gen 3 ya está tomando forma.
OpenAI resume el cambio en la eficiencia que aporta Jalapeño en tres niveles: el modo Ultra-fast puede alcanzar la eficiencia que antes solo tenía el modo Fast; el modo Fast puede alcanzar la eficiencia que antes solo tenía el modo Batch; y el propio modo Batch mejora aún más su eficiencia.
Sin embargo, desarrollar chips propios no significa que OpenAI esté preparándose para prescindir de NVIDIA.
OpenAI declara explícitamente que satisfacer la creciente demanda de IA requiere más potencia de cálculo de todas las fuentes disponibles, y que la empresa seguirá desplegando a gran escala aceleradores de NVIDIA y otros socios, cubriendo tanto las cargas de trabajo de entrenamiento como de inferencia.
¿Qué opinas? ¡Te damos la bienvenida a dejar tus comentarios y discutir!
Enlaces de referencia:
https://x.com/OpenAI/status/2092300846675505602
https://x.com/sama/status/2092339694210040187
https://openai.com/index/jalapeno-first-results/
https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/
Este artículo proviene de la cuenta oficial de WeChat «机器之心» (ID:almosthuman2014), autor: 关注AI的机器之心, editor: 山辉、Youli






