OpenAI «voltea la mesa»: su chip de inferencia propio «Jalapeño» supera a Nvidia

marsbitPublicado a 2026-08-25Actualizado a 2026-08-25

Resumen

OpenAI ha anunciado los resultados de su primer chip de inferencia propio, "Jalapeño", diseñado específicamente para la ejecución de modelos de lenguaje grandes. Desarrollado en colaboración con Cerebras, el chip busca optimizar simultáneamente el rendimiento (mayor throughput) y la latencia (respuestas más rápidas), un equilibrio tradicionalmente difícil de alcanzar. Las pruebas comparativas muestran que Jalapeño supera a los sistemas NVIDIA GB200 y GB300 en eficiencia energética y velocidad al ejecutar modelos como OpenAI GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, demostrando su adaptabilidad a distintas cargas de trabajo. Su ventaja es particularmente notable en escenarios de baja latencia y alta interacción, cruciales para agentes de IA. La arquitectura del chip integra de forma optimizada memoria, red y software, manteniendo localmente datos clave como la caché KV. El desarrollo contó con asistencia de IA, lo que aceleró significativamente el proceso. OpenAI planea desplegar Jalapeño en sus infraestructuras a finales de 2026, y ya está trabajando en las siguientes generaciones Gen 2 y Gen 3. La compañía aclara que continuará usando aceleradores de NVIDIA y otros socios para satisfacer la creciente demanda de cómputo.

Al despertar, las noticias sobre OpenAI están por todas partes.

Primero, el usuario de X, Leo@synthwavedd, afirmó en exclusiva: OpenAI ha completado un nuevo preentrenamiento, con nombre en clave «Bel», cuyo número de parámetros se dice que supera los 10 billones, posible sucesor de Doug, y que podría ser el modelo base de Astra /GPT-6...

Tras una búsqueda, descubro que no hay información precisa. Pero lo que es indiscutible es que el primer chip de inferencia propio de OpenAI ha dado resultados.

Hace un momento, OpenAI anunció los últimos resultados de las pruebas de su primer chip de inferencia propio, Jalapeño: se han logrado avances importantes. Este chip está diseñado específicamente para la inferencia de modelos de lenguaje grande (LLM). A través de un nuevo diseño arquitectónico, puede aumentar simultáneamente el rendimiento y reducir la latencia, logrando ambas cosas manteniendo una alta eficiencia energética. Y en múltiples pruebas de modelos, superó la eficiencia de los sistemas NVIDIA GB200 y GB300.

Inmediatamente después, Sam Altman, CEO de OpenAI, también dijo en X: «Hemos fabricado un chip, y es muy rápido.»

Es importante señalar que, como primer chip de inferencia propio de OpenAI, Jalapeño no es un chip para entrenar la próxima generación de modelos GPT, sino que está optimizado para la fase de ejecución posterior al despliegue del modelo.

En términos simples: la fase de entrenamiento es donde el modelo aprende sus capacidades, mientras que la fase de inferencia es donde el modelo responde rápidamente a las solicitudes de los usuarios. Jalapeño aborda principalmente el segundo problema.

OpenAI señala que los sistemas de hardware tradicionales a menudo tienen que elegir entre dos métricas:

  • Mayor rendimiento (throughput): procesar más solicitudes por unidad de tiempo;
  • Menor latencia (latency): dar una respuesta más rápida al usuario.

Por ejemplo, el procesamiento por lotes a gran escala puede mejorar la eficiencia general, pero puede aumentar el tiempo de espera de una solicitud individual; mientras que perseguir una latencia extremadamente baja puede sacrificar la utilización de recursos. El objetivo de Jalapeño es optimizar ambos simultáneamente en una sola arquitectura.

En cuanto al rendimiento específico, OpenAI afirma que en múltiples pruebas de inferencia de modelos grandes, Jalapeño supera a los sistemas NVIDIA GB200 y GB300. Los modelos de prueba incluyen: OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T.

Llama especialmente la atención la aparición de DeepSeek R1 y Kimi K2.5, lo que parece indicar que Jalapeño no está optimizado solo para los modelos propios de OpenAI, sino que puede adaptarse a diferentes cargas de trabajo de modelos grandes.

Es interesante que Jalapeño pueda traducirse como «chile jalapeño», y tras la publicación de esta noticia, inmediatamente desató bromas y discusiones entre usuarios de Internet.

«¿Vas a nombrar a tu chip con el nombre de un chile? No puedo esperar para probarlo.»

Para OpenAI, el lanzamiento de Jalapeño demuestra que OpenAI está intentando integrar toda la cadena: «modelo — software — chip — centro de datos».

Vale la pena mencionar además que, para este chip Jalapeño, OpenAI colaboró en el hardware con Cerebras.

Tibo publicó: «Esta capacidad es el resultado de nuestra profunda colaboración con Cerebras y su arquitectura de hardware única. En el futuro, esta colaboración seguirá ampliando los límites de la experiencia «ultrarrápida».

Espero con interés que ambas partes continúen colaborando para superar constantemente los límites en la plataforma Cerebras, explorando cómo ejecutar nuestros modelos más potentes a la máxima velocidad y llevando esta experiencia a los clientes con los requisitos de rendimiento más exigentes.»

En realidad, OpenAI no es la primera empresa de IA que desarrolla su propio chip. Muchas grandes empresas de IA ya se han lanzado a fabricar chips. Por ejemplo, Google presentó TPU; Amazon desarrolló Trainium e Inferentia; Microsoft avanzó con Maia; Meta también está desarrollando su propio acelerador de IA...

La lógica subyacente es muy similar: las GPU genéricas son lo suficientemente flexibles, pero no están optimizadas para todas las cargas de trabajo de IA. Para las empresas que ejecutan una enorme cantidad de solicitudes de IA diariamente, si pueden diseñar chips adaptados a sus propios modelos, sistemas de software y formas de servicio, tienen la oportunidad de reducir aún más los costos...

Veamos ahora las capacidades de Jalapeño en detalle.

Más rápido, más eficiente energéticamente

La ventaja central de Jalapeño es realizar más trabajo de IA con el mismo consumo de energía, devolviendo respuestas más rápidamente. Los sistemas existentes suelen tener que elegir entre rendimiento y latencia, mientras que Jalapeño intenta lograr un mayor rendimiento y una menor latencia simultáneamente con la misma arquitectura.

OpenAI enfatiza que esta ventaja no solo aparece en sus propios modelos, sino que también cubre modelos desarrollados externamente, demostrando que Jalapeño es una arquitectura de inferencia más universal.

En los tres modelos públicos GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, Jalapeño logró entre 1.5 y 1.9 veces más trabajo de IA por vatio en el rendimiento máximo, reduciendo la latencia de extremo a extremo a 1/1.7~1/3.6 de la de los sistemas de comparación; para cargas de trabajo altamente interactivas, la ventaja de rendimiento alcanza entre 2.1 y 4.1 veces.

En GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, el rendimiento máximo por vatio de Jalapeño alcanzó 1.9 veces, 1.7 veces y 1.5 veces, respectivamente, el de los mejores sistemas existentes.

Entre ellos, en el modelo de mayor escala, Kimi K2.5, el rendimiento máximo por vatio de Jalapeño mejoró aproximadamente 1.5 veces, y la latencia de extremo a extremo se redujo aproximadamente 3.4 veces.

En Kimi K2.5 1T, a medida que aumenta la velocidad de decodificación por usuario, la ventaja de rendimiento por vatio de Jalapeño frente a GB300 se amplió desde 1.5 veces en el pico hasta un máximo de 56.1 veces.

OpenAI no solo comparó el rendimiento máximo de un solo chip, sino que se centró más en una métrica: cuánto trabajo útil de IA puede completarse por unidad de electricidad mientras se cumplen los requisitos de latencia de usuarios y agentes interactivos.

La razón también tiene que ver con los agentes. Los agentes a menudo necesitan completar múltiples pasos consecutivos, y una latencia aparentemente pequeña en una solicitud puede acumularse durante toda la ejecución de la tarea.

Este es también el punto donde Jalapeño se destaca más en el rango de baja latencia. Tomando DeepSeek R1 como ejemplo, bajo las condiciones correspondientes al mejor TBT previo del sistema de comparación, el rendimiento por kilovatio de Jalapeño alcanzó 12,258 TPS mixtos/kW, en comparación con 118 del GB300, una diferencia de aproximadamente 104.3 veces.

En DeepSeek R1 670B, el rendimiento máximo por vatio de Jalapeño es aproximadamente 1.7 veces el del GB300; a la misma velocidad de decodificación, la ventaja se amplía hasta un máximo de 104.3 veces.

OpenAI utilizó el punto de referencia público InferenceX de SemiAnalysis para las pruebas y lo comparó con los sistemas comerciales líderes actuales. Desde servicios de alto rendimiento hasta escenarios altamente interactivos y de baja latencia, Jalapeño logró una mejor combinación de rendimiento por vatio y latencia en los tres modelos públicos, situándose en la frontera de Pareto (Pareto frontier).

En diferentes puntos de ejecución de DeepSeek R1 670B, Jalapeño logra una combinación superior entre el rendimiento por vatio y la velocidad de interacción, y la latencia de extremo a extremo, situándose en la frontera de Pareto (Pareto frontier).

El consumo de energía nominal de Jalapeño es de 700W, aunque en las cargas de trabajo probadas en esta ocasión, el consumo de energía sostenido real siempre se mantuvo en 550W o menos.

Nacido para Agent

Jalapeño fue diseñado desde el principio pensando en los modelos de lenguaje grande actuales y futuros, especialmente en los agentes interactivos.

Las diferentes fases de la inferencia de LLM tienen diferentes cuellos de botella: Prefill depende más de la capacidad de cómputo, Decode está más limitado por el ancho de banda de la memoria, y el movimiento de datos entre núcleos y chips también aumenta la latencia.

Por lo tanto, OpenAI diseñó de manera coordinada el chip, la memoria, la red, el software y el sistema a nivel de rack. Los estados del modelo, incluida la caché KV, pueden ubicarse explícitamente y permanecer localmente en la medida de lo posible, permitiendo que Jalapeño se adapte tanto a Prefill como a Decode, y se ajuste a los cambios en la carga de trabajo de ambos.

OpenAI cree que esta es precisamente la característica clave de las cargas de trabajo de Agent.

Es interesante que la IA no solo sea el objeto al que Jalapeño sirve, sino que también haya participado directamente en el desarrollo de este chip.

Con la ayuda de modelos en diferentes etapas, el equipo de OpenAI tardó solo 9 meses desde el diseño inicial hasta la finalización del diseño para la fabricación (Tape-out). Los modelos se utilizaron para explorar diferentes implementaciones, acortar los ciclos de diseño, medición y verificación, y también participaron en la optimización de los circuitos aritméticos del chip.

Jalapeño también fue diseñado como un objetivo de programación claro y predecible tanto para humanos como para modelos. Utilizando Codex impulsado por GPT-Astra, el equipo tardó solo 2 meses en lograr un rendimiento alto en tres modelos de peso abierto que originalmente no estaban en el plan de producción inicial de Jalapeño.

En algunos módulos de Atención y MoE de GPT-OSS, la implementación generada por Codex fue incluso entre 1.5 y 1.8 veces más rápida que la versión original escrita manualmente por expertos humanos.

Despliegue a finales de año, la segunda y tercera generación ya están en camino

OpenAI planea comenzar a implementar Jalapeño en su propia infraestructura informática antes de finales de 2026. Actualmente, el equipo aún está realizando la validación de producción, perfeccionando el software, preparándose para la ejecución a gran escala y continuando validando el rendimiento en más modelos.

Los productos posteriores ya están en marcha; la Gen 2 está en una fase de desarrollo avanzado y la Gen 3 ya está tomando forma.

OpenAI resume el cambio en la eficiencia que aporta Jalapeño en tres niveles: el modo Ultra-fast puede alcanzar la eficiencia que antes solo tenía el modo Fast; el modo Fast puede alcanzar la eficiencia que antes solo tenía el modo Batch; y el propio modo Batch mejora aún más su eficiencia.

Sin embargo, desarrollar chips propios no significa que OpenAI esté preparándose para prescindir de NVIDIA.

OpenAI declara explícitamente que satisfacer la creciente demanda de IA requiere más potencia de cálculo de todas las fuentes disponibles, y que la empresa seguirá desplegando a gran escala aceleradores de NVIDIA y otros socios, cubriendo tanto las cargas de trabajo de entrenamiento como de inferencia.

¿Qué opinas? ¡Te damos la bienvenida a dejar tus comentarios y discutir!

Enlaces de referencia:

https://x.com/OpenAI/status/2092300846675505602

https://x.com/sama/status/2092339694210040187

https://openai.com/index/jalapeno-first-results/

https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/

Este artículo proviene de la cuenta oficial de WeChat «机器之心» (ID:almosthuman2014), autor: 关注AI的机器之心, editor: 山辉、Youli

Criptos en tendencia

Preguntas relacionadas

Q¿Qué es el chip Jalapeño de OpenAI y para qué está diseñado específicamente?

AEl chip Jalapeño es el primer chip de inferencia de OpenAI diseñado específicamente para la ejecución de modelos de lenguaje grandes (LLM) en la fase de inferencia, optimizando la velocidad de respuesta a las solicitudes de los usuarios después de que el modelo ha sido entrenado.

Q¿En qué métricas de rendimiento supera el chip Jalapeño a los sistemas NVIDIA GB200 y GB300?

AEl chip Jalapeño supera a los sistemas NVIDIA GB200 y GB300 en rendimiento por vatio, ofreciendo de 1.5 a 1.9 veces más trabajo de IA por vatio en modelos como GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, y reduce la latencia de extremo a extremo entre 1.7 y 3.6 veces.

Q¿Por qué es especialmente importante el bajo rendimiento del Jalapeño para las cargas de trabajo de los agentes de IA?

AEs crucial para los agentes de IA porque las tareas de los agentes suelen involucrar múltiples pasos secuenciales. Incluso una pequeña latencia en cada paso se acumula, afectando significativamente el tiempo total de respuesta. El Jalapeño está diseñado para optimizar tanto el rendimiento como la latencia, lo que acelera las interacciones de los agentes.

Q¿Cuándo planea OpenAI comenzar a implementar el chip Jalapeño y qué hay de sus generaciones futuras?

AOpenAI planea comenzar a implementar el chip Jalapeño en su infraestructura de computación a finales de 2026. Además, ya están en desarrollo las versiones de segunda (Gen 2) y tercera generación (Gen 3) del chip.

Q¿Significa el desarrollo del chip Jalapeño que OpenAI dejará de utilizar aceleradores de NVIDIA?

ANo. OpenAI ha dejado claro que continuará implementando a gran escala aceleradores de NVIDIA y otros socios para cubrir tanto las cargas de trabajo de entrenamiento como de inferencia, ya que satisfacer la creciente demanda de IA requiere más potencia de cómputo de todas las fuentes disponibles.

Lecturas Relacionadas

¿Cuáles son los puntos destacados del evento de otoño de Apple? Se espera el debut del chip de 2nm en dispositivos móviles y el iPhone plegable

Apple prepara importantes novedades para su evento de otoño de 2026, centrado en IA y nuevos dispositivos. Destaca el lanzamiento anticipado del nuevo Mac mini con chips M6 y M5 Pro, ofreciendo grandes mejoras en rendimiento de IA. Se espera que el evento principal tenga lugar el 9 de septiembre. Los productos estrella serían la serie iPhone 18 Pro, con el nuevo chip A20 Pro de 2nm y modem C2 propio, y el primer iPhone plegable, posiblemente llamado iPhone Ultra. Este modelo buscaría fusionar las experiencias de teléfono y tableta, aunque podría presentar compromisos como la falta de lente teleobjetivo y el uso de Touch ID en lugar de Face ID. Su precio se estima alto y su disponibilidad inicial podría ser limitada. Apple estaría redefiniendo su estrategia de iPhone, lanzando primero los modelos premium y posponiendo las versiones estándar. También se renovarían otros productos como el Apple Watch Series 12, AirPods 5 y más adelante, iPad mini con pantalla OLED. Tras bastidores, Apple impulsa su infraestructura de IA, ensamblando servidores en Texas y desarrollando una cadena de suministro de semiconductores en EE.UU., con fábricas de TSMC en Arizona. Este enfoque en chips, servidores y fabricación local será clave bajo el nuevo CEO, John Ternus, quien sucederá a Tim Cook el 1 de septiembre, para consolidar la ventaja competitiva de Apple en la era de la IA.

marsbitHace 17 min(s)

¿Cuáles son los puntos destacados del evento de otoño de Apple? Se espera el debut del chip de 2nm en dispositivos móviles y el iPhone plegable

marsbitHace 17 min(s)

El director general de World Liberty, Witkoff, señala los volúmenes de venta como prueba de la demanda orgánica

El director general de World Liberty, Zach Witkoff, ha destacado las cifras de volumen de operaciones del stablecoin $USD1 como prueba de la demanda orgánica del mercado. En respuesta a las críticas que ven al activo como un instrumento para comprar influencia sobre la familia del presidente, Witkoff señaló un volumen de 24 horas de 1.420 millones de dólares y una capitalización de mercado de unos 4.030 millones. La reciente aprobación condicional de una licencia bancaria nacional para World Liberty Trust Co. por parte de la OCC ha intensificado el debate, permitiendo a la empresa emitir y canjear $USD1 directamente. Críticos como el profesor James Angel argumentan que la tenencia de $USD1 se debe principalmente a su proximidad a la Casa Blanca, citando la gran diferencia de escala con stablecoins líderes como Tether y USDC. Políticos, incluida la senadora Elizabeth Warren, han condenado la decisión de la OCC y han solicitado a la SEC que investigue posibles influencias. La disputa tiene una dimensión financiera significativa, ya que una empresa vinculada a la familia Trump posee una parte importante de la holding controladora, y el propio Trump declaró ingresos de unos 600 millones de dólares por ventas de tokens y acciones. World Liberty niega cualquier conflicto de intereses, afirmando que cumple con la regulación.

cryptonews.ruHace 3 hora(s)

El director general de World Liberty, Witkoff, señala los volúmenes de venta como prueba de la demanda orgánica

cryptonews.ruHace 3 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar CHIP

¡Bienvenido a HTX.com! Hemos hecho que comprar USD.AI (CHIP) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar USD.AI (CHIP) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu USD.AI (CHIP)Después de comprar tu USD.AI (CHIP), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear USD.AI (CHIP)Tradear fácilmente con USD.AI (CHIP) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

1.5k Vistas totalesPublicado en 2026.04.21Actualizado en 2026.06.02

Cómo comprar CHIP

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de CHIP (CHIP).

活动图片