OpenAI于2026年8月25日发布了其自研推理加速器Jalapeño的首批测试结果。在SemiAnalysis的公开基准测试InferenceX上,搭载新芯片的系统在峰值吞吐量下,每瓦特计算性能达到Nvidia GB200和GB300系统的1.5至1.9倍,并将响应延迟降低了1.7至3.6倍。测试在GPT-OSS-120B、DeepSeek R1和Kimi K2.5等模型上进行。对于每日处理海量ChatGPT、Codex及自有API请求的公司而言,这些指标直接关系到每个响应的成本。
该芯片标称功率为700瓦,但在测试负载下的持续功耗保持在550瓦以下。一个由128个Jalapeño芯片组成的单元号称在4位格式下能提供1.7百亿亿次浮点运算的计算能力。
与Nvidia独立的界限在哪里
Jalapeño是与合作伙伴共同开发的:Broadcom负责芯片实现和网络部分,Celestica负责电路板和机架。从设计开始到将设计交付制造耗时九个月。OpenAI计划在2026年底前将该芯片部署到其基础设施中,而Jalapeño将成为其多年平台战略中第一代产品,后续会有扩展。
Nvidia的通用加速器必须服务于广泛的客户和任务类型。Jalapeño则是为OpenAI自身生成、测量并可以随着软件栈一同调整的具体负载而设计——围绕其自有语言模型、计算核心、数据移动、内存和网络交换。
规模目标设定为10吉瓦
整个计划的基础是OpenAI与Broadcom达成的协议,双方同意部署总计10吉瓦的OpenAI自研加速器。机架安装将于2026年下半年开始,持续到2029年底。在这种规模下,瓦特和毫秒级别的差异不再是实验室特性,而是转变为电力、冷却、内存、网络、机架和数据中心面积上的成本项目。
与此同时,OpenAI并未完全放弃外部供应商:
- 前沿模型的训练仍需要外部加速器;
- Jalapeño的量产依赖于制造、内存、封装和组装合作伙伴;
- 公司将继续广泛使用Nvidia及其他供应商的芯片——既用于训练,也用于部分推理任务。
因此,该项目的边界很明确:OpenAI保留了外部供应链,但将最大日常计算流量的硬件架构控制权掌握在自己手中。
推理的经济学
自研芯片与购买GPU之间的差异超越了能耗范畴。Nvidia在2026财年以2159亿美元的收入和71.1%的毛利率收官,其数据中心业务同比增长68%——这些数据体现在该公司提交给美国证券交易委员会(SEC)的报告中。GPU购买者不仅需要支付设备本身,还需支付供应商附加其上的商业利润。
OpenAI将芯片构建为自身服务的内部组件,即使处理器本身没有单独的市场溢价,也能从降低每个请求处理总成本中获益。公司正试图将过去沉淀在通用加速器供应商那里的部分成本,转化为自身的节省和额外的计算容量。
更便宜、更快的推理使得执行智能体任务的时间更长、服务更多并行请求以及降低产品成本成为可能,而无需数据中心数量成比例增长。服务使用量的增长反过来又提高了自研平台的利用率,使得下一代专用芯片在经济上更具合理性。
Jalapeño改变了OpenAI在AI基础设施链中的地位:该公司此前已控制模型、软件栈和产品,现在则获得了决定响应价格的处理器架构控制权。Nvidia保住了模型训练和通用加速器的市场,但OpenAI最大量的工作部分对其而言不再是保证的销售。
AI观点
从机器学习数据分析的角度看,Jalapeño案例重复了OpenAI之前其他行业领导者已经走过的轨迹。Anthropic早在2025年10月就承诺使用来自Google的一百万个TPU,而Midjourney为了节省成本,已将图像生成迁移到Google Cloud的TPU上。其总体逻辑一致:一旦推理量变得足够可预测和规模化,超大规模服务商就会从通用GPU转向为自身负载定制的芯片。
该战略也有其反面。针对特定模型和软件栈的定制化降低了AI架构变更时的灵活性,而对Broadcom和Celestica的生产依赖为整个九个月的开发周期创造了单一风险点。Jalapeño在两三代模型之后是否仍具竞争力?或者,针对当前推理场景的狭窄优化是否会变成明日的限制?






