OpenAI 于 2026 年 8 月 25 日公布了其自家推理加速器 Jalapeño 的首批测试结果。在 SemiAnalysis 的公共基准测试 InferenceX 中,搭载新芯片的系统在峰值吞吐量下,每瓦特性能表现是搭载 Nvidia GB200 和 GB300 系统的 1.5–1.9 倍,并将响应延迟降低了 1.7–3.6 倍。测试基于 GPT-OSS-120B、DeepSeek R1 和 Kimi K2.5 模型进行。对于每天服务海量 ChatGPT、Codex 及其自有 API 请求的 OpenAI 而言,这些指标与每个回答的成本直接相关。
该芯片额定功率为 700 瓦,但在测试负载下的稳定功耗保持在 550 瓦以内。一个由 128 颗 Jalapeño 组成的集群宣称能提供 1.7 exaflops(百亿亿次浮点运算)的 4 比特格式计算性能。
何时终结对 Nvidia 的依赖
Jalapeño 是与合作伙伴共同开发的:Broadcom 负责芯片实现和网络部分,Celestica 负责电路板和机架。从设计开始到流片共耗时九个月。OpenAI 计划在 2026 年底前将这款芯片部署到其基础设施中,而 Jalapeño 将成为其多年平台战略中的第一代产品,后续将进行扩展。
Nvidia 的通用加速器需要服务广泛的客户和任务类型。而 Jalapeño 则是针对 OpenAI 自身产生、测量并可与软件栈一同调整的特定负载量身定制——围绕着自家语言模型、计算核心、数据移动、内存和网络交换进行优化。
规模目标设定为 10 GW
整个项目的基石是 OpenAI 与 Broadcom 达成的一项协议,双方同意部署总计 10 吉瓦(GW)的 OpenAI 自研加速器。机架部署将于 2026 年下半年开始,并持续到 2029 年底。在这种规模下,几瓦特和几毫秒的差异就不再是实验室参数,而是转化为电力、冷却、内存、网络、机架和数据中心占地空间等实实在在的成本项目。
与此同时,OpenAI 并未完全放弃外部供应商:
- 前沿模型的训练仍需依赖外部加速器;
- Jalapeño 的量产依赖于制造、内存、封装和组装合作伙伴;
- 公司将继续广泛使用 Nvidia 和其他供应商的芯片,用于训练以及部分推理任务。
因此,该项目的边界非常清晰:OpenAI 保留外部供应链,但将最大日常计算流量的硬件架构设计权掌握在自己手中。
推理的经济学
自研芯片与购买 GPU 之间的差异超越了能耗范畴。Nvidia 在 2026 财年实现了 2159 亿美元营收和 71.1% 的毛利率,其数据中心部门同比增长 68%——这些数据反映在公司提交给美国证券交易委员会(SEC)的报告中。GPU 的购买者不仅支付设备本身的费用,还要承担供应商附加在设备之上的商业利润。
OpenAI 将芯片构建为自身服务的内部组件,即使处理器本身没有单独的市场溢价,也能从降低每个请求处理的综合成本中获益。公司正试图将原本流向通用加速器供应商的部分成本,转化为自身的节省和额外的计算能力。
更廉价、更快速的推理使得执行智能体任务的时间更长、服务更多并行请求以及降低产品成本而无需数据中心数量成比例增长成为可能。服务使用量的增长反过来又提高了自研平台的利用率,使得下一代专用芯片在经济上更具合理性。
Jalapeño 改变了 OpenAI 在人工智能基础设施链中的位置:公司此前已控制模型、软件栈和产品,现在则获得了决定回答成本的处理器架构控制权。Nvidia 仍然保有模型训练和通用加速器市场,但对 OpenAI 而言,最大规模的日常工作负载部分已不再是 Nvidia 的必然销售保障。
AI 观点
从机器学习数据分析的角度看,Jalapeño 案例重演了 OpenAI 之前其他行业领导者已经走过的轨迹。Anthropic 早在 2025 年 10 月就获得了来自 Google 的一百万个 TPU 承诺,而 Midjourney 为了节省成本,已将图像生成迁移到 Google Cloud 的 TPU 上。总的逻辑是一致的:一旦推理工作量变得足够可预测和规模化,超大规模提供商就会从通用 GPU 转向为自身负载定制的芯片。
然而,这种策略也存在弊端。针对特定模型和软件栈的优化会降低切换 AI 架构时的灵活性,而在生产上依赖 Broadcom 和 Celestica 则在整个九个月的开发周期中引入了单一风险点。Jalapeño 在两三代模型更新后是否还能保持竞争力?或者说,针对当前推理的狭窄优化是否会变成未来的限制?








