OpenAI展示了自家Jalapeño芯片:加速器效率高出Nvidia 1.5至2倍
2026年8月25日,OpenAI公布了其自研推理加速芯片Jalapeño的首批测试结果。在SemiAnalysis的公开基准测试InferenceX中,搭载该芯片的系统在多个大型语言模型上表现优异:相比Nvidia GB200/GB300系统,其能效(每瓦特算力)提升了1.5-1.9倍,同时响应延迟降低了1.7-3.6倍。对于日均处理海量请求的OpenAI而言,这直接关系到每次推理的成本。
Jalapeño额定功率700瓦,实测负载下稳定功耗约550瓦。一个由128颗芯片组成的单元可提供1.7 Exaflops(百亿亿次)的4位整数算力。该芯片由OpenAI与合作伙伴共同开发:Broadcom负责芯片实现与网络部分,Celestica负责板卡与机架,从设计到流片仅用九个月,计划于2026年底开始部署。
OpenAI与Broadcom达成协议,计划部署总计10吉瓦(GW)的自研加速器,部署工作将持续至2029年底。如此庞大的规模使得功耗和延迟的微小改进都将显著影响电费、冷却、基础设施等总体运营成本。
OpenAI此举旨在控制其最大规模日常推理工作负载的底层硬件架构,从而降低单次请求的总处理成本。与采购通用GPU相比,自研芯片避免了供应商的商业利润加成。Nvidia在2026财年数据中心业务收入增长68%,毛利率高达71.1%,这反映出客户承担了可观的溢价。
更廉价、快速的推理能力使得OpenAI能够支持更复杂的智能体任务、处理更多并发请求,并在不显著扩张数据中心的前提下降低服务成本。这标志着OpenAI将其在AI产业链的控制力,从模型、软件栈和产品,进一步延伸至决定成本的核心硬件架构。
分析认为,Jalapeño案例延续了行业趋势:当推理工作量达到足够大且可预测的规模时,领先公司倾向于转向为自身负载定制的专用芯片,如Anthropic和Midjourney对Google TPU的依赖。然而,这种深度定制也带来了风险:它可能降低应对未来AI架构变化的灵活性,并且将生产依赖于少数合作伙伴(如Broadcom和Celestica),形成了新的供应链风险点。芯片能否在未来几代模型迭代中保持竞争力,仍是未知数。
cryptonews.ru08/30 15:10