Vào ngày 25 tháng 8 năm 2026, OpenAI đã công bố những kết quả thử nghiệm đầu tiên cho bộ gia tốc suy luận (inference) tự thiết kế mang tên Jalapeño. Trên benchmark công khai InferenceX của SemiAnalysis, các hệ thống sử dụng chip mới này cho thấy khả năng tính toán cao hơn từ 1,5–1,9 lần trên mỗi watt ở băng thông đỉnh và giảm độ trễ phản hồi từ 1,7–3,6 lần so với các hệ thống sử dụng Nvidia GB200 và GB300. Các bài kiểm tra được thực hiện trên các mô hình GPT-OSS-120B, DeepSeek R1 và Kimi K2.5. Đối với một công ty hàng ngày phục vụ lưu lượng truy cập khổng lồ từ ChatGPT, Codex và API riêng của mình, những chỉ số này liên quan trực tiếp đến chi phí cho mỗi phản hồi.
Chip được thiết kế cho công suất định mức 700W, trong khi mức tiêu thụ ổn định ở các tải đã thử nghiệm vẫn duy trì ở mức lên đến 550W. Một cụm gồm 128 chip Jalapeño được công bố đạt 1,7 exaflops tính toán ở định dạng 4-bit.
Ranh giới của sự độc lập khỏi Nvidia
Jalapeño được phát triển chung với các đối tác: Broadcom chịu trách nhiệm triển khai vi xử lý và phần mạng, Celestica chịu trách nhiệm về bo mạch và tủ rack. Chỉ mất chín tháng từ khi bắt đầu thiết kế đến khi chuyển giao bản thiết kế cho sản xuất. Việc triển khai chip trong cơ sở hạ tầng của OpenAI dự kiến vào cuối năm 2026, và bản thân Jalapeño sẽ là thế hệ đầu tiên trong nền tảng nhiều năm với các mở rộng tiếp theo.
Bộ gia tốc đa năng của Nvidia buộc phải phục vụ nhiều loại khách hàng và nhiều loại tác vụ khác nhau. Trong khi đó, Jalapeño được thiết kế cho tải cụ thể mà chính OpenAI tự tạo ra, đo lường và có thể thay đổi cùng với phần mềm stack - xoay quanh các mô hình ngôn ngữ riêng, lõi tính toán, luồng dữ liệu, bộ nhớ và trao đổi qua mạng.
Quy mô đã được đặt ở mức 10 GW
Cơ sở cho toàn bộ chương trình là thỏa thuận giữa OpenAI và Broadcom, theo đó các bên đã đồng ý triển khai 10 GW bộ gia tốc do OpenAI tự thiết kế. Việc lắp đặt tủ rack sẽ bắt đầu vào nửa cuối năm 2026 và kéo dài đến cuối năm 2029. Ở công suất như vậy, sự khác biệt về watt và mili giây không còn là đặc tính trong phòng thí nghiệm mà biến thành một khoản chi phí cho điện năng, làm mát, bộ nhớ, mạng, tủ rack và diện tích trung tâm dữ liệu.
Trong khi đó, OpenAI không từ bỏ hoàn toàn các nhà cung cấp bên ngoài:
- Việc huấn luyện các mô hình tiên tiến vẫn cần đến các bộ gia tốc bên ngoài;
- Việc sản xuất hàng loạt Jalapeño phụ thuộc vào các đối tác về sản xuất, bộ nhớ, đóng gói và lắp ráp;
- Công ty sẽ tiếp tục sử dụng rộng rãi chip của Nvidia và các nhà cung cấp khác - cả cho việc huấn luyện lẫn một phần suy luận.
Do đó, ranh giới của dự án rất rõ ràng: OpenAI duy trì chuỗi cung ứng bên ngoài, nhưng giành quyền kiểm soát kiến trúc phần cứng cho luồng tính toán hàng ngày lớn nhất của mình.
Kinh tế học của suy luận (Inference)
Sự khác biệt giữa chip tự thiết kế và việc mua GPU vượt ra ngoài phạm vi tiêu thụ năng lượng. Nvidia đã kết thúc năm tài chính 2026 với doanh thu 215,9 tỷ USD và biên lợi nhuận gộp 71,1%, còn phân khúc trung tâm dữ liệu của họ tăng 68% so với cùng kỳ năm trước - những dữ liệu này được phản ánh trong báo cáo của công ty trước Ủy ban Chứng khoán và Giao dịch (SEC). Người mua GPU không chỉ phải trả tiền cho chính thiết bị, mà còn cho lợi nhuận thương mại của nhà cung cấp trên đó.
OpenAI xây dựng chip như một thành phần nội bộ của dịch vụ riêng và thu được lợi ích từ việc giảm tổng chi phí xử lý mỗi yêu cầu, ngay cả khi không có phụ phí thị trường riêng biệt trên chính bộ xử lý. Một phần chi phí trước đây nằm lại với nhà cung cấp bộ gia tốc đa năng, công ty đang cố gắng biến thành khoản tiết kiệm nội bộ và năng lực tính toán bổ sung cho chính mình.
Suy luận rẻ hơn và nhanh hơn cho phép thực hiện các tác vụ agent lâu hơn, phục vụ nhiều yêu cầu song song hơn và giảm chi phí sản phẩm mà không cần tăng số lượng trung tâm dữ liệu một cách tương ứng. Sự gia tăng sử dụng dịch vụ, đến lượt nó, làm tăng mức độ tải của nền tảng riêng và khiến thế hệ chip chuyên dụng tiếp theo trở nên kinh tế hơn.
Jalapeño thay đổi vị thế của OpenAI trong chuỗi cung ứng hạ tầng AI: công ty trước đây đã kiểm soát mô hình, phần mềm stack và sản phẩm, và giờ đây giành được quyền kiểm soát kiến trúc bộ xử lý - yếu tố quyết định giá của mỗi phản hồi. Nvidia vẫn giữ thị phần huấn luyện mô hình và bộ gia tốc đa năng, nhưng phân khúc công việc lớn nhất của OpenAI không còn là một giao dịch đảm bảo cho họ.
Quan điểm của AI
Từ góc độ phân tích dữ liệu bằng máy móc, trường hợp Jalapeño lặp lại quỹ đạo mà các lãnh đạo ngành khác đã trải qua trước OpenAI. Anthropic đã cam kết sử dụng một triệu TPU từ Google vào tháng 10 năm 2025, còn Midjourney đã chuyển việc tạo hình ảnh sang TPU của Google Cloud để tiết kiệm chi phí. Logic chung là như nhau: các hyperscaler chuyển dần từ GPU đa năng sang chip được tối ưu hóa cho tải riêng ngay khi khối lượng suy luận trở nên đủ dự đoán được và đủ lớn.
Chiến lược này cũng mang mặt trái. Việc chuyên môn hóa cho một mô hình và stack cụ thể làm giảm tính linh hoạt khi kiến trúc AI thay đổi, và sự phụ thuộc vào Broadcom và Celestica trong sản xuất tạo ra một điểm rủi ro duy nhất cho toàn bộ chu kỳ phát triển chín tháng. Liệu Jalapeño có còn cạnh tranh sau hai đến ba thế hệ mô hình nữa, hay sự tối ưu hóa hẹp cho suy luận ngày hôm nay sẽ trở thành hạn chế vào ngày mai?
end-content





