Vào ngày 25 tháng 8 năm 2026, OpenAI đã công bố kết quả thử nghiệm đầu tiên của bộ tăng tốc suy luận tự thiết kế Jalapeño. Trên điểm chuẩn công khai InferenceX từ SemiAnalysis, các hệ thống sử dụng chip mới này đã thể hiện khả năng tính toán trên mỗi watt cao hơn từ 1,5–1,9 lần ở thông lượng đỉnh và giảm độ trễ phản hồi từ 1,7–3,6 lần so với các hệ thống sử dụng Nvidia GB200 và GB300. Các bài kiểm tra được thực hiện trên các mô hình GPT-OSS-120B, DeepSeek R1 và Kimi K2.5. Đối với một công ty phục vụ lượng truy vấn khổng lồ hàng ngày từ ChatGPT, Codex và API riêng của mình, những chỉ số này có liên quan trực tiếp đến chi phí của mỗi phản hồi.
Chip được thiết kế cho công suất định mức 700W, trong khi mức tiêu thụ ổn định dưới các tải được thử nghiệm vẫn duy trì ở mức lên đến 550W. Một khối gồm 128 chip Jalapeño được công bố đạt 1,7 exaflops tính toán ở định dạng 4-bit.
Giới hạn của sự độc lập khỏi Nvidia
Jalapeño được phát triển chung với các đối tác: Broadcom phụ trách việc triển khai tinh thể và phần mạng, Celestica phụ trách bo mạch và giá đỡ. Từ khi bắt đầu thiết kế đến khi chuyển giao bản thiết kế để sản xuất mất chín tháng. Việc triển khai chip trong cơ sở hạ tầng của OpenAI được lên kế hoạch vào cuối năm 2026, và bản thân Jalapeño sẽ trở thành thế hệ đầu tiên trong nền tảng đa năm với các bản mở rộng tiếp theo.
Bộ tăng tốc đa năng của Nvidia buộc phải phục vụ một phạm vi rộng các khách hàng và loại tác vụ. Trong khi đó, Jalapeño được thiết kế cho tải cụ thể mà chính OpenAI tạo ra, đo lường và có thể thay đổi cùng với ngăn xếp phần mềm — xoay quanh các mô hình ngôn ngữ riêng, lõi tính toán, luồng dữ liệu, bộ nhớ và trao đổi mạng.
Quy mô được đặt ở mức 10 GW
Cơ sở cho toàn bộ chương trình là thỏa thuận giữa OpenAI và Broadcom, theo đó hai bên đã thống nhất về việc triển khai 10 GW bộ tăng tốc do OpenAI tự thiết kế. Việc lắp đặt các giá đỡ sẽ bắt đầu vào nửa cuối năm 2026 và kéo dài đến cuối năm 2029. Với công suất như vậy, sự khác biệt về watt và mili giây không còn là đặc tính phòng thí nghiệm mà trở thành một khoản chi phí cho điện, làm mát, bộ nhớ, mạng, giá đỡ và diện tích trung tâm dữ liệu.
Tuy nhiên, OpenAI không từ bỏ hoàn toàn các nhà cung cấp bên ngoài:
- Việc đào tạo các mô hình tiên tiến vẫn yêu cầu bộ tăng tốc bên ngoài;
- Sản xuất hàng loạt Jalapeño phụ thuộc vào các đối tác về sản xuất, bộ nhớ, đóng gói và lắp ráp;
- Công ty sẽ tiếp tục sử dụng rộng rãi chip của Nvidia và các nhà cung cấp khác — cho cả việc đào tạo và một phần suy luận.
Do đó, ranh giới của dự án rất rõ ràng: OpenAI duy trì chuỗi cung ứng bên ngoài, nhưng nắm lấy kiến trúc phần cứng cho luồng tính toán hàng ngày lớn nhất của mình.
Kinh tế học của suy luận
Sự khác biệt giữa chip tự thiết kế và việc mua GPU vượt ra ngoài phạm vi tiêu thụ năng lượng. Nvidia đã kết thúc năm tài chính 2026 với doanh thu 215,9 tỷ USD và biên lợi nhuận gộp 71,1%, và phân khúc trung tâm dữ liệu của họ tăng trưởng 68% so với cùng kỳ năm ngoái — những dữ liệu này được phản ánh trong báo cáo của công ty trước Ủy ban Chứng khoán và Giao dịch (SEC). Người mua GPU không chỉ trả tiền cho chính thiết bị, mà còn cho lợi nhuận thương mại của nhà cung cấp trên đó.
OpenAI xây dựng chip như một thành phần nội bộ của dịch vụ riêng và thu lợi từ việc giảm tổng chi phí xử lý mỗi yêu cầu, ngay cả khi không có phụ phí thị trường riêng biệt cho chính bộ xử lý. Một phần chi phí trước đây nằm lại ở nhà cung cấp bộ tăng tốc đa năng, công ty đang cố gắng biến thành khoản tiết kiệm của riêng mình và thành năng lực tính toán bổ sung.
Suy luận rẻ hơn và nhanh hơn cho phép thực hiện các tác vụ tự chủ lâu hơn, phục vụ nhiều yêu cầu song song hơn và giảm chi phí sản phẩm mà không cần tăng tỷ lệ thuận số lượng trung tâm dữ liệu. Việc tăng cường sử dụng dịch vụ, đến lượt nó, làm tăng mức độ tải của nền tảng riêng và khiến thế hệ chip chuyên dụng tiếp theo trở nên kinh tế hơn.
Jalapeño thay đổi vị thế của OpenAI trong chuỗi cơ sở hạ tầng AI: công ty trước đây đã kiểm soát mô hình, ngăn xếp phần mềm và sản phẩm, và giờ đây nắm quyền kiểm soát kiến trúc bộ xử lý, yếu tố quyết định giá của mỗi phản hồi. Nvidia vẫn giữ thị trường đào tạo mô hình và bộ tăng tốc đa năng, nhưng phân khúc làm việc lớn nhất của OpenAI không còn là khoản bán hàng đảm bảo cho họ.
Quan điểm của AI
Từ góc độ phân tích dữ liệu máy móc, trường hợp Jalapeño lặp lại quỹ đạo mà trước OpenAI, các nhà lãnh đạo ngành khác đã đi qua. Anthropic đã cam kết về một triệu TPU từ Google vào tháng 10 năm 2025, và Midjourney đã chuyển việc tạo hình ảnh sang TPU của Google Cloud để tiết kiệm chi phí. Logic chung là một: các siêu nhà cung cấp dịch vụ quy mô lớn (hyperscalers) chuyển dần từ GPU đa năng sang chip được tối ưu hóa cho tải riêng của họ, ngay khi khối lượng suy luận trở nên đủ dự đoán và lớn.
Chiến lược này cũng mang mặt trái. Việc chuyên môn hóa cho một mô hình và ngăn xếp cụ thể làm giảm tính linh hoạt khi kiến trúc AI thay đổi, và sự phụ thuộc vào Broadcom và Celestica trong sản xuất tạo ra một điểm rủi ro duy nhất cho toàn bộ chu kỳ phát triển chín tháng. Liệu Jalapeño có còn cạnh tranh sau hai đến ba thế hệ mô hình, hay sự tối ưu hóa hẹp cho suy luận ngày hôm nay sẽ trở thành hạn chế vào ngày mai?
end-content





