Thức dậy, tin tức về OpenAI đúng là bay khắp nơi.
Đầu tiên, người dùng X Leo@synthwavedd độc quyền tuyên bố: OpenAI đã hoàn thành một đợt tiền huấn luyện mới, mã hiệu "Bel", quy mô tham số được cho là trên 10 nghìn tỷ, có thể là người kế nhiệm của Doug, có thể trở thành mô hình nền tảng cho Astra /GPT-6......

Tìm kiếm một vòng phát hiện, thực sự không có thông tin chính xác. Nhưng điều chắc chắn không thể nghi ngờ là, chip suy luận tự nghiên cứu đầu tiên của OpenAI đã có thành tích.
Ngay vừa rồi, OpenAI đã công bố kết quả kiểm tra mới nhất của chip suy luận tự nghiên cứu đầu tiên Jalapeño: đạt được đột phá lớn, chip này được thiết kế riêng cho suy luận mô hình ngôn ngữ lớn, thông qua thiết kế kiến trúc mới, nó có thể đồng thời nâng cao thông lượng và giảm độ trễ, trong khi duy trì hiệu suất năng lượng cao, đạt được cả hai. Và vượt trội hơn hiệu suất của hệ thống NVIDIA GB200, GB300 trong nhiều bài kiểm tra mô hình.

Ngay sau đó, CEO OpenAI Sam Altman cũng nói trên X: "Chúng tôi đã tạo ra một con chip, nó rất nhanh."

Cần lưu ý rằng, là chip suy luận tự nghiên cứu đầu tiên của OpenAI, Jalapeño không phải là chip dùng để huấn luyện mô hình GPT thế hệ tiếp theo, mà là tối ưu hóa cho giai đoạn vận hành sau khi mô hình được triển khai.
Nói đơn giản: giai đoạn huấn luyện là để mô hình học hỏi khả năng, còn giai đoạn suy luận là để mô hình trả lời nhanh yêu cầu người dùng. Jalapeño chủ yếu giải quyết vấn đề thứ hai.
OpenAI cho biết, hệ thống phần cứng truyền thống thường phải đánh đổi giữa hai chỉ số:
- Thông lượng cao hơn (throughput): xử lý nhiều yêu cầu hơn trong một đơn vị thời gian;
- Độ trễ thấp hơn (latency): để người dùng nhận được phản hồi nhanh hơn.
Ví dụ, xử lý hàng loạt quy mô lớn có thể nâng cao hiệu quả tổng thể, nhưng có thể tăng thời gian chờ cho mỗi yêu cầu; còn theo đuổi độ trễ cực thấp, lại có thể hy sinh tỷ lệ sử dụng tài nguyên. Mục tiêu của Jalapeño là đồng thời tối ưu hóa cả hai trong một kiến trúc.
Còn về hiệu suất cụ thể, OpenAI cho biết, trong nhiều bài kiểm tra suy luận mô hình lớn, Jalapeño vượt trội hơn hệ thống NVIDIA GB200 và GB300. Các mô hình kiểm tra bao gồm: OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T.

Đặc biệt đáng chú ý là sự xuất hiện của DeepSeek R1 và Kimi K2.5, điều này dường như nói rằng: Jalapeño không chỉ tối ưu hóa cho mô hình riêng của OpenAI, mà có thể thích ứng với các tải công việc mô hình lớn khác nhau.
Thú vị là, Jalapeño có thể được dịch là "Ớt Mexico", và sau khi tin này được công bố, cũng lập tức gây ra những lời bình luận và thảo luận sôi nổi từ cộng đồng mạng.
"Bạn định dùng tên ớt để đặt tên cho chip của mình sao? Nóng lòng muốn trải nghiệm."

Còn đối với OpenAI, việc ra mắt Jalapeño cho thấy OpenAI đang thử nghiệm mở ra toàn bộ chuỗi liên kết "mô hình — phần mềm — chip — trung tâm dữ liệu".
Một điểm đáng chú ý khác là, chip Jalapeño của OpenAI lần này, về mặt phần cứng là hợp tác với Cerebras.
Tibo đã đăng bài nói: "Khả năng này nhờ vào sự hợp tác sâu sắc mà chúng tôi thiết lập với Cerebras, cũng như kiến trúc phần cứng độc đáo của họ. Trong tương lai, sự hợp tác này sẽ tiếp tục thúc đẩy ranh giới của trải nghiệm 'siêu nhanh'. Tôi rất mong chờ hai bên tiếp tục hợp tác, không ngừng đột phá giới hạn trên nền tảng Cerebras, khám phá cách chạy mô hình mạnh nhất của chúng tôi với tốc độ nhanh nhất, và mang trải nghiệm này đến cho những khách hàng có yêu cầu hiệu suất cao nhất."

Thực ra, OpenAI không phải là công ty AI đầu tiên hướng tới chip tự nghiên cứu. Trước đó nhiều đại gia AI cũng đã lần lượt xuống sân sản xuất chip. Ví dụ Google đã ra mắt TPU; Amazon phát triển Trainium, Inferentia; Microsoft thúc đẩy Maia; Meta cũng bố trí bộ tăng tốc AI tự nghiên cứu......
Logic đằng sau rất giống nhau: GPU thông dụng đủ linh hoạt, nhưng không được tối ưu hóa cho tất cả các tải công việc AI. Đối với các công ty chạy hàng loạt yêu cầu AI mỗi ngày, nếu có thể thiết kế chip cho riêng mô hình, hệ thống phần mềm và cách thức dịch vụ của mình, thì có cơ hội giảm thêm chi phí......
Dưới đây chúng ta hãy xem cụ thể năng lực của Jalapeño.
Nhanh hơn, tiết kiệm điện hơn
Ưu thế cốt lõi của Jalapeño là hoàn thành nhiều công việc AI hơn với cùng mức tiêu thụ điện, đồng thời trả về phản hồi nhanh hơn. Hệ thống hiện có thường phải đánh đổi giữa thông lượng và độ trễ, còn Jalapeño cố gắng dùng cùng một kiến trúc để đồng thời đạt được thông lượng cao hơn và độ trễ thấp hơn.
OpenAI nhấn mạnh, ưu thế này không chỉ xuất hiện trên mô hình của riêng họ, mà còn bao phủ các mô hình phát triển bên ngoài, chứng minh Jalapeño là một kiến trúc suy luận phổ dụng hơn.
Trên ba mô hình công khai GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, Jalapeño đạt được khối lượng công việc AI trên mỗi watt gấp 1.5~1.9 lần ở thông lượng đỉnh, độ trễ end-to-end giảm xuống còn 1/1.7~1/3.6 của hệ thống so sánh; đối với tải công việc có tính tương tác cao, lợi thế hiệu suất đạt 2.1~4.1 lần.

Trên GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, thông lượng trên mỗi watt đỉnh của Jalapeño lần lượt đạt 1.9 lần, 1.7 lần và 1.5 lần hệ thống tốt nhất hiện có.
Trong đó, trên mô hình quy mô lớn nhất Kimi K2.5, hiệu suất trên mỗi watt đỉnh của Jalapeño tăng khoảng 1.5 lần, độ trễ end-to-end giảm khoảng 3.4 lần.

Trên Kimi K2.5 1T, khi tốc độ giải mã cho mỗi người dùng tăng lên, lợi thế thông lượng trên mỗi watt của Jalapeño so với GB300 tăng từ 1.5 lần ở đỉnh lên đến cao nhất 56.1 lần.
OpenAI không chỉ so sánh hiệu suất đỉnh của một chip đơn lẻ, mà quan tâm hơn đến một chỉ số: trong điều kiện đáp ứng yêu cầu độ trễ của người dùng và Agent tương tác, mỗi đơn vị điện năng có thể hoàn thành bao nhiêu công việc AI hữu ích.
Nguyên nhân cũng liên quan đến Agent. Agent thường cần hoàn thành liên tiếp nhiều bước, độ trễ tưởng như không lớn trong một yêu cầu sẽ liên tục tích lũy trong suốt quá trình thực hiện nhiệm vụ.
Đây cũng là nơi Jalapeño thể hiện rõ ràng nhất trong phạm vi độ trễ thấp. Lấy DeepSeek R1 làm ví dụ, trong điều kiện tương ứng với TBT tốt nhất trước đây của hệ thống so sánh, thông lượng trên mỗi kilowatt của Jalapeño đạt 12,258 mixed TPS/kW, so với 118 của GB300, chênh lệch khoảng 104.3 lần.

Trên DeepSeek R1 670B, thông lượng trên mỗi watt đỉnh của Jalapeño khoảng 1.7 lần GB300; ở cùng tốc độ giải mã, lợi thế cao nhất mở rộng đến 104.3 lần.
OpenAI sử dụng benchmark công khai InferenceX của SemiAnalysis để kiểm tra, và so sánh với hệ thống thương mại hàng đầu hiện nay. Từ dịch vụ thông lượng cao đến kịch bản tương tác cao, độ trễ thấp, Jalapeño đều đạt được hiệu suất trên mỗi watt và tổ hợp độ trễ tốt hơn trên ba mô hình công khai, nằm ở Pareto frontier (biên giới Pareto).

Tại các điểm chạy khác nhau của DeepSeek R1 670B, Jalapeño hình thành tổ hợp tối ưu hơn giữa thông lượng trên mỗi watt với tốc độ tương tác, độ trễ end-to-end, nằm ở Pareto frontier (biên giới Pareto).
Công suất định mức của Jalapeño là 700W, nhưng trong tải công việc kiểm tra lần này, công suất liên tục thực tế luôn duy trì ở 550W hoặc thấp hơn.
Sinh ra dành cho Agent
Jalapeño ngay từ đầu đã được thiết kế xoay quanh mô hình ngôn ngữ lớn hiện tại và tương lai, đặc biệt là Agent tương tác.
Các giai đoạn suy luận LLM khác nhau có các nút thắt khác nhau: Prefill phụ thuộc nhiều hơn vào khả năng tính toán, Decode bị giới hạn bởi băng thông bộ nhớ, việc di chuyển dữ liệu giữa các lõi và chip cũng sẽ tăng độ trễ.
Do đó, OpenAI đồng thiết kế chip, bộ nhớ, mạng, phần mềm và hệ thống cấp giá. Trạng thái mô hình bao gồm cả KV Cache có thể được đặt rõ ràng và cố gắng giữ ở cục bộ, cho phép Jalapeño đồng thời thích ứng với Prefill và Decode, và điều chỉnh theo sự thay đổi khối lượng công việc của cả hai.
OpenAI cho rằng, đây chính là đặc trưng then chốt của tải công việc Agent.
Thú vị là, AI không chỉ là đối tượng mà Jalapeño phục vụ, mà còn trực tiếp tham gia phát triển con chip này.
Nhờ các mô hình ở các giai đoạn khác nhau, đội ngũ OpenAI chỉ mất 9 tháng từ thiết kế ban đầu đến Tape-out (hoàn thiện thiết kế cho sản xuất chip). Mô hình được sử dụng để khám phá các triển khai khác nhau, rút ngắn chu kỳ thiết kế, đo lường và xác minh, còn tham gia tối ưu hóa mạch số học của chip.
Jalapeño cũng được thiết kế thành một mục tiêu lập trình rõ ràng, có thể dự đoán được đối với cả con người và mô hình. Sử dụng Codex được hỗ trợ bởi GPT-Astra, đội ngũ chỉ mất 2 tháng, đã cho ba mô hình trọng số mở ban đầu không nằm trong kế hoạch sản xuất ban đầu của Jalapeño chạy với hiệu suất cao.
Trong một số mô-đun Attention và MoE của GPT-OSS, phiên bản thực hiện do Codex tạo ra thậm chí nhanh hơn 1.5~1.8 lần so với phiên bản viết tay chuyên gia người ban đầu.
Triển khai cuối năm, thế hệ hai ba đang trên đường
OpenAI dự kiến bắt đầu triển khai Jalapeño vào cơ sở hạ tầng tính toán của chính mình trước cuối năm 2026. Hiện tại đội ngũ vẫn đang tiến hành xác minh sản xuất, hoàn thiện phần mềm, chuẩn bị cho vận hành quy mô lớn, và tiếp tục xác minh hiệu suất trên nhiều mô hình hơn.
Các sản phẩm tiếp theo cũng đã khởi động, Gen 2 đã bước vào giai đoạn phát triển sâu, Gen 3 cũng đã bắt đầu định hình.
OpenAI tổng kết sự thay đổi hiệu quả do Jalapeño mang lại thành ba mức: Chế độ Ultra-fast, có thể đạt hiệu quả mà trước đây chỉ có chế độ Fast mới có; chế độ Fast, có thể đạt hiệu quả mà trước đây chỉ có chế độ Batch mới có; bản thân chế độ Batch thì nâng cao hơn nữa hiệu quả.
Tuy nhiên, chip tự nghiên cứu không có nghĩa là OpenAI chuẩn bị thoát khỏi NVIDIA.
OpenAI tuyên bố rõ ràng, để đáp ứng nhu cầu AI ngày càng tăng, cần nhiều sức mạnh tính toán hơn từ tất cả các nguồn có sẵn, công ty vẫn sẽ tiếp tục triển khai quy mô lớn bộ tăng tốc của NVIDIA và các đối tác khác, đồng thời bao phủ cả tải công việc huấn luyện và suy luận.
Bạn nghĩ sao? Chào đón bình luận, trao đổi trong phần bình luận!
Liên kết tham khảo:
https://x.com/OpenAI/status/2092300846675505602
https://x.com/sama/status/2092339694210040187
https://openai.com/index/jalapeno-first-results/
https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/
Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注AI的机器之心, biên tập: 山辉、Youli






