OpenAI "Lật Bàn": Chip Suy luận Tự Nghiên Cứu "Jalapeño" Vượt Mặt NVIDIA

marsbitXuất bản vào 2026-08-25Cập nhật gần nhất vào 2026-08-25

Tóm tắt

OpenAI đã công bố kết quả thử nghiệm đầu tiên của chip suy luận tự thiết kế mang tên Jalapeño, một bước tiến lớn trong nỗ lực tối ưu hóa hiệu suất chạy mô hình AI. Chip này tập trung vào giai đoạn suy luận (inference) của các mô hình ngôn ngữ lớn (LLM), nhằm giải quyết thách thức cân bằng giữa thông lượng cao (throughput) và độ trễ thấp (latency) – điều mà phần cứng truyền thống thường phải đánh đổi. Trong các bài kiểm tra với nhiều mô hình như GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, Jalapeño thể hiện hiệu suất vượt trội so với hệ thống NVIDIA GB200/GB300. Cụ thể, chip đạt được thông lượng trên mỗi watt cao hơn từ 1.5 đến 1.9 lần và giảm độ trễ từ 1.7 đến 3.6 lần. Lợi thế này càng rõ nét trong các tác vụ tương tác đòi hỏi độ trễ cực thấp, nơi hiệu suất có thể cao hơn tới hơn 100 lần. Jalapeño được thiết kế đặc biệt cho nhu cầu của các Agent AI tương tác, với kiến trúc cho phép tối ưu hóa đồng thời cả giai đoạn tiền điền (prefill) và giải mã (decode). Đáng chú ý, chính AI đã được sử dụng để đẩy nhanh quá trình thiết kế và tối ưu hóa chip. OpenAI hợp tác với Cerebras để phát triển phần cứng và kế hoạch triển khai Jalapeño vào cơ sở hạ tầng của mình vào cuối năm 2026, với thế hệ thứ hai và thứ ba đang được phát triển. Dù đầu tư vào chip tự thiết kế, OpenAI khẳng định vẫn sẽ tiếp tục sử dụng quy mô lớn các bộ tăng tốc từ NVIDIA và các đối tác khác để đáp ứng nhu cầu điện toán AI ngày càng tăng.

Thức dậy, tin tức về OpenAI đúng là bay khắp nơi.

Đầu tiên, người dùng X Leo@synthwavedd độc quyền tuyên bố: OpenAI đã hoàn thành một đợt tiền huấn luyện mới, mã hiệu "Bel", quy mô tham số được cho là trên 10 nghìn tỷ, có thể là người kế nhiệm của Doug, có thể trở thành mô hình nền tảng cho Astra /GPT-6......

Tìm kiếm một vòng phát hiện, thực sự không có thông tin chính xác. Nhưng điều chắc chắn không thể nghi ngờ là, chip suy luận tự nghiên cứu đầu tiên của OpenAI đã có thành tích.

Ngay vừa rồi, OpenAI đã công bố kết quả kiểm tra mới nhất của chip suy luận tự nghiên cứu đầu tiên Jalapeño: đạt được đột phá lớn, chip này được thiết kế riêng cho suy luận mô hình ngôn ngữ lớn, thông qua thiết kế kiến trúc mới, nó có thể đồng thời nâng cao thông lượng và giảm độ trễ, trong khi duy trì hiệu suất năng lượng cao, đạt được cả hai. Và vượt trội hơn hiệu suất của hệ thống NVIDIA GB200, GB300 trong nhiều bài kiểm tra mô hình.

Ngay sau đó, CEO OpenAI Sam Altman cũng nói trên X: "Chúng tôi đã tạo ra một con chip, nó rất nhanh."

Cần lưu ý rằng, là chip suy luận tự nghiên cứu đầu tiên của OpenAI, Jalapeño không phải là chip dùng để huấn luyện mô hình GPT thế hệ tiếp theo, mà là tối ưu hóa cho giai đoạn vận hành sau khi mô hình được triển khai.

Nói đơn giản: giai đoạn huấn luyện là để mô hình học hỏi khả năng, còn giai đoạn suy luận là để mô hình trả lời nhanh yêu cầu người dùng. Jalapeño chủ yếu giải quyết vấn đề thứ hai.

OpenAI cho biết, hệ thống phần cứng truyền thống thường phải đánh đổi giữa hai chỉ số:

  • Thông lượng cao hơn (throughput): xử lý nhiều yêu cầu hơn trong một đơn vị thời gian;
  • Độ trễ thấp hơn (latency): để người dùng nhận được phản hồi nhanh hơn.

Ví dụ, xử lý hàng loạt quy mô lớn có thể nâng cao hiệu quả tổng thể, nhưng có thể tăng thời gian chờ cho mỗi yêu cầu; còn theo đuổi độ trễ cực thấp, lại có thể hy sinh tỷ lệ sử dụng tài nguyên. Mục tiêu của Jalapeño là đồng thời tối ưu hóa cả hai trong một kiến trúc.

Còn về hiệu suất cụ thể, OpenAI cho biết, trong nhiều bài kiểm tra suy luận mô hình lớn, Jalapeño vượt trội hơn hệ thống NVIDIA GB200 và GB300. Các mô hình kiểm tra bao gồm: OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T.

Đặc biệt đáng chú ý là sự xuất hiện của DeepSeek R1 và Kimi K2.5, điều này dường như nói rằng: Jalapeño không chỉ tối ưu hóa cho mô hình riêng của OpenAI, mà có thể thích ứng với các tải công việc mô hình lớn khác nhau.

Thú vị là, Jalapeño có thể được dịch là "Ớt Mexico", và sau khi tin này được công bố, cũng lập tức gây ra những lời bình luận và thảo luận sôi nổi từ cộng đồng mạng.

"Bạn định dùng tên ớt để đặt tên cho chip của mình sao? Nóng lòng muốn trải nghiệm."

Còn đối với OpenAI, việc ra mắt Jalapeño cho thấy OpenAI đang thử nghiệm mở ra toàn bộ chuỗi liên kết "mô hình — phần mềm — chip — trung tâm dữ liệu".

Một điểm đáng chú ý khác là, chip Jalapeño của OpenAI lần này, về mặt phần cứng là hợp tác với Cerebras.

Tibo đã đăng bài nói: "Khả năng này nhờ vào sự hợp tác sâu sắc mà chúng tôi thiết lập với Cerebras, cũng như kiến trúc phần cứng độc đáo của họ. Trong tương lai, sự hợp tác này sẽ tiếp tục thúc đẩy ranh giới của trải nghiệm 'siêu nhanh'. Tôi rất mong chờ hai bên tiếp tục hợp tác, không ngừng đột phá giới hạn trên nền tảng Cerebras, khám phá cách chạy mô hình mạnh nhất của chúng tôi với tốc độ nhanh nhất, và mang trải nghiệm này đến cho những khách hàng có yêu cầu hiệu suất cao nhất."

Thực ra, OpenAI không phải là công ty AI đầu tiên hướng tới chip tự nghiên cứu. Trước đó nhiều đại gia AI cũng đã lần lượt xuống sân sản xuất chip. Ví dụ Google đã ra mắt TPU; Amazon phát triển Trainium, Inferentia; Microsoft thúc đẩy Maia; Meta cũng bố trí bộ tăng tốc AI tự nghiên cứu......

Logic đằng sau rất giống nhau: GPU thông dụng đủ linh hoạt, nhưng không được tối ưu hóa cho tất cả các tải công việc AI. Đối với các công ty chạy hàng loạt yêu cầu AI mỗi ngày, nếu có thể thiết kế chip cho riêng mô hình, hệ thống phần mềm và cách thức dịch vụ của mình, thì có cơ hội giảm thêm chi phí......

Dưới đây chúng ta hãy xem cụ thể năng lực của Jalapeño.

Nhanh hơn, tiết kiệm điện hơn

Ưu thế cốt lõi của Jalapeño là hoàn thành nhiều công việc AI hơn với cùng mức tiêu thụ điện, đồng thời trả về phản hồi nhanh hơn. Hệ thống hiện có thường phải đánh đổi giữa thông lượng và độ trễ, còn Jalapeño cố gắng dùng cùng một kiến trúc để đồng thời đạt được thông lượng cao hơn và độ trễ thấp hơn.

OpenAI nhấn mạnh, ưu thế này không chỉ xuất hiện trên mô hình của riêng họ, mà còn bao phủ các mô hình phát triển bên ngoài, chứng minh Jalapeño là một kiến trúc suy luận phổ dụng hơn.

Trên ba mô hình công khai GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, Jalapeño đạt được khối lượng công việc AI trên mỗi watt gấp 1.5~1.9 lần ở thông lượng đỉnh, độ trễ end-to-end giảm xuống còn 1/1.7~1/3.6 của hệ thống so sánh; đối với tải công việc có tính tương tác cao, lợi thế hiệu suất đạt 2.1~4.1 lần.

Trên GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, thông lượng trên mỗi watt đỉnh của Jalapeño lần lượt đạt 1.9 lần, 1.7 lần và 1.5 lần hệ thống tốt nhất hiện có.

Trong đó, trên mô hình quy mô lớn nhất Kimi K2.5, hiệu suất trên mỗi watt đỉnh của Jalapeño tăng khoảng 1.5 lần, độ trễ end-to-end giảm khoảng 3.4 lần.

Trên Kimi K2.5 1T, khi tốc độ giải mã cho mỗi người dùng tăng lên, lợi thế thông lượng trên mỗi watt của Jalapeño so với GB300 tăng từ 1.5 lần ở đỉnh lên đến cao nhất 56.1 lần.

OpenAI không chỉ so sánh hiệu suất đỉnh của một chip đơn lẻ, mà quan tâm hơn đến một chỉ số: trong điều kiện đáp ứng yêu cầu độ trễ của người dùng và Agent tương tác, mỗi đơn vị điện năng có thể hoàn thành bao nhiêu công việc AI hữu ích.

Nguyên nhân cũng liên quan đến Agent. Agent thường cần hoàn thành liên tiếp nhiều bước, độ trễ tưởng như không lớn trong một yêu cầu sẽ liên tục tích lũy trong suốt quá trình thực hiện nhiệm vụ.

Đây cũng là nơi Jalapeño thể hiện rõ ràng nhất trong phạm vi độ trễ thấp. Lấy DeepSeek R1 làm ví dụ, trong điều kiện tương ứng với TBT tốt nhất trước đây của hệ thống so sánh, thông lượng trên mỗi kilowatt của Jalapeño đạt 12,258 mixed TPS/kW, so với 118 của GB300, chênh lệch khoảng 104.3 lần.

Trên DeepSeek R1 670B, thông lượng trên mỗi watt đỉnh của Jalapeño khoảng 1.7 lần GB300; ở cùng tốc độ giải mã, lợi thế cao nhất mở rộng đến 104.3 lần.

OpenAI sử dụng benchmark công khai InferenceX của SemiAnalysis để kiểm tra, và so sánh với hệ thống thương mại hàng đầu hiện nay. Từ dịch vụ thông lượng cao đến kịch bản tương tác cao, độ trễ thấp, Jalapeño đều đạt được hiệu suất trên mỗi watt và tổ hợp độ trễ tốt hơn trên ba mô hình công khai, nằm ở Pareto frontier (biên giới Pareto).

Tại các điểm chạy khác nhau của DeepSeek R1 670B, Jalapeño hình thành tổ hợp tối ưu hơn giữa thông lượng trên mỗi watt với tốc độ tương tác, độ trễ end-to-end, nằm ở Pareto frontier (biên giới Pareto).

Công suất định mức của Jalapeño là 700W, nhưng trong tải công việc kiểm tra lần này, công suất liên tục thực tế luôn duy trì ở 550W hoặc thấp hơn.

Sinh ra dành cho Agent

Jalapeño ngay từ đầu đã được thiết kế xoay quanh mô hình ngôn ngữ lớn hiện tại và tương lai, đặc biệt là Agent tương tác.

Các giai đoạn suy luận LLM khác nhau có các nút thắt khác nhau: Prefill phụ thuộc nhiều hơn vào khả năng tính toán, Decode bị giới hạn bởi băng thông bộ nhớ, việc di chuyển dữ liệu giữa các lõi và chip cũng sẽ tăng độ trễ.

Do đó, OpenAI đồng thiết kế chip, bộ nhớ, mạng, phần mềm và hệ thống cấp giá. Trạng thái mô hình bao gồm cả KV Cache có thể được đặt rõ ràng và cố gắng giữ ở cục bộ, cho phép Jalapeño đồng thời thích ứng với Prefill và Decode, và điều chỉnh theo sự thay đổi khối lượng công việc của cả hai.

OpenAI cho rằng, đây chính là đặc trưng then chốt của tải công việc Agent.

Thú vị là, AI không chỉ là đối tượng mà Jalapeño phục vụ, mà còn trực tiếp tham gia phát triển con chip này.

Nhờ các mô hình ở các giai đoạn khác nhau, đội ngũ OpenAI chỉ mất 9 tháng từ thiết kế ban đầu đến Tape-out (hoàn thiện thiết kế cho sản xuất chip). Mô hình được sử dụng để khám phá các triển khai khác nhau, rút ngắn chu kỳ thiết kế, đo lường và xác minh, còn tham gia tối ưu hóa mạch số học của chip.

Jalapeño cũng được thiết kế thành một mục tiêu lập trình rõ ràng, có thể dự đoán được đối với cả con người và mô hình. Sử dụng Codex được hỗ trợ bởi GPT-Astra, đội ngũ chỉ mất 2 tháng, đã cho ba mô hình trọng số mở ban đầu không nằm trong kế hoạch sản xuất ban đầu của Jalapeño chạy với hiệu suất cao.

Trong một số mô-đun Attention và MoE của GPT-OSS, phiên bản thực hiện do Codex tạo ra thậm chí nhanh hơn 1.5~1.8 lần so với phiên bản viết tay chuyên gia người ban đầu.

Triển khai cuối năm, thế hệ hai ba đang trên đường

OpenAI dự kiến bắt đầu triển khai Jalapeño vào cơ sở hạ tầng tính toán của chính mình trước cuối năm 2026. Hiện tại đội ngũ vẫn đang tiến hành xác minh sản xuất, hoàn thiện phần mềm, chuẩn bị cho vận hành quy mô lớn, và tiếp tục xác minh hiệu suất trên nhiều mô hình hơn.

Các sản phẩm tiếp theo cũng đã khởi động, Gen 2 đã bước vào giai đoạn phát triển sâu, Gen 3 cũng đã bắt đầu định hình.

OpenAI tổng kết sự thay đổi hiệu quả do Jalapeño mang lại thành ba mức: Chế độ Ultra-fast, có thể đạt hiệu quả mà trước đây chỉ có chế độ Fast mới có; chế độ Fast, có thể đạt hiệu quả mà trước đây chỉ có chế độ Batch mới có; bản thân chế độ Batch thì nâng cao hơn nữa hiệu quả.

Tuy nhiên, chip tự nghiên cứu không có nghĩa là OpenAI chuẩn bị thoát khỏi NVIDIA.

OpenAI tuyên bố rõ ràng, để đáp ứng nhu cầu AI ngày càng tăng, cần nhiều sức mạnh tính toán hơn từ tất cả các nguồn có sẵn, công ty vẫn sẽ tiếp tục triển khai quy mô lớn bộ tăng tốc của NVIDIA và các đối tác khác, đồng thời bao phủ cả tải công việc huấn luyện và suy luận.

Bạn nghĩ sao? Chào đón bình luận, trao đổi trong phần bình luận!

Liên kết tham khảo:

https://x.com/OpenAI/status/2092300846675505602

https://x.com/sama/status/2092339694210040187

https://openai.com/index/jalapeno-first-results/

https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/

Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注AI的机器之心, biên tập: 山辉、Youli

Tiền kỹ thuật số thịnh hành

Nội dung Liên quan

Solana lần đầu trở lại mức $100 kể từ tháng 2, trong bối cảnh hoạt động mạng lập kỷ lục

Giá Solana (SOL) đã vượt mốc 100 USD lần đầu tiên kể từ tháng Hai, tăng gần 40% chỉ trong 8 ngày nhờ sự phục hồi chung của thị trường tiền mã hóa. Đợt tăng giá này trùng hợp với hoạt động mạng lưới kỷ lục: trong tháng 7, Solana xử lý 4,2 tỷ giao dịch, mức cao nhất từ trước đến nay, tăng 13,5% so với tháng trước. Số lượng giao dịch đã tăng liên tục vài tháng, tăng khoảng 91% kể từ tháng 12, cho thấy sự mở rộng bền vững của cơ sở người dùng. Song song đó, phân khúc tài sản thực được mã hóa (RWA) trên Solana cũng tăng trưởng, với giá trị tiệm cận 4 tỷ USD, tăng 11,8% trong tháng, đưa Solana vào nhóm các mạng lưới dẫn đầu về RWA. Tổng giá trị RWA trên tất cả các blockchain được theo dõi đã vượt 38 tỷ USD. Động lực cho đợt tăng giá bao gồm việc phục hồi thị trường tiền mã hóa rộng hơn và quyết định của Bộ Tài chính Mỹ tăng gấp đôi khối lượng mua lại trái phiếu dài hạn, làm giảm lợi suất và thúc đẩy tâm lý chấp nhận rủi ro của nhà đầu tư. Tuy nhiên, cần thận trọng khi phân tích số liệu giao dịch, vì một phần có thể bao gồm các hoạt động kỹ thuật hoặc biểu quyết của trình xác thực, không chỉ hành động người dùng thực tế. Rủi ro bảo mật, như vụ tấn công Drift Protocol trị giá 286 triệu USD vào tháng 4/2026, cũng là yếu tố cần theo dõi đối với niềm tin của nhà đầu tư.

cryptonews.ru3 giờ trước

Solana lần đầu trở lại mức $100 kể từ tháng 2, trong bối cảnh hoạt động mạng lập kỷ lục

cryptonews.ru3 giờ trước

Giám đốc điều hành của World Liberty, Witkoff, chỉ ra doanh số bán hàng là bằng chứng về nhu cầu hữu cơ

Giám đốc điều hành World Liberty Financial, Zach Witkoff, đã chỉ ra khối lượng giao dịch của stablecoin $USD1 như một bằng chứng cho thấy nhu cầu thị trường thực sự đối với đồng tiền này. Ông đưa ra bình luận trên bối cảnh có những chỉ trích cho rằng $USD1 là công cụ để mua ảnh hưởng lên Tổng thống. Tranh luận thêm phần gay gắt sau khi các cơ quan quản lý liên bang cấp giấy phép ngân hàng cho World Liberty Financial. Trong 24 giờ, khối lượng giao dịch $USD1 đạt khoảng 1,42 tỷ USD, vốn hóa thị trường xấp xỉ 4,03 tỷ USD. Witkoff khẳng định mức độ hoạt động giao dịch này là "hữu cơ", phản ánh sự tin tưởng của các nhà đầu tư tổ chức và xứng đáng nhận được sự giám sát của liên bang. Vào ngày 14/8, OCC đã cấp phép sơ bộ có điều kiện cho World Liberty Trust Co. để thành lập một ngân hàng ủy thác quốc gia, cho phép công ty trực tiếp phát hành và mua lại $USD1. Tuy nhiên, các nhà phê bình và học giả tỏ ra hoài nghi. Họ cho rằng giá trị của $USD1 chủ yếu đến từ mối liên hệ với Nhà Trắng, và quy mô của nó còn nhỏ so với các stablecoin lớn như Tether hay USDC. Thượng nghị sĩ Elizabeth Warren thậm chí gọi quyết định của OCC là "hành động lạm quyền trắng trợn nhất". Vấn đề càng trở nên phức tạp do lợi ích tài chính liên quan. Một công ty liên kết với gia đình Trump sở hữu khoảng 38% công ty mẹ của World Liberty Financial, và các thành viên gia đình nắm giữ 22,5 tỷ token quản trị. Tổng thống Trump cũng đã báo cáo thu nhập khoảng 600 triệu USD từ việc bán token và cổ phiếu của World Liberty. Công ty này phủ nhận mọi xung đột lợi ích, khẳng định Trump không liên quan đến hoạt động quản lý và họ đang tập trung vào việc tuân thủ các quy định.

cryptonews.ru3 giờ trước

Giám đốc điều hành của World Liberty, Witkoff, chỉ ra doanh số bán hàng là bằng chứng về nhu cầu hữu cơ

cryptonews.ru3 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CHIP

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua USD.AI (CHIP) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua USD.AI (CHIP) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ USD.AI (CHIP) của BạnSau khi mua USD.AI (CHIP), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch USD.AI (CHIP)Giao dịch USD.AI (CHIP) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 1.1kXuất bản vào 2026.04.21Cập nhật vào 2026.06.02

Làm thế nào để Mua CHIP

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CHIP (CHIP) được trình bày dưới đây.

活动图片