Chỉ qua một đêm, GPT-5.6 Sol được OpenAI tăng tốc gấp 14 lần

marsbitPublished on 2026-08-14Last updated on 2026-08-14

Abstract

OpenAI cùng Cerebras đã công bố chế độ "Ultrafast" cho mô hình GPT-5.6 Sol, tăng tốc độ xử lý lên tới 750 tokens/giây – nhanh hơn 14 lần so với chế độ tiêu chuẩn. Tốc độ này vượt xa các đối thủ như Claude Fable 5 hay Opus 4.8. Trong bài kiểm tra "Humanity's Last Exam" (HLE), GPT-5.6 Sol Ultrafast hoàn thành 2500 câu hỏi chỉ trong 11 giờ 11 phút. Thành tựu này nhờ vào kiến trúc phần cứng chip quy mô wafer độc đáo của Cerebras (WSE-3), giúp lưu trữ toàn bộ tham số mô hình trên bộ nhớ SRAM tốc độ cao tại chỗ, loại bỏ nghẽn cổ chai băng thông bộ nhớ truyền thống. Tốc độ xử lý cực nhanh mở ra nhiều ứng dụng thực tế như: phân tích sự cố hệ thống theo thời gian thực, nghiên cứu tài chính, hỗ trợ khách hàng phức tạp, cá nhân hóa trải nghiệm mua sắm và rút ngắn chu kỳ thử nghiệm trong nghiên cứu. Điều này cho phép các tác vụ Agent phức tạp trước đây cần hàng giờ nay có thể hoàn thành trong vài phút. Chế độ Ultrafast hiện đang được mở bản xem trước giới hạn qua OpenAI API.

AI bắt đầu cuộc chạy đua về sự bất cân xứng thông tin?

Vào lúc rạng sáng ngày 14 tháng 8, OpenAI cùng với nhà sản xuất chip AI Cerebras đã chính thức ra mắt bản xem trước cấp dịch vụ mới "Chế độ Siêu tốc" (Ultrafast Mode) cho mô hình hàng đầu của họ, GPT-5.6 Sol.

Trong chế độ này, tốc độ xuất (output) của GPT-5.6 Sol có thể lên tới 750 tokens/s, so với đường cơ sở suy luận khoảng 53 tokens/s của chế độ Standard (Tiêu chuẩn) hiện tại, tốc độ được cải thiện tối đa lên 14 lần, đồng thời không làm giảm bất kỳ chất lượng nào. So sánh ngang hàng, GPT-5.6 Sol sau khi tăng tốc nhanh hơn Fable 5 gấp 11 lần, và nhanh hơn Opus 4.8 ở chế độ Fast gấp 5 lần.

Chế độ Ultrafast sẽ được ra mắt đầu tiên trong OpenAI API, hiện đã có phiên bản xem trước giới hạn cho một số khách hàng.

Để làm điều này, OpenAI và Cerebras còn lập một bảng so sánh tốc độ và trí tuệ hiện tại của các mô hình AI lớn tiên tiến, trong đó GPT-5.6 Sol Ultrafast đang ở vị trí dẫn đầu tuyệt đối:

Trong blog của Cerebras, các kỹ sư đã giới thiệu về bài kiểm tra được thực hiện trên "Kỳ thi Cuối cùng của Nhân loại" (Humanity's Last Exam, HLE), nơi họ so sánh mô hình sau khi Ultrafast với các đối thủ cạnh tranh trực tiếp. Chúng ta biết rằng HLE là một điểm chuẩn (benchmark) mô hình đầy thách thức, bao gồm 2500 câu hỏi, thường chỉ có các tiến sĩ trong các lĩnh vực như hóa học, kinh tế học và văn học mới có thể giải đáp.

GPT-5.6 Sol ở chế độ siêu tốc chỉ mất 11 giờ 11 phút để trả lời tất cả các câu hỏi. Trong khi đó Claude Fable 5 cần 78 giờ 27 phút, tức là hơn ba ngày tính toán liên tục để đưa ra kết luận tương tự. Chế độ siêu tốc của GPT chỉ mất một ngày làm việc để hoàn thành lĩnh vực tiên phong của tri thức nhân loại, với độ chính xác tương đương, tốc độ nhanh gấp gần 7 lần so với Claude Fable.

Khi khả năng của mô hình ngày càng được nâng cao, phạm vi ứng dụng của việc suy luận nhanh cũng sẽ mở rộng. GPT-5.6 Sol là mô hình hoạt động tốt nhất của OpenAI cho đến nay trong các lĩnh vực như văn bản pháp lý, mô hình tài chính và báo cáo kỹ thuật. Trên GDP-Val (một điểm chuẩn đo lường các nhiệm vụ công việc tri thức có giá trị kinh tế), Ultrafast đạt được mức tăng tốc độ đầu-cuối (end-to-end) gấp 5.6 lần, và chất lượng không bị ảnh hưởng, thể hiện đầy đủ việc tốc độ suy luận nhanh hơn có thể đẩy nhanh việc triển khai các công việc có giá trị kinh tế như thế nào.

Xử lý AI nhanh hơn mang lại nhiều khả năng mới cho các quy trình làm việc mới nổi, giờ đây mọi người có thể triển khai các tác nhân (agent) vào đường dẫn quan trọng của vấn đề. OpenAI liệt kê một số ứng dụng cho bạn:

  • Ứng phó sự kiện và độ tin cậy: Khi hệ thống quan trọng gặp sự cố, AI phân tích nhật ký ứng dụng, các thay đổi mã gần đây và báo cáo của kỹ sư để xác định nguyên nhân có thể xảy ra, và hỗ trợ chuẩn bị phương án khắc phục trong khi sự cố vẫn đang diễn ra.
  • Nghiên cứu và an ninh tài chính: Phân tích tín hiệu thị trường, đánh giá giao dịch và xác định hoạt động đáng ngờ trong bối cảnh tình hình thị trường thay đổi nhanh chóng.
  • Hỗ trợ khách hàng và giọng nói: Giải quyết các vấn đề phức tạp của khách hàng trong thời gian thực, ngay cả khi tìm câu trả lời cần nhiều bước hoặc hệ thống, mà không làm gián đoạn cuộc trò chuyện.
  • Thương mại: Trả lời câu hỏi về sản phẩm, kiểm tra tồn kho, cá nhân hóa đề xuất và giải quyết vấn đề thanh toán khi người mua sắm vẫn đang do dự, tránh để sự do dự biến thành việc bỏ giỏ hàng.
  • Nghiên cứu và thí nghiệm thời gian thực: Biến nghiên cứu trước đây cần cả đêm để hoàn thành thành các cuộc họp công việc tương tác, cho phép nhóm kiểm tra ý tưởng, xem xét kết quả, điều chỉnh phương pháp và tiến hành một thí nghiệm khác mà không làm gián đoạn quy trình làm việc.

Nội bộ OpenAI, các nhà phát triển đã thử nghiệm GPT-5.6 Sol ở chế độ siêu tốc, ứng phó sự kiện là một ví dụ sử dụng Ultrafast. Khi báo động được kích hoạt, các kỹ sư cần xây dựng bức tranh chính xác về sự kiện trong khi hệ thống và bằng chứng vẫn đang thay đổi. Với trí thông minh cấp độ Sol, nhóm có thể nhanh chóng đọc nhật ký, phân tích thông tin dấu vết, tóm tắt cuộc trò chuyện, xác định bước kiểm tra tiếp theo và hỗ trợ chuẩn bị hoặc xác minh phương án khắc phục. Chế độ Ultrafast rút ngắn độ trễ từ quan sát tín hiệu, xác minh giả thuyết đến lựa chọn hành động tiếp theo, trong khi các kỹ sư vẫn chịu trách nhiệm phán đoán và triển khai.

Về mặt nghiên cứu, đội ngũ OpenAI sử dụng Ultrafast để nhanh chóng tìm kiếm cơ sở kiến thức, truy vấn dữ liệu, và nhanh chóng thu thập, sắp xếp và tổng hợp thông tin từ các công cụ khác nhau. Quy trình phổ biến trước đây trong nghiên cứu là các thành viên nhóm khởi động một loạt thí nghiệm vào ban đêm và xem kết quả vào sáng hôm sau. Với Ultrafast, quy trình khám phá có thể được rút ngắn, từ đó hỗ trợ nhiều lần lặp lại trong ngày làm việc.

Đột phá của chế độ Ultrafast nằm ở việc phá vỡ nút cổ chai băng thông bộ nhớ của các cụm GPU truyền thống trong giai đoạn giải mã suy luận của mô hình lớn, việc triển khai chủ yếu dựa vào kiến trúc phần cứng cấp wafer (tấm bán dẫn) của Cerebras.

Trong hàng ngũ các nhà sản xuất chip AI, giải pháp của Cerebras có một không hai: các thế hệ chip của họ được chế tạo từ cả một tấm wafer nguyên vẹn, tích hợp một lượng khổng lồ lõi tính toán và mạng lưới kết nối siêu tốc trên một chip đơn.

GPU truyền thống khi chạy quá trình sinh token giải mã tự hồi quy (autoregressive decoding) của mô hình lớn, bị giới hạn bởi băng thông bộ nhớ, cần liên tục di chuyển lượng trọng số mô hình khổng lồ qua lại giữa bộ nhớ HBM ngoài chip và các lõi tính toán; đồng thời việc chia cắt đa card còn mang lại độ trễ truyền thông kết nối liên chip (PCIe/NVLink).

Trong khi đó, mỗi chip cấp wafer mới nhất của Cerebras (WSE-3) tích hợp 4 nghìn tỷ bóng bán dẫn, 125 petaflops sức mạnh tính toán AI và lên đến 44 GB SRAM tốc độ cao trên chip, các tham số mô hình trực tiếp thường trú toàn bộ trong SRAM trên chip có băng thông cực cao, tránh được thời gian chờ đợi tải trọng số lặp đi lặp lại từ bộ nhớ ngoài chip.

Tất nhiên, GPT-5.6 Sol là một mô hình hàng đầu tiên phong, tổng số tham số đầy đủ rõ ràng vượt xa dung lượng chip. Cerebras còn có cơ chế "Song song đường ống đa wafer (Pipelined across wafers)", phân phối các lớp mạng khác nhau của mô hình lên nhiều wafer, mỗi tham số lớp thường trú trong SRAM của chip riêng, cho phép Token truyền liền mạch qua đường ống giữa các wafer.

Đối với nhiều người dùng mô hình lớn, tốc độ nhanh gấp 14 lần của mô hình hàng đầu sẽ có nghĩa là nhiều nhiệm vụ trước đây buộc phải chuyển sang mô hình cấp thứ cấp (như Luna và Terra) giờ có thể chạy trực tiếp với đầy đủ sức mạnh một cách yên tâm, đối với các nhiệm vụ Agent đòi hỏi nhiều vòng gọi công cụ, sinh mã gỡ lỗi và suy nghĩ chuỗi phức tạp, quy trình trước đây cần vài giờ có thể được nén xuống còn vài phút.

Tốc độ nhanh hơn có lẽ cũng có nghĩa là cách chúng ta sử dụng AI đang thay đổi:

Trong cộng đồng AI, mọi người đã mong đợi chế độ siêu tốc cho các phiên bản Luna và Terra rồi, chỉ không biết chip của Cerebras có đủ không.

Tài liệu tham khảo:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Bài viết này từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注大模型的机器之心

Trending Cryptos

Related Questions

QGPT-5.6 Sol Ultrafast Mode có tốc độ đầu ra token tối đa là bao nhiêu và nhanh hơn bao nhiêu lần so với Standard mode?

ATrong chế độ Ultrafast Mode, GPT-5.6 Sol có tốc độ đầu ra tối đa 750 tokens/giây, nhanh hơn khoảng 14 lần so với tốc độ cơ sở khoảng 53 tokens/giây của Standard mode.

QGPT-5.6 Sol trong chế độ Ultrafast mất bao lâu để hoàn thành bài kiểm tra Humanity's Last Exam (HLE) và so sánh với Claude Fable 5 thế nào?

AGPT-5.6 Sol ở chế độ Ultrafast chỉ mất 11 giờ 11 phút để trả lời toàn bộ 2500 câu hỏi của HLE. Trong khi đó, Claude Fable 5 cần 78 giờ 27 phút, nghĩa là GPT-5.6 Sol nhanh hơn gần 7 lần.

QCông nghệ phần cứng nào từ Cerebras giúp tăng tốc đáng kể GPT-5.6 Sol và nguyên lý chính của nó là gì?

ACông nghệ phần cứng chính là chip quy mô wafer (WSE-3) của Cerebras. Nguyên lý là tích hợp toàn bộ 4 nghìn tỷ bóng bán dẫn và 44 GB bộ nhớ SRAM tốc độ cao trên một chip đơn, cho phép tham số mô hình thường trú trên chip, tránh việc phải tải đi tải lại từ bộ nhớ ngoài, từ đó phá vỡ nút cổ chai băng thông bộ nhớ truyền thống.

QBài báo liệt kê những lĩnh vực ứng dụng tiềm năng nào cho GPT-5.6 Sol tốc độ cao? (Liệt kê ít nhất 3)

ABài báo liệt kê một số lĩnh vực ứng dụng tiềm năng như: 1) Ứng phó sự cố và độ tin cậy hệ thống, 2) Nghiên cứu tài chính và an ninh (phân tích thị trường, đánh giá giao dịch), 3) Hỗ trợ khách hàng và giọng nói phức tạp theo thời gian thực, 4) Thương mại (trả lời câu hỏi sản phẩm, kiểm tra tồn kho), 5) Nghiên cứu và thử nghiệm tương tác theo thời gian thực.

QTốc độ nhanh hơn của GPT-5.6 Sol Ultrafast có thể thay đổi cách thức sử dụng AI như thế nào theo bài báo?

ATheo bài báo, tốc độ nhanh hơn cho phép các tác vụ phức tạp như đa luồng công cụ, sinh mã gỡ lỗi và suy nghĩ chuỗi phức tạp (Agent task) có thể được hoàn thành trong vài phút thay vì vài giờ. Nó cũng cho phép triển khai các tác nhân thông minh vào đường dẫn quan trọng của vấn đề, biến quy trình nghiên cứu qua đêm thành các phiên làm việc lặp lại tương tác trong ngày, từ đó thay đổi cơ bản quy trình làm việc với AI.

Related Reads

Bitcoin Price Drops to $62,470 as Sellers Retest $63,000 Support Level

Bitcoin's price fell below $63,000 for a second consecutive day on Friday, hitting an intraday low of $62,470. The cryptocurrency later recovered to trade just above $63,000, leaving it nearly flat for the past 24 hours and for August overall, with a weekly loss of 2.6%. The volatility triggered significant liquidations, with $26 million of leveraged long Bitcoin positions liquidated over 24 hours. Market sentiment was further dampened by data showing over $131 million in outflows from spot Bitcoin ETFs for a second straight day, signaling a potential pullback by institutional investors. Adding to the negative pressure, index provider MSCI has proposed new criteria for "non-operating companies" in its global indexes, which could lead to the exclusion of firms holding significant digital assets like Bitcoin on their balance sheets. Companies such as Strategy and Metaplanet could be affected, potentially forcing index-tracking funds to sell their shares. Strategy publicly criticized the proposal, arguing digital assets are legitimate assets and index providers should not dictate what companies can own. Public consultations on MSCI's proposal end September 30, with a final decision expected by October 16. If approved, exclusions could begin in November, potentially triggering sustained institutional selling and damaging a key bridge for Bitcoin adoption in the corporate sector.

cryptonews.ru7m ago

Bitcoin Price Drops to $62,470 as Sellers Retest $63,000 Support Level

cryptonews.ru7m ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of SOL (SOL) are presented below.

活动图片