Chỉ qua một đêm, GPT-5.6 Sol được OpenAI tăng tốc gấp 14 lần

marsbit发布于2026-08-14更新于2026-08-14

文章摘要

OpenAI cùng Cerebras đã công bố chế độ "Ultrafast" cho mô hình GPT-5.6 Sol, tăng tốc độ xử lý lên tới 750 tokens/giây – nhanh hơn 14 lần so với chế độ tiêu chuẩn. Tốc độ này vượt xa các đối thủ như Claude Fable 5 hay Opus 4.8. Trong bài kiểm tra "Humanity's Last Exam" (HLE), GPT-5.6 Sol Ultrafast hoàn thành 2500 câu hỏi chỉ trong 11 giờ 11 phút. Thành tựu này nhờ vào kiến trúc phần cứng chip quy mô wafer độc đáo của Cerebras (WSE-3), giúp lưu trữ toàn bộ tham số mô hình trên bộ nhớ SRAM tốc độ cao tại chỗ, loại bỏ nghẽn cổ chai băng thông bộ nhớ truyền thống. Tốc độ xử lý cực nhanh mở ra nhiều ứng dụng thực tế như: phân tích sự cố hệ thống theo thời gian thực, nghiên cứu tài chính, hỗ trợ khách hàng phức tạp, cá nhân hóa trải nghiệm mua sắm và rút ngắn chu kỳ thử nghiệm trong nghiên cứu. Điều này cho phép các tác vụ Agent phức tạp trước đây cần hàng giờ nay có thể hoàn thành trong vài phút. Chế độ Ultrafast hiện đang được mở bản xem trước giới hạn qua OpenAI API.

AI bắt đầu cuộc chạy đua về sự bất cân xứng thông tin?

Vào lúc rạng sáng ngày 14 tháng 8, OpenAI cùng với nhà sản xuất chip AI Cerebras đã chính thức ra mắt bản xem trước cấp dịch vụ mới "Chế độ Siêu tốc" (Ultrafast Mode) cho mô hình hàng đầu của họ, GPT-5.6 Sol.

Trong chế độ này, tốc độ xuất (output) của GPT-5.6 Sol có thể lên tới 750 tokens/s, so với đường cơ sở suy luận khoảng 53 tokens/s của chế độ Standard (Tiêu chuẩn) hiện tại, tốc độ được cải thiện tối đa lên 14 lần, đồng thời không làm giảm bất kỳ chất lượng nào. So sánh ngang hàng, GPT-5.6 Sol sau khi tăng tốc nhanh hơn Fable 5 gấp 11 lần, và nhanh hơn Opus 4.8 ở chế độ Fast gấp 5 lần.

Chế độ Ultrafast sẽ được ra mắt đầu tiên trong OpenAI API, hiện đã có phiên bản xem trước giới hạn cho một số khách hàng.

Để làm điều này, OpenAI và Cerebras còn lập một bảng so sánh tốc độ và trí tuệ hiện tại của các mô hình AI lớn tiên tiến, trong đó GPT-5.6 Sol Ultrafast đang ở vị trí dẫn đầu tuyệt đối:

Trong blog của Cerebras, các kỹ sư đã giới thiệu về bài kiểm tra được thực hiện trên "Kỳ thi Cuối cùng của Nhân loại" (Humanity's Last Exam, HLE), nơi họ so sánh mô hình sau khi Ultrafast với các đối thủ cạnh tranh trực tiếp. Chúng ta biết rằng HLE là một điểm chuẩn (benchmark) mô hình đầy thách thức, bao gồm 2500 câu hỏi, thường chỉ có các tiến sĩ trong các lĩnh vực như hóa học, kinh tế học và văn học mới có thể giải đáp.

GPT-5.6 Sol ở chế độ siêu tốc chỉ mất 11 giờ 11 phút để trả lời tất cả các câu hỏi. Trong khi đó Claude Fable 5 cần 78 giờ 27 phút, tức là hơn ba ngày tính toán liên tục để đưa ra kết luận tương tự. Chế độ siêu tốc của GPT chỉ mất một ngày làm việc để hoàn thành lĩnh vực tiên phong của tri thức nhân loại, với độ chính xác tương đương, tốc độ nhanh gấp gần 7 lần so với Claude Fable.

Khi khả năng của mô hình ngày càng được nâng cao, phạm vi ứng dụng của việc suy luận nhanh cũng sẽ mở rộng. GPT-5.6 Sol là mô hình hoạt động tốt nhất của OpenAI cho đến nay trong các lĩnh vực như văn bản pháp lý, mô hình tài chính và báo cáo kỹ thuật. Trên GDP-Val (một điểm chuẩn đo lường các nhiệm vụ công việc tri thức có giá trị kinh tế), Ultrafast đạt được mức tăng tốc độ đầu-cuối (end-to-end) gấp 5.6 lần, và chất lượng không bị ảnh hưởng, thể hiện đầy đủ việc tốc độ suy luận nhanh hơn có thể đẩy nhanh việc triển khai các công việc có giá trị kinh tế như thế nào.

Xử lý AI nhanh hơn mang lại nhiều khả năng mới cho các quy trình làm việc mới nổi, giờ đây mọi người có thể triển khai các tác nhân (agent) vào đường dẫn quan trọng của vấn đề. OpenAI liệt kê một số ứng dụng cho bạn:

  • Ứng phó sự kiện và độ tin cậy: Khi hệ thống quan trọng gặp sự cố, AI phân tích nhật ký ứng dụng, các thay đổi mã gần đây và báo cáo của kỹ sư để xác định nguyên nhân có thể xảy ra, và hỗ trợ chuẩn bị phương án khắc phục trong khi sự cố vẫn đang diễn ra.
  • Nghiên cứu và an ninh tài chính: Phân tích tín hiệu thị trường, đánh giá giao dịch và xác định hoạt động đáng ngờ trong bối cảnh tình hình thị trường thay đổi nhanh chóng.
  • Hỗ trợ khách hàng và giọng nói: Giải quyết các vấn đề phức tạp của khách hàng trong thời gian thực, ngay cả khi tìm câu trả lời cần nhiều bước hoặc hệ thống, mà không làm gián đoạn cuộc trò chuyện.
  • Thương mại: Trả lời câu hỏi về sản phẩm, kiểm tra tồn kho, cá nhân hóa đề xuất và giải quyết vấn đề thanh toán khi người mua sắm vẫn đang do dự, tránh để sự do dự biến thành việc bỏ giỏ hàng.
  • Nghiên cứu và thí nghiệm thời gian thực: Biến nghiên cứu trước đây cần cả đêm để hoàn thành thành các cuộc họp công việc tương tác, cho phép nhóm kiểm tra ý tưởng, xem xét kết quả, điều chỉnh phương pháp và tiến hành một thí nghiệm khác mà không làm gián đoạn quy trình làm việc.

Nội bộ OpenAI, các nhà phát triển đã thử nghiệm GPT-5.6 Sol ở chế độ siêu tốc, ứng phó sự kiện là một ví dụ sử dụng Ultrafast. Khi báo động được kích hoạt, các kỹ sư cần xây dựng bức tranh chính xác về sự kiện trong khi hệ thống và bằng chứng vẫn đang thay đổi. Với trí thông minh cấp độ Sol, nhóm có thể nhanh chóng đọc nhật ký, phân tích thông tin dấu vết, tóm tắt cuộc trò chuyện, xác định bước kiểm tra tiếp theo và hỗ trợ chuẩn bị hoặc xác minh phương án khắc phục. Chế độ Ultrafast rút ngắn độ trễ từ quan sát tín hiệu, xác minh giả thuyết đến lựa chọn hành động tiếp theo, trong khi các kỹ sư vẫn chịu trách nhiệm phán đoán và triển khai.

Về mặt nghiên cứu, đội ngũ OpenAI sử dụng Ultrafast để nhanh chóng tìm kiếm cơ sở kiến thức, truy vấn dữ liệu, và nhanh chóng thu thập, sắp xếp và tổng hợp thông tin từ các công cụ khác nhau. Quy trình phổ biến trước đây trong nghiên cứu là các thành viên nhóm khởi động một loạt thí nghiệm vào ban đêm và xem kết quả vào sáng hôm sau. Với Ultrafast, quy trình khám phá có thể được rút ngắn, từ đó hỗ trợ nhiều lần lặp lại trong ngày làm việc.

Đột phá của chế độ Ultrafast nằm ở việc phá vỡ nút cổ chai băng thông bộ nhớ của các cụm GPU truyền thống trong giai đoạn giải mã suy luận của mô hình lớn, việc triển khai chủ yếu dựa vào kiến trúc phần cứng cấp wafer (tấm bán dẫn) của Cerebras.

Trong hàng ngũ các nhà sản xuất chip AI, giải pháp của Cerebras có một không hai: các thế hệ chip của họ được chế tạo từ cả một tấm wafer nguyên vẹn, tích hợp một lượng khổng lồ lõi tính toán và mạng lưới kết nối siêu tốc trên một chip đơn.

GPU truyền thống khi chạy quá trình sinh token giải mã tự hồi quy (autoregressive decoding) của mô hình lớn, bị giới hạn bởi băng thông bộ nhớ, cần liên tục di chuyển lượng trọng số mô hình khổng lồ qua lại giữa bộ nhớ HBM ngoài chip và các lõi tính toán; đồng thời việc chia cắt đa card còn mang lại độ trễ truyền thông kết nối liên chip (PCIe/NVLink).

Trong khi đó, mỗi chip cấp wafer mới nhất của Cerebras (WSE-3) tích hợp 4 nghìn tỷ bóng bán dẫn, 125 petaflops sức mạnh tính toán AI và lên đến 44 GB SRAM tốc độ cao trên chip, các tham số mô hình trực tiếp thường trú toàn bộ trong SRAM trên chip có băng thông cực cao, tránh được thời gian chờ đợi tải trọng số lặp đi lặp lại từ bộ nhớ ngoài chip.

Tất nhiên, GPT-5.6 Sol là một mô hình hàng đầu tiên phong, tổng số tham số đầy đủ rõ ràng vượt xa dung lượng chip. Cerebras còn có cơ chế "Song song đường ống đa wafer (Pipelined across wafers)", phân phối các lớp mạng khác nhau của mô hình lên nhiều wafer, mỗi tham số lớp thường trú trong SRAM của chip riêng, cho phép Token truyền liền mạch qua đường ống giữa các wafer.

Đối với nhiều người dùng mô hình lớn, tốc độ nhanh gấp 14 lần của mô hình hàng đầu sẽ có nghĩa là nhiều nhiệm vụ trước đây buộc phải chuyển sang mô hình cấp thứ cấp (như Luna và Terra) giờ có thể chạy trực tiếp với đầy đủ sức mạnh một cách yên tâm, đối với các nhiệm vụ Agent đòi hỏi nhiều vòng gọi công cụ, sinh mã gỡ lỗi và suy nghĩ chuỗi phức tạp, quy trình trước đây cần vài giờ có thể được nén xuống còn vài phút.

Tốc độ nhanh hơn có lẽ cũng có nghĩa là cách chúng ta sử dụng AI đang thay đổi:

Trong cộng đồng AI, mọi người đã mong đợi chế độ siêu tốc cho các phiên bản Luna và Terra rồi, chỉ không biết chip của Cerebras có đủ không.

Tài liệu tham khảo:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Bài viết này từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注大模型的机器之心

热门币种推荐

相关问答

QGPT-5.6 Sol Ultrafast Mode có tốc độ đầu ra token tối đa là bao nhiêu và nhanh hơn bao nhiêu lần so với Standard mode?

ATrong chế độ Ultrafast Mode, GPT-5.6 Sol có tốc độ đầu ra tối đa 750 tokens/giây, nhanh hơn khoảng 14 lần so với tốc độ cơ sở khoảng 53 tokens/giây của Standard mode.

QGPT-5.6 Sol trong chế độ Ultrafast mất bao lâu để hoàn thành bài kiểm tra Humanity's Last Exam (HLE) và so sánh với Claude Fable 5 thế nào?

AGPT-5.6 Sol ở chế độ Ultrafast chỉ mất 11 giờ 11 phút để trả lời toàn bộ 2500 câu hỏi của HLE. Trong khi đó, Claude Fable 5 cần 78 giờ 27 phút, nghĩa là GPT-5.6 Sol nhanh hơn gần 7 lần.

QCông nghệ phần cứng nào từ Cerebras giúp tăng tốc đáng kể GPT-5.6 Sol và nguyên lý chính của nó là gì?

ACông nghệ phần cứng chính là chip quy mô wafer (WSE-3) của Cerebras. Nguyên lý là tích hợp toàn bộ 4 nghìn tỷ bóng bán dẫn và 44 GB bộ nhớ SRAM tốc độ cao trên một chip đơn, cho phép tham số mô hình thường trú trên chip, tránh việc phải tải đi tải lại từ bộ nhớ ngoài, từ đó phá vỡ nút cổ chai băng thông bộ nhớ truyền thống.

QBài báo liệt kê những lĩnh vực ứng dụng tiềm năng nào cho GPT-5.6 Sol tốc độ cao? (Liệt kê ít nhất 3)

ABài báo liệt kê một số lĩnh vực ứng dụng tiềm năng như: 1) Ứng phó sự cố và độ tin cậy hệ thống, 2) Nghiên cứu tài chính và an ninh (phân tích thị trường, đánh giá giao dịch), 3) Hỗ trợ khách hàng và giọng nói phức tạp theo thời gian thực, 4) Thương mại (trả lời câu hỏi sản phẩm, kiểm tra tồn kho), 5) Nghiên cứu và thử nghiệm tương tác theo thời gian thực.

QTốc độ nhanh hơn của GPT-5.6 Sol Ultrafast có thể thay đổi cách thức sử dụng AI như thế nào theo bài báo?

ATheo bài báo, tốc độ nhanh hơn cho phép các tác vụ phức tạp như đa luồng công cụ, sinh mã gỡ lỗi và suy nghĩ chuỗi phức tạp (Agent task) có thể được hoàn thành trong vài phút thay vì vài giờ. Nó cũng cho phép triển khai các tác nhân thông minh vào đường dẫn quan trọng của vấn đề, biến quy trình nghiên cứu qua đêm thành các phiên làm việc lặp lại tương tác trong ngày, từ đó thay đổi cơ bản quy trình làm việc với AI.

你可能也喜欢

XRP活跃地址数激增84%,价格较历史高点下跌72%

在XRP生态系统中,网络活跃度与价格走势出现背离。分析师阿里·马丁内斯指出,XRP活跃地址数从8月1日的23,642个增至目前的43,543个,大幅增长84.18%。与此同时,XRP价格约为3.66美元的历史高点(2025年7月)低约71.7%。 当前市场焦点集中在1美元至1.06美元区间。这主要源于网络活动增加、大额持币者增持以及衍生品市场头寸变化。数据显示,过去一周大型持有者累积了超过3.8亿枚XRP,且月度图表上的Tom DeMark Sequential指标发出了买入信号。 背离现象部分源于XRP在逼近1美元高流动性区域时,未平仓合约兴趣上升,而现货交易量受限。若价格能守住1美元并重返1.06美元上方,当前头寸布局或支撑价格尝试反弹。反之,若跌破1美元,可能引发杠杆多头头寸的强平压力,尤其是在资金费率持续为正的背景下。 衍生品数据显示,自6月底以来,XRP资金费率多数时间为正,表明永续合约市场中多头头寸总体超过空头。尽管价格自6月中旬的1.20美元上方跌至8月12日的0.90美元,这种多头倾向依然存在,导致价格与衍生品头寸间出现脱节。 技术指标依然疲软。14日RSI为35.97,低于其均线39.95和中性水平50。MACD指标也呈负值,MACD线位于信号线下方,柱状图为负,显示看跌动能尚未扭转。 关键价位方面,守住1美元是测试1.06美元阻力的前提,据称该位置曾有近30亿XRP的交易记录。若失守1美元,代币可能进一步跌向0.98美元乃至0.93美元的流动性区域。

cryptonews.ru9分钟前

XRP活跃地址数激增84%,价格较历史高点下跌72%

cryptonews.ru9分钟前

交易

现货

热门文章

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对SOL(SOL)币价的意见。

活动图片