AI bắt đầu cuộc chạy đua về sự bất cân xứng thông tin?
Vào lúc rạng sáng ngày 14 tháng 8, OpenAI cùng với nhà sản xuất chip AI Cerebras đã chính thức ra mắt bản xem trước cấp dịch vụ mới "Chế độ Siêu tốc" (Ultrafast Mode) cho mô hình hàng đầu của họ, GPT-5.6 Sol.
Trong chế độ này, tốc độ xuất (output) của GPT-5.6 Sol có thể lên tới 750 tokens/s, so với đường cơ sở suy luận khoảng 53 tokens/s của chế độ Standard (Tiêu chuẩn) hiện tại, tốc độ được cải thiện tối đa lên 14 lần, đồng thời không làm giảm bất kỳ chất lượng nào. So sánh ngang hàng, GPT-5.6 Sol sau khi tăng tốc nhanh hơn Fable 5 gấp 11 lần, và nhanh hơn Opus 4.8 ở chế độ Fast gấp 5 lần.
Chế độ Ultrafast sẽ được ra mắt đầu tiên trong OpenAI API, hiện đã có phiên bản xem trước giới hạn cho một số khách hàng.

Để làm điều này, OpenAI và Cerebras còn lập một bảng so sánh tốc độ và trí tuệ hiện tại của các mô hình AI lớn tiên tiến, trong đó GPT-5.6 Sol Ultrafast đang ở vị trí dẫn đầu tuyệt đối:

Trong blog của Cerebras, các kỹ sư đã giới thiệu về bài kiểm tra được thực hiện trên "Kỳ thi Cuối cùng của Nhân loại" (Humanity's Last Exam, HLE), nơi họ so sánh mô hình sau khi Ultrafast với các đối thủ cạnh tranh trực tiếp. Chúng ta biết rằng HLE là một điểm chuẩn (benchmark) mô hình đầy thách thức, bao gồm 2500 câu hỏi, thường chỉ có các tiến sĩ trong các lĩnh vực như hóa học, kinh tế học và văn học mới có thể giải đáp.
GPT-5.6 Sol ở chế độ siêu tốc chỉ mất 11 giờ 11 phút để trả lời tất cả các câu hỏi. Trong khi đó Claude Fable 5 cần 78 giờ 27 phút, tức là hơn ba ngày tính toán liên tục để đưa ra kết luận tương tự. Chế độ siêu tốc của GPT chỉ mất một ngày làm việc để hoàn thành lĩnh vực tiên phong của tri thức nhân loại, với độ chính xác tương đương, tốc độ nhanh gấp gần 7 lần so với Claude Fable.

Khi khả năng của mô hình ngày càng được nâng cao, phạm vi ứng dụng của việc suy luận nhanh cũng sẽ mở rộng. GPT-5.6 Sol là mô hình hoạt động tốt nhất của OpenAI cho đến nay trong các lĩnh vực như văn bản pháp lý, mô hình tài chính và báo cáo kỹ thuật. Trên GDP-Val (một điểm chuẩn đo lường các nhiệm vụ công việc tri thức có giá trị kinh tế), Ultrafast đạt được mức tăng tốc độ đầu-cuối (end-to-end) gấp 5.6 lần, và chất lượng không bị ảnh hưởng, thể hiện đầy đủ việc tốc độ suy luận nhanh hơn có thể đẩy nhanh việc triển khai các công việc có giá trị kinh tế như thế nào.

Xử lý AI nhanh hơn mang lại nhiều khả năng mới cho các quy trình làm việc mới nổi, giờ đây mọi người có thể triển khai các tác nhân (agent) vào đường dẫn quan trọng của vấn đề. OpenAI liệt kê một số ứng dụng cho bạn:
- Ứng phó sự kiện và độ tin cậy: Khi hệ thống quan trọng gặp sự cố, AI phân tích nhật ký ứng dụng, các thay đổi mã gần đây và báo cáo của kỹ sư để xác định nguyên nhân có thể xảy ra, và hỗ trợ chuẩn bị phương án khắc phục trong khi sự cố vẫn đang diễn ra.
- Nghiên cứu và an ninh tài chính: Phân tích tín hiệu thị trường, đánh giá giao dịch và xác định hoạt động đáng ngờ trong bối cảnh tình hình thị trường thay đổi nhanh chóng.
- Hỗ trợ khách hàng và giọng nói: Giải quyết các vấn đề phức tạp của khách hàng trong thời gian thực, ngay cả khi tìm câu trả lời cần nhiều bước hoặc hệ thống, mà không làm gián đoạn cuộc trò chuyện.
- Thương mại: Trả lời câu hỏi về sản phẩm, kiểm tra tồn kho, cá nhân hóa đề xuất và giải quyết vấn đề thanh toán khi người mua sắm vẫn đang do dự, tránh để sự do dự biến thành việc bỏ giỏ hàng.
- Nghiên cứu và thí nghiệm thời gian thực: Biến nghiên cứu trước đây cần cả đêm để hoàn thành thành các cuộc họp công việc tương tác, cho phép nhóm kiểm tra ý tưởng, xem xét kết quả, điều chỉnh phương pháp và tiến hành một thí nghiệm khác mà không làm gián đoạn quy trình làm việc.
Nội bộ OpenAI, các nhà phát triển đã thử nghiệm GPT-5.6 Sol ở chế độ siêu tốc, ứng phó sự kiện là một ví dụ sử dụng Ultrafast. Khi báo động được kích hoạt, các kỹ sư cần xây dựng bức tranh chính xác về sự kiện trong khi hệ thống và bằng chứng vẫn đang thay đổi. Với trí thông minh cấp độ Sol, nhóm có thể nhanh chóng đọc nhật ký, phân tích thông tin dấu vết, tóm tắt cuộc trò chuyện, xác định bước kiểm tra tiếp theo và hỗ trợ chuẩn bị hoặc xác minh phương án khắc phục. Chế độ Ultrafast rút ngắn độ trễ từ quan sát tín hiệu, xác minh giả thuyết đến lựa chọn hành động tiếp theo, trong khi các kỹ sư vẫn chịu trách nhiệm phán đoán và triển khai.
Về mặt nghiên cứu, đội ngũ OpenAI sử dụng Ultrafast để nhanh chóng tìm kiếm cơ sở kiến thức, truy vấn dữ liệu, và nhanh chóng thu thập, sắp xếp và tổng hợp thông tin từ các công cụ khác nhau. Quy trình phổ biến trước đây trong nghiên cứu là các thành viên nhóm khởi động một loạt thí nghiệm vào ban đêm và xem kết quả vào sáng hôm sau. Với Ultrafast, quy trình khám phá có thể được rút ngắn, từ đó hỗ trợ nhiều lần lặp lại trong ngày làm việc.
Đột phá của chế độ Ultrafast nằm ở việc phá vỡ nút cổ chai băng thông bộ nhớ của các cụm GPU truyền thống trong giai đoạn giải mã suy luận của mô hình lớn, việc triển khai chủ yếu dựa vào kiến trúc phần cứng cấp wafer (tấm bán dẫn) của Cerebras.

Trong hàng ngũ các nhà sản xuất chip AI, giải pháp của Cerebras có một không hai: các thế hệ chip của họ được chế tạo từ cả một tấm wafer nguyên vẹn, tích hợp một lượng khổng lồ lõi tính toán và mạng lưới kết nối siêu tốc trên một chip đơn.
GPU truyền thống khi chạy quá trình sinh token giải mã tự hồi quy (autoregressive decoding) của mô hình lớn, bị giới hạn bởi băng thông bộ nhớ, cần liên tục di chuyển lượng trọng số mô hình khổng lồ qua lại giữa bộ nhớ HBM ngoài chip và các lõi tính toán; đồng thời việc chia cắt đa card còn mang lại độ trễ truyền thông kết nối liên chip (PCIe/NVLink).
Trong khi đó, mỗi chip cấp wafer mới nhất của Cerebras (WSE-3) tích hợp 4 nghìn tỷ bóng bán dẫn, 125 petaflops sức mạnh tính toán AI và lên đến 44 GB SRAM tốc độ cao trên chip, các tham số mô hình trực tiếp thường trú toàn bộ trong SRAM trên chip có băng thông cực cao, tránh được thời gian chờ đợi tải trọng số lặp đi lặp lại từ bộ nhớ ngoài chip.
Tất nhiên, GPT-5.6 Sol là một mô hình hàng đầu tiên phong, tổng số tham số đầy đủ rõ ràng vượt xa dung lượng chip. Cerebras còn có cơ chế "Song song đường ống đa wafer (Pipelined across wafers)", phân phối các lớp mạng khác nhau của mô hình lên nhiều wafer, mỗi tham số lớp thường trú trong SRAM của chip riêng, cho phép Token truyền liền mạch qua đường ống giữa các wafer.
Đối với nhiều người dùng mô hình lớn, tốc độ nhanh gấp 14 lần của mô hình hàng đầu sẽ có nghĩa là nhiều nhiệm vụ trước đây buộc phải chuyển sang mô hình cấp thứ cấp (như Luna và Terra) giờ có thể chạy trực tiếp với đầy đủ sức mạnh một cách yên tâm, đối với các nhiệm vụ Agent đòi hỏi nhiều vòng gọi công cụ, sinh mã gỡ lỗi và suy nghĩ chuỗi phức tạp, quy trình trước đây cần vài giờ có thể được nén xuống còn vài phút.
Tốc độ nhanh hơn có lẽ cũng có nghĩa là cách chúng ta sử dụng AI đang thay đổi:

Trong cộng đồng AI, mọi người đã mong đợi chế độ siêu tốc cho các phiên bản Luna và Terra rồi, chỉ không biết chip của Cerebras có đủ không.
Tài liệu tham khảo:
https://openai.com/index/previewing-ultrafast/
https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
Bài viết này từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注大模型的机器之心








