Quá nổ tung.
Ngay vừa rồi, lần đầu tiên trong lịch sử, NVIDIA đã công bố dữ liệu thử nghiệm trên chip đầu tiên cho tủ máy flagship thế hệ tiếp theo của họ - Vera Rubin NVL72.
Và, lần thử nghiệm này trực tiếp mời đến DeepSeek -V4-Pro, chạy tác vụ "mã hóa tác nhân" thực tế nhất!
Kết quả đáng kinh ngạc: So với ông vua máy chủ hiện tại là GB300 NVL72, thông lượng trên mỗi megawatt của Vera Rubin tăng vọt cao nhất 30 lần, chi phí cho mỗi Token giảm mạnh nhất 35 lần!

Có người thốt lên: "Ngay cả bản trình bày PPT để gọi vốn đầu tư tôi còn không dám viết như vậy!"
Còn có bình luận thần thánh từ cư dân mạng: "Trước đây còn chê H200 ba mươi nghìn đô một tấm là đắt, giờ nhìn lại, H200 hóa ra còn chưa được tính là phiên bản rút gọn."

Hãy cùng phân tích kỹ một chút.
Từ H200 đến GB300, thông lượng của khối lượng công việc Agent thực tế đã tăng cao nhất 30 lần, chi phí tăng gấp đôi đại khái.
Từ GB300 đến Vera Rubin, thông lượng lại tăng vọt cao nhất 30 lần nữa, giá cả tủ máy đại khái lại tăng gấp đôi.
Theo định luật Moore của ông Hoàng, vậy là trong hai năm qua, đột phá công nghệ lớn nhất của NVIDIA không phải là bản thân GPU, mà là khiến giá cả đắt hơn 4 lần, nhưng đổi lại được tốc độ tăng vọt đến tận 900 lần!

Lần này, NVIDIA tuyên bố với tất cả mọi người một sự thật phản trực giác: Thời đại LLM kết thúc, thời đại Agent đến, tất cả các điểm chuẩn chạy AI trước đây, đều bị bãi bỏ!

Đồng thời, CPU Vera chuyên biệt cho tác nhân thông minh, đã được SpaceXAI của Elon Musk lắp đặt ngay trong đêm, thậm chí chuẩn bị đưa thẳng lên vũ trụ.
Cùng ngày hôm nay, NVIDIA Groq 3 LPX cũng đã sản xuất hàng loạt toàn diện.
Gemma 4 31B chạy trên đó, tốc độ thật tuyệt vời, đạt thẳng đến 3400 Token mỗi giây. Thông lượng của mô hình nghìn tỷ tham số, tăng vọt 35 lần.


Những kỷ lục mới này, trực tiếp khiến cục diện thương mại của hệ sinh thái Agent, bắt đầu từ đêm nay, được viết lại!
Tại sao NVIDIA phải ra mắt Vera Rubin?
Dữ liệu mới nhất từ OpenRouter đã đưa ra câu trả lời: Trong thế giới thực, số lượng Token mà một tác vụ AI Agent tiêu thụ, gấp 15 lần so với cuộc trò chuyện tán gẫu thông thường!
Ví dụ, nếu để một Agent nghiên cứu một công ty cho quyết định đầu tư, trong quá trình này, tác nhân thông minh và các tác nhân con sẽ liên tục suy luận, Token tích lũy trở thành đầu vào cho bước tiếp theo, xử lý ngữ cảnh dài, trở thành yếu tố then chốt nhất hạn chế AI tác nhân.

Số lần tương tác của Agent càng nhiều, thông lượng càng lớn – số lượng Agent tăng 10 lần, việc gọi công cụ tăng 2 lần, mâu thuẫn giữa sức mạnh tính toán và thuật toán thúc đẩy nhu cầu mới.

Đừng lấy trò chuyện làm Agent, điểm chuẩn cũ toàn bộ bỏ đi!
Lúc này, các bài kiểm tra điểm chuẩn AI truyền thống (như kiểm tra chuỗi độ dài cố định 8K/1K) trở nên hoàn toàn vô hiệu.
NVIDIA chính thức nói rõ: Đo lường hiệu suất phải tiến hóa! Không thể chỉ kiểm tra một yêu cầu suy luận đơn lẻ nữa, mà phải nắm bắt toàn bộ quy trình làm việc của Agent.
Vì lý do này, họ đã sử dụng bài kiểm tra điểm chuẩn AgentX thuộc sở hữu của SemiAnalysis.
Bài kiểm tra này không còn là hỏi đáp cứng nhắc, mà là phát lại "phiên làm việc viết mã" thực tế, có sự phát triển ngữ cảnh, gọi công cụ và tạo ra các tác nhân con.

Đây là lý do tại sao H200 tỏ ra bất lực trong chiến trường Agent mới, Vera Rubin chắc chắn sẽ xưng vương.
Vera Rubin NVL72 × DeepSeek-V4-Pro:
Quái vật sức mạnh tính toán đã đến
Để chứng minh sức mạnh của Vera Rubin NVL72, NVIDIA trực tiếp sử dụng vương giả mã nguồn mở – DeepSeek -V4-Pro (1.6T) để thử nghiệm trên chip.
Dữ liệu vừa ra, kết quả kinh ngạc –
Dưới khối lượng công việc AgentX, thông lượng trên mỗi megawatt của Vera Rubin NVL72, so với GB300 NVL72 cao nhất đã tăng lên đúng 30 lần!

Xin lưu ý, ở đây so sánh không phải với H200 cũ kỹ, mà là GB300 nóng hổi hiện tại.
GB300 trong cùng bài kiểm tra DeepSeek -V4-Pro, thông lượng trên mỗi megawatt đã tăng 15 lần so với H200.
Thế nhưng Vera Rubin lại trên vai của GB300, lại nâng cao thêm 30 lần, trên toàn bộ đường cong Pareto lại cải thiện thêm!
Điều này có nghĩa là gì?
Đối với "nhà máy AI" bị hạn chế bởi nguồn cung điện lực, điều này trực tiếp mở rộng ranh giới của định luật vật lý.
Với cùng ngân sách điện năng, Vera Rubin có thể làm gấp 30 lần công việc của Agent.
Đối với trung tâm dữ liệu cấp megawatt thậm chí gigawatt, điều này tương đương với việc biến ra tài sản sức mạnh tính toán gấp 30 lần từ hư không.
Hơn nữa, công nghệ NVIDIA DSX MaxLPS có thể quản lý nguồn điện ở cấp độ GPU, tủ máy và khối lượng công việc, có thể cấu hình thêm tới 40% GPU trong cùng ngân sách megawatt, giúp nhà máy AI nâng cao hơn nữa thông lượng trên mỗi megawatt!

Chi phí Token giảm mạnh 35 lần! "Sổ sách" của ngành Agent hoàn toàn được viết lại
Thông lượng trên mỗi megawatt, ảnh hưởng trực tiếp chính là chi phí cho mỗi token được tạo ra. Hiệu suất tăng vọt, hậu quả trực tiếp nhất mang lại chính là mô hình kinh doanh nổ hạt nhân.
NVIDIA tuyên bố, Vera Rubin NVL72 sản xuất chi phí cho mỗi triệu Token, so với GB300 NVL72 cao nhất đã giảm 35 lần!

Khi chi phí suy luận giảm mạnh 35 lần, nhân viên kỹ thuật số làm việc 24/7 không nghỉ sẽ trở thành hiện thực, ứng dụng siêu cấp phía người dùng cuối (ToC) sẽ đón nhận sự bùng nổ lớn.
Ông Hoàng một nhát dao này, trực tiếp cắt mở cánh cửa thời đại ứng dụng Agent.

Thiết kế hiệp đồng cực đỉnh: Ông Hoàng đã làm thế nào?
Bạn có thể hỏi: Dựa vào cái gì mà có thể tăng tốc 30 lần? Dựa vào quy trình của một con chip đơn lẻ sao?
Rõ ràng là không.
Hiệu suất tăng đáng kinh ngạc của Vera Rubin NVL72, dựa vào "thiết kế hiệp đồng cực đỉnh".

Ví dụ như dịch vụ tách biệt, bộ nhớ đệm KV phân tán, định tuyến nhận thức KV, MegaMoE v.v.

Ngoài ra, lượng tử hóa NVFP4 trực tiếp nén trọng số mô hình xuống độ chính xác 4 bit, trong khi không hy sinh chất lượng đầu ra, giảm mạnh chiếm dụng bộ nhớ, khiến thông lượng cất cánh tại chỗ.
Mà NVLink thế hệ thứ sáu cùng với mô hình lớn MoE, cung cấp mạng lưới kết nối nhanh hơn 10 lần so với Ethernet có sẵn, độ trễ thấp hơn 3 lần, cho phép mô hình lớn dựa trên kiến trúc MoE như DeepSeek , có thể điều động các mạng con "chuyên gia" khác nhau giữa 72 GPU một cách trôi chảy như mây nước.
Đây đã không còn là bán card đồ họa, ông Hoàng đang bán cả một "nhà máy phát điện AI".

NVIDIA Groq 3 LPX sản xuất hàng loạt toàn diện:
3400 Token/giây, Agent mã nguồn biến đổi trời!
Tại hội nghị Hot Chips 2026 lần này, NVIDIA còn tung ra một tin chấn động: Groq 3 LPX bắt đầu sản xuất hàng loạt toàn diện!

Groq 3 LPX, là phần mở rộng chuyên biệt cho nền tảng trung tâm dữ liệu Vera Rubin NVL72.
Nó được "thiết kế riêng" cho hệ thống này, chủ đạo chính là tăng tốc suy luận độ trễ thấp.
Công nghệ đen này, là vào tháng 12 năm ngoái NVIDIA đã mạnh tay chi 20 tỷ USD mua lại từ công ty khởi nghiệp Groq.

AI tác nhân thông minh sẽ gặp vấn đề độ trễ giải mã, để chấm dứt điểm đau này, Groq 3 LPX đã khéo léo tách biệt hoàn toàn việc xử lý ngữ cảnh khổng lồ với việc tạo ra Token.
Giải pháp của NVIDIA là, để GPU Rubin xử lý ngữ cảnh quy mô lớn, giao nhiệm vụ tạo Token cực nhanh cho Groq 3 LPX.
Một cái quản "đọc", một cái quản "viết", mỗi cái làm việc mình giỏi nhất.

Trong một triển khai cấp tủ máy hoàn chỉnh, có tới 256 bộ gia tốc LP30 có thể thông qua kết nối băng thông cực cao phối hợp tác chiến với GPU, tạo ra động cơ suy luận quy mô doanh nghiệp.

Từ đó, Groq 3 LPX đạt thẳng tốc độ đầu ra phá kỷ lục.
Trong bài kiểm tra điểm chuẩn của Artificial Analysis, Groq 3 LPX chạy Gemma 4 31B dưới cửa sổ ngữ cảnh siêu dài 10 vạn Token, tốc độ đầu ra đạt mức kinh ngạc 3.400 Token/giây!
Điều này khiến nó trong khối lượng công việc cực kỳ nhạy cảm với độ trễ, tốc độ phản hồi nhanh hơn 4 lần so với đối thủ cạnh tranh.

Trước đây mất vài giờ mới hoàn thành được nhiệm vụ tác nhân thông minh nhiều bước, giờ chỉ trong vài phút là hoàn thành!

Groq 3 LPX tạo ra 5000 Token, thời gian sử dụng từ 50 giây giảm xuống còn 1.5 giây, chênh lệch 34 lần.

Và trong nhiệm vụ mã hóa, tốc độ đầu ra lớn nhất của Groq 3 LPX là 6981 token/s.

Jensen Huang nói thẳng, thông qua LPX thúc đẩy việc tạo Token siêu tốc, đã đạt được "một bước nhảy vọt khổng lồ nữa" trong khả năng phản hồi và thông lượng AI.

Nebius đã triển khai con chip này trong Nebius Token Factory, cho phép mỗi bước trong vòng lặp tác nhân thông minh đều có được trải nghiệm cực đỉnh phản hồi tức thì.

Theo sát ngay sau đó, còn có chính Groq.

CPU chuyên biệt đầu tiên dành cho Agent ra mắt,
Elon Musk ngay trong đêm "đưa lên vũ trụ"!
Trong lần công bố chính thức này, nước cờ tham vọng nhất, chính là CPU Vera.
Vì Agent, NVIDIA đã đặc biệt chế tạo một con CPU.
CPU Vera này, chính là chuyên để nuôi no tác nhân thông minh,
Nó được trang bị 88 lõi Olympus tự nghiên cứu, bộ nhớ LPDDR5X băng thông cao, băng thông thẳng đến 1.2TB/s.

Tại sao thời đại mô hình lớn cần CPU hoàn toàn mới?
Tại hiện trường Hot Chips, quản lý cao cấp CPU Vera của NVIDIA nói thẳng, "Agentic AI là nhiệm vụ tính toán phức tạp nhất trong lịch sử".

Một lần nhiệm vụ, phía sau Agent phải chạy hàng trăm bước: gọi công cụ, thực thi mã Python, lật ngữ cảnh, xử lý dữ liệu biển cả....
Những việc chạy vặt điều phối này, tất cả đều đè nặng lên CPU. Do đó, NVIDIA phải đặc biệt chế tạo một con CPU cho Agent.
Chính vì nhìn thấy điểm này, SpaceXAI của Elon Musk ngay trong đêm tuyên bố, chính thức triển khai quy mô hóa CPU Vera của NVIDIA!
Ngay từ tháng 5 năm nay, NVIDIA đã lặng lẽ gửi mẫu Vera đầu tiên, đến A社, OpenAI, SpaceXAI để "thử nước" trước.
Chỉ 3 tháng sau, SpaceXAI đã nóng lòng muốn chuyển nó sang triển khai toàn diện.
Điên cuồng hơn, SpaceXAI đang xây dựng nhà máy sức mạnh tính toán cấp gigawatt dựa trên nền tảng Vera Rubin, dùng để vận hành Grok.
Không chỉ vậy, sức mạnh tính toán này, còn phải được đưa thẳng lên vũ trụ.
Elon Musk biểu thị, "hai công ty mạnh mẽ hợp tác, đã thiết kế một phiên bản tối ưu hóa của Vera Rubin NVL72, sẽ được triển khai quy mô lớn vào năm 2028".

Thế hệ đầu tiên vệ tinh AI "Starmind" của SpaceXAI, dự định sử dụng hệ thống cấp tủ máy Vera Rubin NVL72.

Từ một GPU, đến toàn bộ nhà máy Agent
Cùng một ngày, hai con chip lớn CPU Vera và Groq 3 LPX, sản xuất hàng loạt toàn diện.
Điều này đối với NVIDIA mà nói, ý nghĩa trọng đại.

Thời đại mô hình lớn, NVIDIA dựa vào GPU chiếm lĩnh huấn luyện và suy luận.
Thời đại Agent, lãnh thổ của nó đã mở rộng đến CPU, bộ gia tốc suy luận, NVLink v.v.
Ông Hoàng bán, đã không còn chỉ là một GPU.
Ông ấy muốn bán, là một nhà máy AI có thể không ngừng sản xuất Token.
Ông Hoàng lần này, là muốn trải lại một lần nền móng cho toàn bộ "thời đại Agent".
Tài liệu tham khảo:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Bài viết này đến từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục





