Bản gốc | Odaily Planet Daily(@OdailyChina)
Tác giả | Azuma(@azuma_eth)

Cuối tuần vừa qua, một báo cáo từ tổ chức nghiên cứu đầu tư nổi tiếng SemiAnalysis đã tạo ra cuộc thảo luận sôi nổi trong toàn ngành AI.
Nội dung cốt lõi của báo cáo là, sau khi SemiAnalysis tiết lộ vào cuối tháng 6 rằng thiết kế Rubin Ultra 4-điểm chết (4-die) nguyên bản của NVIDIA sẽ bị cắt giảm một nửa, tổ chức này một lần nữa tiết lộ rằng NVIDIA đã cung cấp bản xem trước Rubin Ultra cho các khách hàng chính, nhưng thông số kỹ thuật của nó đã giảm thêm so với dự kiến trước đó.

Các thông tin liên quan đến Rubin Ultra rò rỉ trong báo cáo SemiAnalysis được tóm tắt như sau:
- Rubin Ultra sẽ duy trì cùng đỉnh hiệu suất lý thuyết với Rubin, đều là 35 PFLOPs;
- Dung lượng bộ nhớ bị cắt giảm nghiêm trọng, quy cách giảm xuống còn 192GB với 8 tầng xếp chồng (8-Hi), thậm chí thấp hơn so với Rubin 288GB 12 tầng xếp chồng (12-Hi);
- Băng thông bộ nhớ thay đổi rất nhỏ, chỉ tăng 1 TB/s, về cơ bản có thể bỏ qua trong tính toán thông lượng cao thực tế;
- Mức tiêu thụ điện năng ở cấp chip thậm chí còn tăng nhẹ, mức tiêu thụ tối thiểu giống với Rubin (1800 W), mức tiêu thụ tối đa thậm chí còn cao hơn (2600 W);
- Nâng cấp quan trọng duy nhất là "Quy mô liên kết mở rộng" (Scale-up world size), từ 72 GPU được nâng lên 576 GPU, điều này có nghĩa là NVIDIA đã chuyển điểm bán hàng thực sự sang mạng lưới cụm, thông qua mạng NVLink, nó có thể kết nối tối đa 576 Rubin Ultra thành một "siêu GPU logic" khổng lồ (phiên bản tiêu chuẩn chỉ hỗ trợ tối đa 72 card kết nối).
Là phiên bản flagship hàng đầu của Rubin được NVIDIA công bố chính thức tại GTC 2026 năm nay, Rubin Ultra ban đầu được định vị là tích hợp nhiều điểm chết (die) và bộ nhớ băng thông cao hơn, được thiết kế riêng cho nhu cầu huấn luyện và suy luận mô hình AI quy mô cực lớn. Tuy nhiên, từ các chi tiết thông số kỹ thuật mới nhất được SemiAnalysis tiết lộ, rõ ràng NVIDIA đã điều chỉnh hướng thiết kế của Rubin Ultra.
HBM tăng giá quá nhanh, NVIDIA bắt đầu tính toán lại
Hai năm qua, một trong những thành phần then chốt nhất trong việc mở rộng ngành công nghiệp AI chắc chắn là HBM.
Với sự bùng nổ nhu cầu về các bộ tăng tốc AI như Nvidia H100, H200, Blackwell..., bộ nhớ băng thông cao từ một sản phẩm lưu trữ cao cấp tương đối thích hợp đã trở thành mắt xích khan hiếm nhất trong cơ sở hạ tầng AI. SK hynix, Samsung, Micron liên tục lập kỷ lục doanh thu và đồng loạt tăng đầu tư vào HBM, trong khi sự mất cân bằng cung cầu thị trường vẫn tiếp tục đẩy giá HBM tăng cao.
Đối với các nhà sản xuất chip AI, tầm quan trọng của HBM là không cần bàn cãi - GPU chịu trách nhiệm tính toán, HBM chịu trách nhiệm cung cấp thông lượng dữ liệu tốc độ cao, cả hai cùng quyết định hiệu quả huấn luyện và suy luận mô hình AI. Tuy nhiên, vấn đề nằm ở chỗ, HBM hiện nay đã trở nên đắt đỏ đến mức bắt đầu ảnh hưởng đến tính kinh tế tổng thể của hệ thống AI. Lấy HBM3 làm ví dụ, giá của một viên HBM3 trong quý 2 năm 2025 ở mức thấp chỉ có 180-220 USD, quý 1 năm nay (giá hợp đồng) đã tăng lên 600-700 USD, quý 2 (giá giao ngay) thậm chí đã tăng lên 700 - 850 USD.
Theo tính toán của SemiAnalysis, với việc giá HBM tăng, chi phí vật tư thuần (BOM) cho một giá đỡ đơn Rubin Ultra đã tăng từ khoảng 6,6 triệu USD lên 8 triệu USD, trong khi sau khi điều chỉnh thông số kỹ thuật thiết kế, chi phí có thể giảm xuống còn khoảng 6,4 triệu USD.
Đối với NVIDIA, sự chênh lệch chi phí lớn như vậy đồng nghĩa với một vấn đề thực tế rất rõ ràng - nếu tiếp tục tăng dung lượng HBM theo thiết kế ban đầu, liệu có còn mang lại hiệu suất tương xứng với chi phí? Có giải pháp tối ưu hơn nào khác không?
SemiAnalysis đã trả lời điều này trong báo cáo, sự điều chỉnh của Rubin Ultra, về bản chất thực ra là NVIDIA đang tối ưu hóa lại cơ cấu chi phí của hệ thống AI trong nguồn lực hạn chế, tức là giảm cấu hình HBM tương đối đắt đỏ (tỷ trọng chi phí giảm từ gần 40% xuống còn 28%), và chuyển nguồn lực sang khả năng kết nối mở rộng có giá trị cao hơn (tỷ trọng chi phí tăng từ 4% lên 12%).
Như đã đề cập trước đó, hướng nâng cấp cốt lõi của Rubin Ultra hiện đã chuyển sang "khả năng kết nối mở rộng cấp hệ thống". Kiến trúc NVL576 được Rubin Ultra hỗ trợ, có thể kết nối tối đa 576 GPU thông qua NVLink thành một miền tính toán thống nhất, nhằm mục đích bù đắp cho sự điều chỉnh thông số kỹ thuật trên một con chip đơn lẻ bằng cách mở rộng quy mô hệ thống lớn hơn.
Cổ phiếu lưu trữ lao dốc, thị trường lo ngại nhu cầu đạt đỉnh
Có thể do chịu tác động của thông tin này, sau khi thị trường chứng khoán Hàn Quốc mở cửa sáng nay, nhóm cổ phiếu lưu trữ đồng loạt giảm. Tính đến 11:45 giờ Bắc Kinh, SK hynix, Samsung hai gã khổng lồ HBM cùng giảm mạnh khoảng 8%, chỉ số KOSPI cũng giảm khoảng 5%.
Thị trường đã bắt đầu lo ngại, nếu thông số kỹ thuật điều chỉnh của Rubin Ultra mà SemiAnalysis tiết lộ là thật (NVIDIA chưa công khai xác nhận thông tin liên quan), liệu có nghĩa là - với tư cách là người mua cốt lõi nhất trong cơ sở hạ tầng AI, NVIDIA đang giảm nhu cầu đối với HBM?
Hai năm qua, cùng với sự tăng trưởng nhanh chóng của nhu cầu mở rộng AI, HBM đã trở thành phần khan hiếm nhất trong cơ sở hạ tầng AI. Các nhà sản xuất chip như NVIDIA, AMD liên tục nâng cấp cấu hình HBM trong bộ tăng tốc AI, thúc đẩy doanh thu bùng nổ của các nhà sản xuất bộ nhớ như SK hynix, Samsung, Micron, đồng thời cũng không ngừng củng cố quyền định giá của họ trong toàn bộ chuỗi ngành.
Và sự lựa chọn của NVIDIA có thể có nghĩa là các nhà sản xuất chip AI đang cân nhắc việc tối ưu hóa thiết kế phần cứng để giảm sự phụ thuộc của một con chip đơn lẻ vào HBM dung lượng cao. Nếu con đường này được chứng minh là khả thi, thì không gian để các nhà sản xuất HBM tiếp tục tăng giá rất có thể sẽ bị hạn chế.
Xây dựng cơ sở hạ tầng AI sớm muộn cũng sẽ nói lời tạm biệt với thời đại "chồng chất điên cuồng và tăng giá vô não", và bây giờ, ngay cả NVIDIA đứng trên ngai vàng sức mạnh tính toán, cũng đã bắt đầu tính toán chi li rồi.





