Rubin Ultra大减配,英伟达也扛不住内存涨价了?

Odaily星球日报發佈於 2026-08-03更新於 2026-08-03

文章摘要

知名投研机构SemiAnalysis近日报告指出,英伟达已向主要客户预览了其顶级AI芯片Rubin Ultra的最新规格,但相比此前预期出现显著降配。核心变化包括:算力峰值保持与普通版Rubin相同的35 PFLOPs;显存容量降至8层堆叠的192GB,甚至低于普通版的288GB;显存带宽仅微升1TB/s;芯片功耗反而略有提高。Rubin Ultra的主要升级方向转向“扩展互联规模”,支持通过NVLink将最多576张GPU互联成统一计算域,远高于普通版的72张。 报告分析认为,此次调整主要源于HBM(高带宽内存)价格持续快速上涨。以HBM3为例,其价格已从2025年二季度的低点180-220美元,飙升至目前约700-850美元。HBM成本飙升使得Rubin Ultra单机架的物料成本一度从约660万美元升至800万美元。英伟达因此重新评估设计,通过减少昂贵的HBM配置(成本占比从近40%降至28%),将资源更多投入互联能力等方向,优化整体成本结构。 此消息引发市场对HBM需求见顶的担忧。受冲击影响,韩国存储股开盘大跌,SK海力士、三星股价均下挫约8%。市场解读认为,若英伟达此举成为趋势,意味着AI芯片厂商可能开始通过优化设计来降低对高容量HBM的依赖,这或将限制存储厂商未来的提价空间,标志着AI基础设施的“堆料涨价”时代可能接近尾声。

原创 | Odaily 星球日报(@OdailyChina)

作者|Azuma(@azuma_eth)

过去的这个周末,知名投研机构 SemiAnalysis 的一篇机构报告在整个 AI 行业掀起了巨大讨论。

报告的核心内容为,继 SemiAnalysis 六月底透露英伟达(NVIDIA)原版的 4 裸片(4-die)Rubin Ultra 设计将被砍半之后,该投研机构再次透露,英伟达已向主要客户提供了 Rubin Ultra 预览,但其规格较此前预期进一步下降。

SemiAnalysis 报告中流出的 Rubin Ultra 相关信息截图如下:

  • Rubin Ultra 将保持与 Rubin 相同的算力理论峰值,均为 35 PFLOPs;
  • 显存容量严重减配,规格降至 8 层堆叠(8-Hi)的 192GB,甚至低于 12 层堆叠(12-Hi) 288GB 的 Rubin;
  • 显存带宽变化微乎其微,只提升了 1 TB/s,在实际高吞吐计算中基本可以忽略不计;
  • 芯片级功耗甚至略有提高,最低功耗与 Rubin 相同(1800 W),最高功耗反而更高(2600 W);
  • 唯一的重大提升是“扩展互联规模”(Scale-up world size),从 72 张 GPU 提高到了 576 张 GPU,这意味着 NVIDIA 把真正的卖点转移到了集群网络上,通过 NVLink 网络,它可以把最多 576 张 Rubin Ultra 连成一个巨大的“超级逻辑 GPU”(普通版最高只支持 72 张卡互联)。

作为英伟达今年在 GTC 2026 上重磅官宣的 Rubin 顶级旗舰版本,Rubin Ultra 原本的定位是通过整合更多芯片裸片(die)和高带宽内存,专为应对极致规模的 AI 模型训练与推理需求而设计,但从 SemiAnalysis 最新披露的规格细节来看,英伟达显然已经调整了 Rubin Ultra 的设计思路。

HBM 涨价太快,英伟达开始重新算账

过去两年,AI 产业扩展中最关键的组件之一无疑是 HBM。

随着 Nvidia H100、H200、Blackwell 等 AI 加速器的需求大爆发,高带宽内存从此前相对小众的高端存储产品,成为整个 AI 基础设施中最紧缺的环节。SK 海力士、三星、美光在不断刷新也业绩的同时纷纷扩大 HBM 投入,而市场供需的失衡仍在不断推动着 HBM 价格持续上涨。

对于 AI 芯片厂商而言,HBM 的重要性不言而喻 —— GPU 负责计算,HBM 负责提供高速数据吞吐,两者共同决定 AI 模型训练和推理效率,但问题在于,如今的 HBM 已经贵到开始影响 AI 系统整体经济性。以 HBM3 为例,一颗 HBM3 的价格在 2025 年 Q2 低点仅有 180-220 美元,今年 Q1(合约价)则已涨至 600-700 美元,Q2(现货价)更是涨至 700 - 850 美元。

根据 SemiAnalysis 的测算,随着 HBM 价格上涨,Rubin Ultra 单机架纯物料(BOM)成本一度从约 660 万美元升至 800 万美元,而在调整设计规格后,成本可回落至约 640 万美元。

对于英伟达而言,如此巨大的成本差异意味着一个非常现实的现实问题 —— 如果继续依照原设计增加 HBM 容量,是否还能带来与成本匹配的性能提升?有没有其他的更优方案?

SemiAnalysis 在报告中对此给出了回答,Rubin Ultra 的调整,本质上其实是英伟达在有限资源下重新优化 AI 系统的成本结构,即减少相对昂贵的 HBM 配置(成本占比从接近 40% 降到 28%),将资源投入到更高价值的扩展互联能力上(成本占比从 4% 升到 12%)。

如前文所述,Rubin Ultra 的核心核心升级方向现已经转向为“系统级的扩展互联能力”。Rubin Ultra 支持的 NVL576 架构,可以通过 NVLink 将最多 576 颗 GPU 连接成为一个统一计算域,旨在以更大规模的系统扩展,弥补单颗芯片规格上的调整。

存储股大跌,市场担忧需求见顶

或受此消息冲击,今晨韩股开盘后存储概念集体下行,截至北京时间 11:45,SK 海力士、三星两大 HBM 龙头双双大跌约 8%,KOSPI 指数亦下跌约 5%。

市场已开始担忧,如果 SemiAnalysis 所透露的 Rubin Ultra 规格调整为实(英伟达暂未公开确认相关信息),是否意味着 —— 英伟达作为 AI 基础设施中最核心的买家,正在降低对 HBM 的需求?

过去两年,随着 AI 扩展需求的快速增长,HBM 已成为了 AI 基础设施中最紧缺部分,英伟达、AMD 等芯片厂商持续提升 AI 加速器中的 HBM 配置,推动了 SK 海力士、三星、美光等存储厂商的业绩暴涨,也不断强化着后者在整条产业链上的定价权。

而英伟达的选择,可能意味着 AI 芯片厂商正在考虑通过优化硬件设计,降低单颗芯片对于高容量 HBM 的依赖。如果这条路被证明可行,那么 HBM 厂商持续提价的空间极有可能会受到限制。

AI 的基础设施建设迟早会告别“疯狂堆料与无脑涨价”的时代,而现在,即便是站在算力铁王座上的英伟达,也已经开始精打细算了。

相關問答

Q根据SemiAnalysis的报告,英伟达Rubin Ultra相比原计划在哪些关键规格上进行了减配?

A根据报告,Rubin Ultra的减配主要体现在:1. 算力理论峰值与基础版Rubin相同,均为35 PFLOPs,没有提升;2. 显存容量严重减配,降至8层堆叠的192GB,甚至低于12层堆叠288GB的基础版Rubin;3. 显存带宽提升微乎其微,仅增加1 TB/s;4. 芯片级功耗反而略有提高。

Q为什么英伟达要调整Rubin Ultra的设计,选择减少HBM配置?

A英伟达调整设计的主要原因是HBM价格快速上涨,导致AI系统整体物料成本飙升。根据SemiAnalysis的测算,原设计单机架成本从约660万美元升至800万美元。为了优化成本结构,英伟达减少昂贵的HBM配置(成本占比从近40%降至28%),并将资源投入到扩展互联能力等更具性价比的方向。

QRubin Ultra规格调整后,其核心升级方向是什么?

A规格调整后,Rubin Ultra的核心升级方向转向了“系统级的扩展互联能力”。具体来说,它支持NVL576架构,可以通过NVLink网络将最多576张GPU连接成一个巨大的“超级逻辑GPU”,旨在通过更大规模的系统集群扩展来弥补单卡规格上的调整。

Q英伟达Rubin Ultra设计规格可能调整的消息,对市场产生了什么影响?

A该消息引发了市场对HBM需求见顶的担忧。消息传出后,韩国存储股应声大跌,SK海力士和三星两大HBM龙头均下跌约8%。市场担心,如果英伟达作为核心买家开始减少对高容量HBM的依赖,那么HBM厂商持续提价的空间将受到限制。

Q根据文章,HBM价格在近期的具体涨幅如何?

A文章指出,以HBM3为例,其价格在2025年第二季度低点时仅为180-220美元。进入2026年,第一季度合约价已涨至600-700美元,而第二季度现货价更是涨至700-850美元,价格在一年左右的时间内翻了数倍。

你可能也喜歡

WEEX API Fast Connect:10秒内将每次登录转化为实盘交易者

WEEX宣布推出API快速连接(API Fast Connect),一种一键式OAuth授权系统。该系统允许用户无需手动处理API密钥即可关联其WEEX账户。该解决方案专为WEEX经纪商合作伙伴设计,旨在通过无缝的一键体验取代传统复杂的技术接入流程,从而在合作伙伴平台上实现更快的用户转化和更强的长期留存。 **核心要点:** * **功能:** 类似“使用Google登录”的一键授权系统,让用户无需创建或管理API密钥即可将其WEEX账户连接到第三方平台。 * **解决问题:** 手动API密钥设置是阻碍潜在用户成为活跃交易者的最大障碍。快速连接彻底消除了这一步骤。 * **获益:** 实现无摩擦转化,降低用户流失,提高留存率,使用户能在数秒内(而非数分钟)从登录进入实盘交易。 * **目标用户:** AI信号平台、量化策略工具、交易机器人以及任何目前需要用户手动配置API访问的WEEX经纪商合作伙伴。 **运作流程:** 1. 用户在合作平台点击“使用WEEX登录”。 2. 系统重定向至官方WEEX授权页面进行验证。 3. 用户确认API密钥的授权范围(默认为交易和读取权限)。 4. 确认后,系统在后台生成API密钥并通过加密通道直接绑定至合作平台。 **优势对比:** 与传统手动API密钥方式相比,快速连接在用户体验(一键操作 vs 手动碎片化流程)、权限管理(预设防错 vs 易出错)、密钥安全(后端加密,用户不接触密钥 vs 前端暴露高风险)和连接速度(即时绑定 vs 手动复制粘贴)方面均有显著提升。 API快速连接是WEEX经纪商工具包的核心组件之一,旨在帮助合作伙伴将感兴趣的用户迅速转化为实际交易者。

TheNewsCrypto6 分鐘前

WEEX API Fast Connect:10秒内将每次登录转化为实盘交易者

TheNewsCrypto6 分鐘前

生成模型也能端到端训练了?核心竟是一个for循环

长期以来,深度学习在图像分类、检测等任务上凭借端到端训练取得了巨大成功,但生成模型领域却始终是个例外。当前主流的自回归、扩散模型等训练时只学习预测“一小步”,推理时则需要反复展开数百上千步,这种训练与推理的不一致导致了“暴露偏差”等问题,使得生成模型一直未能实现真正的端到端训练。 最近,一篇来自UIUC与哈佛大学的论文提出了“探索式建模(Explorative Modeling,XM)”新范式,其核心是一个简单到近乎朴素的for循环:在每个训练步骤中,模型生成K个候选样本,然后仅选取其中最接近真实数据的一个样本来计算损失和回传梯度。这种做法巧妙地绕开了传统生成模型中因使用重构损失(如平方误差)而导致的“模态模糊”问题——即模型倾向于输出多个可能答案的平均值,而这个平均值往往不属于任何真实的数据模式。 XM通过这种方式,在不拆分生成过程的前提下,直接提升了模型的“生成表达力”,即模型捕捉数据分布中多个独立模式的能力。论文将“探索”验证为继模型参数量、数据量之后的第三根可扩展轴。实验表明,随着模型规模、数据量和计算量的增大,探索带来的性能收益越发显著,在图像、视频、语言等多种任务上均能带来效率与质量的提升。 更重要的是,当探索程度足够时,XM可以实现真正的端到端生成。在机器人控制等任务中,仅需一次网络前向传播的XM策略,其性能可媲美甚至超过需要上百次前向的扩散模型策略,实现了推理效率的飞跃。 尽管“最佳K样本选择”的思想并非全新,但该研究的贡献在于清晰地揭示了这一简单机制如何直接解决生成模型的核心瓶颈,并为实现高效、端到端的生成模型开辟了新的可能性。随着模型规模的持续扩大,探索这一新维度可能将发挥越来越关键的作用。

marsbit2 小時前

生成模型也能端到端训练了?核心竟是一个for循环

marsbit2 小時前

交易

現貨
活动图片