英伟达震撼首测Vera Rubin,DeepSeek吞吐暴涨30倍

marsbit发布于2026-08-25更新于2026-08-25

文章摘要

英伟达首次公布下一代旗舰机柜Vera Rubin NVL72的实测数据,使用DeepSeek-V4-Pro模型运行真实的智能体编码任务。结果显示,相比当前主力GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高提升30倍,每百万Token成本最高暴降35倍。 英伟达强调,传统AI基准测试已不适用于智能体时代。他们采用能模拟完整智能体工作流的AgentX基准进行测试,凸显了Vera Rubin在长上下文、工具调用等复杂任务上的优势。其性能飞跃得益于极致的协同设计,包括分离式服务、第六代NVLink互联、NVFP4量化等技术。 同时,英伟达宣布专为低延迟推理设计的Groq 3 LPX加速器全面量产。在与Vera Rubin协同工作时,它在Gemma 4 31B模型上实现了每秒3400个Token的破纪录输出速度,将智能体任务的完成时间从小时级缩短至分钟级。 此外,英伟达推出了首款为智能体专属设计的Vera CPU,配备88个自研核心和高带宽内存。SpaceXAI已宣布规模化部署该CPU,并计划将基于Vera Rubin的算力系统送上太空。 通过Vera Rubin平台、Groq LPX加速器和Vera CPU,英伟达正从提供单一GPU转向构建完整的“AI工厂”,旨在为整个智能体时代重塑算力基础。

太炸裂了。

就在刚刚,英伟达史上首次公布了下一代旗舰级机柜 Vera Rubin NVL72 的首次片上实测数据。

而且,这次实测直接拉来了 DeepSeek -V4-Pro,跑最真实的「智能体编码」任务!

结果令人吃惊:对比当前的主力机皇GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高飙升了30倍、Token成本最高暴降了35倍!

有人惊呼:「我连骗投资人的 PPT 都不敢这么写!」

还有网友神评:「以前嫌 H200 三万美元一张贵,现在回头一看,H200 居然连丐版都算不上了。」

让我们来仔细盘一盘。

从H200到GB300,真实Agent工作负载的吞吐量提升了最高30倍,成本大致翻倍。

从GB300到Vera Rubin,吞吐量再次飙升最高30倍,整机架价格大致再翻倍。

按照老黄的摩尔定律,合着这两年英伟达最大的技术突破不是GPU本身,而是让价格贵了4倍,却换来了整整900倍的速度飞跃!

这次,英伟达向所有人宣布了一个反常识的真相:LLM时代结束,Agent时代降临,以前的AI跑分基准,全部作废!

与此同时,专为智能体打造的Vera CPU,已被马斯克的SpaceXAI连夜装机,甚至准备直接打上太空.

同在今天,英伟达Groq 3 LPX也全面量产。

Gemma 4 31B在上面跑,速度简直绝了,直接干到每秒3400个Token。万亿参数模型吞吐,狂飙35倍。

这些新纪录,直接让Agent生态的商业格局,从今夜开始重写!

为什么英伟达必须推出Vera Rubin?

OpenRouter的最新数据给出了答案:在真实世界里,一个Agent AI任务消耗的Token数量,是普通聊天对话的15倍!

比如,如果让一个Agent为投资决策去研究一家公司,在这个过程中,智能体和子智能体会不断推理,累积的Token成为下一步的输入,长上下文处理,就成为限制智能体AI的最关键要素。

智能体交互次数越多,吞吐量越大——智能体数量多了10倍,工具调用多了2倍,算力和算法的矛盾催生了新的需求。

别拿聊天当智能体,旧基准全废了!

这时候,传统的AI基准测试(如固定长度的8K/1K序列测试)就彻底无效了。

英伟达官方挑明:性能测量必须进化!不能再测单一的推理请求,必须捕捉完整的Agent工作流。

为此,他们使用了SemiAnalysis 旗下的 AgentX 基准测试。

这个测试不再是死板的问答,而是回放真实的、具有上下文增长、工具调用和子智能体生成的「代码编写会话」。

这就是为什么H200在新的Agent战场上显得力不从心,Vera Rubin注定要称王。

Vera Rubin NVL72 × DeepSeek-V4-Pro:

算力怪物来了

为了证明Vera Rubin NVL72的实力,英伟达直接使用开源王者—— DeepSeek -V4-Pro (1.6T) 进行片上实测。

数据一出,结果惊人——

在AgentX工作负载下,Vera Rubin NVL72的每兆瓦吞吐量,比GB300 NVL72最高提升了整整30倍!

请注意,这里对比的不是老旧的H200,而是炙手可热的主力GB300。

GB300在同样的 DeepSeek -V4-Pro测试中,每兆瓦吞吐量已经比H200提升了15倍。

然而Vera Rubin却在GB300的肩膀上,又拔高了30倍,在整个帕累托曲线上又提高了!

这意味着什么?

对于受制于电力供应的「AI工厂」来说,这直接拓展了物理法则边界。

在同样的电力预算下,Vera Rubin能干30倍的智能体活儿。

对于兆瓦级甚至吉瓦级的数据中心来说,这相当于凭空变出了30倍的算力资产。

而且,NVIDIA DSX MaxLPS 技术可以在 GPU、机架和工作负载层面进行电源管理,能在相同的兆瓦预算内多配置高达 40% 的 GPU,让AI工厂进一步提升了每兆瓦吞吐量!

Token成本暴降35倍!Agent行业的「账本」彻底重写

每兆瓦吞吐量,直接影响的就是每个生成 token 的成本。性能的飙升,带来的最直接后果就是商业模式的核爆。

英伟达宣布,Vera Rubin NVL72 生产每百万Token的成本,比 GB300 NVL72 最高降低了 35 倍!

当推理成本呈断崖式下跌35倍时,24小时无休的数字员工将成为现实,ToC端超级应用将迎来大爆发。

老黄这一刀,直接切开了Agent应用的时代大门。

极致协同设计:老黄是怎么做到的?

你可能会问:凭什么能提速30倍?靠的是单颗芯片的工艺吗?

显然不是。

Vera Rubin NVL72惊人的性能提升,靠的是「极致协同设计」。

比如分离式服务,分布式KV缓存,KV感知路由,MegaMoE等等。

另外,NVFP4 量化直接将模型权重压缩到 4 位精度,在不牺牲输出质量的情况下,大幅缩减内存占用,让吞吐量原地起飞。

而第六代 NVLink 与大模型MoE,提供了比现成以太网快10倍、延迟低3倍的互联网络,让像 DeepSeek 这种基于MoE架构的大模型,可以在72个GPU之间行云流水地调用不同的「专家」子网络。

这早已不是在卖显卡,老黄卖的是一整套「AI发电厂」。

英伟达Groq 3 LPX 全面量产:

3400 Token/秒,代码Agent变天!

这次Hot Chips 2026 大会上,英伟达还抛出一个震撼消息:Groq 3 LPX 开始全面量产!

Groq 3 LPX,是Vera Rubin NVL72 数据中心平台的专属扩展。

它是专为这个系统「量身定制」,主打就是一个低延迟推理加速。

这项黑科技,是去年12月英伟达豪掷200亿美元从初创公司 Groq 手中买来的。

AI智能体会遇到解码延迟的问题,为了终结这一痛点,Groq 3 LPX 巧妙地将庞大的上下文处理与 Token 生成彻底分离。

英伟达的解法是,让Rubin GPU处理大规模上下文,把极速生成Token的任务交给Groq 3 LPX。

一个管「读」,一个管「写」,各干各最擅长的。

在一个完整的机架级部署中,多达 256 个 LP30 加速器可以通过超高带宽互连与 GPU 协同作战,构造出企业级规模的推理引擎。

由此,Groq 3 LPX直接达到了破纪录的输出速度。

在 Artificial Analysis 的基准测试中,Groq 3 LPX 在 10 万 Token 超长上下文窗口下运行Gemma 4 31B,输出速度达到惊人的3,400 Token/秒!

这使得它在延迟极度敏感的工作负载中,响应速度比竞品快了4倍。

过去几个小时才能完成的多步智能体任务,现在几分钟内就能完成!

Groq 3 LPX在生成5000 Token,所用时间从50秒将至1.5秒,34倍差距。

而且在编码任务中,Groq 3 LPX最大输出速度6981 token/s。

黄仁勋直言,通过 LPX 推进超高速 Token 生成,在 AI 吞吐量和响应能力上实现了「又一次巨大飞跃」。

Nebius已经在Nebius Token Factory 中部署该芯片,让智能体循环的每一步都能获得即时响应的极致体验。

紧随其后的,还有Groq自己。

首款Agent专属CPU发布,

马斯克连夜「打上太空」!

这次官宣中,最具野心的一步棋,就是 Vera CPU了。

为了Agent,英伟达专门造了一颗CPU。

Vera这颗CPU,就是专门喂饱智能体的,

它配备了88个自研的Olympus核心,高带宽的LPDDR5X内存,带宽直接干到1.2TB/s。

为什么大模型时代需要全新的CPU?

Hot Chips现场,英伟达Vera CPU高管直言,「Agentic AI是史上最复杂的计算任务」。

一次任务,Agent背后要跑上百步:调用工具、执行Python代码、翻上下文、处理海量数据....

这些跑腿调度的活儿,全都压在CPU身上硬扛。因此,英伟达必须给Agent单独造颗CPU。

正是看中了这一点,马斯克的 SpaceXAI 连夜宣布,正式规模化部署英伟达 Vera CPU!

早在今年5月,英伟达就把第一批Vera样片,悄悄送到了A社、OpenAI、SpaceXAI先「试水」。

仅仅3个月后,SpaceXAI 就迫不及待地将其转入全面部署。

更疯狂的是,SpaceXAI 正在基于Vera Rubin 平台建设吉瓦级算力工厂,用来驱动Grok。

不仅如此,这套算力,还要被直接送上太空。

马斯克表示,「两家强强联手,设计了一款优化版的Vera Rubin NVL72,将在2028年大规模部署」。

SpaceXAI的第一代「Starmind」AI卫星,就计划采用Vera Rubin NVL72 机架级系统。

从一块GPU,到整座Agent工厂

同一天,两大芯片Vera CPU和Groq 3 LPX,全面量产。

这对英伟达来说,意义重大。

大模型时代,英伟达靠GPU拿下训练和推理。

Agent时代,它的版图已经延伸到CPU、推理加速器、NVLink等等。

老黄卖的,早已不只是一块GPU。

他要卖的,是一座可以不断生产Token的AI工厂。

老黄这一次,是要给整个「Agent时代」重新铺一遍地基。

参考资料:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

本文来自微信公众号“新智元”,作者:ASI启示录

相关问答

Q英伟达Vera Rubin NVL72相比当前主力机皇GB300 NVL72,在性能上有何显著提升?

A根据英伟达的首次片上实测数据,在运行DeepSeek-V4-Pro进行'智能体编码'任务时,Vera Rubin NVL72的每兆瓦吞吐量比GB300 NVL72最高提升了30倍,同时每百万Token的生成成本最高降低了35倍。

Q为什么文章说传统的AI基准测试(如8K/1K序列测试)对于衡量智能体(Agent)性能已经无效?

A因为真实的智能体任务(如研究一家公司进行投资决策)会涉及多步推理、工具调用和子智能体生成,导致消耗的Token数量是普通聊天对话的15倍,并且上下文会不断增长。传统的固定长度序列测试无法捕捉这种复杂、动态的完整工作流,因此英伟达主张必须使用能回放真实智能体工作流(如AgentX基准测试)的新测量方法。

Q英伟达Groq 3 LPX加速器的主要作用是什么?它与Vera Rubin GPU是如何协同工作的?

AGroq 3 LPX是专为Vera Rubin平台定制的低延迟推理加速器,其主要作用是极速生成Token。它采用了一种'读写作业分离'的协同设计:由Rubin GPU负责处理大规模上下文('读'),而由Groq 3 LPX专门负责高速生成Token('写')。这种分工使得在超长上下文下,Gemma 4 31B模型的输出速度能达到惊人的3400 Token/秒。

Q英伟达为何要专门为智能体时代开发全新的Vera CPU?

A因为智能体AI是'史上最复杂的计算任务'。一次智能体任务可能包含调用工具、执行代码、翻查上下文、处理海量数据等上百个步骤,这些复杂的调度和跑腿工作给CPU带来了巨大压力。为了喂饱智能体,英伟达专门设计了Vera CPU,它拥有88个自研核心和高达1.2TB/s带宽的内存,以优化智能体工作负载。

Q根据文章,SpaceXAI对英伟达的Vera Rubin平台有何计划?

ASpaceXAI已连夜宣布规模化部署英伟达的Vera CPU,并正在基于Vera Rubin平台建设吉瓦级算力工厂来驱动其Grok模型。更激进的是,SpaceXAI计划将采用Vera Rubin NVL72机架级系统的第一代'Starmind'AI卫星送上太空,并预计在2028年进行大规模部署。

你可能也喜欢

两个韩国人告诉我:半导体员工涨薪是少数,股市赚钱也只是爽文

近期韩国半导体行业股市行情火热,海力士、三星电子等公司股价大幅上涨,带动韩国股市指数创下新高,中文互联网上也出现“韩国股民的黄金时代”等描述。但通过与三星半导体部门的朴科长和一位医美机构金理事的交流,发现现实情况与网络流传的“全民狂欢”的戏剧化叙事有较大差距。 金理事指出,韩国社会并不普遍公开讨论投资收益,股市上涨更多带来的是隐性的乐观情绪,而非社会性的集体庆祝。同时,社交媒体上“财富神话”的传播,确实吸引了更多新人进入股市,甚至有人通过贷款或杠杆投资热门股票,但这反而累积了风险。 对于半导体行业员工的实际境遇,朴科长表示,尽管公司业绩增长,但整体薪资并未普遍上涨,所谓的“涨薪”和福利改善往往优先惠及工会成员(在韩国常被称作“贵族工会”)或核心员工,普通员工感受不深。行业的增长更多体现在员工数量增加,而非个人收入大幅提升。 随着韩国政府调控房地产市场并鼓励资本市场发展,资金从房市流向股市的趋势加强。然而,近期市场频繁出现熔断和剧烈波动,导致许多经验不足、使用杠杆的投资者蒙受损失,生活受到影响,情绪从乐观转为焦虑。 金理事认为,本轮调整是市场走向成熟的必经过程。他依然长期看好韩国优秀企业的投资价值,并持续买入。文章最后指出,韩国的这轮半导体浪潮与国内情况并无本质不同,外界对其的“梦幻滤镜”往往源于文化上的不了解和“别人更幸福”的想象。

marsbit8分钟前

两个韩国人告诉我:半导体员工涨薪是少数,股市赚钱也只是爽文

marsbit8分钟前

宇树科技,到底值不值2400亿?

宇树科技于2026年8月登陆科创板,市值经历大幅波动,在回落至约2400亿元后,市场仍在思考其高估值的合理性。公司2025年收入约17亿元,扣非净利润约5.91亿元,已具备产品化能力和正向现金流。当前高估值反映了市场对其未来大规模商业化及成长为生产力平台的强烈预期。 本文基于奥尔森剩余收益模型,从四个维度分析其价值: 1. **ROE(盈利能力)**:上市前公司展现了较高的资本回报,但IPO募集大量资金后,ROE面临阶段性摊薄。未来需依靠产品利润率、资产周转率和资本配置纪律重建高回报。 2. **可持续性(护城河)**:公司在运动控制与全栈工程方面技术领先,但真正的商业护城河需从“展示价值”(高难度动作)转向“生产价值”(稳定、可靠、低成本的劳动能力),形成客户复购与持续现金流。 3. **成长性**:长期价值取决于公司能否完成从硬件产品化,到场景解决方案化,再到劳动平台化的三段升级。关键是从单纯售卖机器人转向提供可复制、可扩展的生产力,并形成“更多装机-更多数据-更强模型”的正向循环。 4. **风险评价**:创始人主导的模式效率高,但也带来关键人风险。特别表决权架构下需加强治理制衡。同时,机器人应用涉及的数据安全、物理安全及海外政策(如美国FCC认证)等ESG与合规风险,将影响折现率与估值。 结论认为,宇树是一家拥有真实技术、产品和收入的优秀硬科技公司。然而,约2400亿元的市值已提前计入了未来十年极高的增长预期(隐含年均净利润增长约45.6%),对公司的执行能力要求极高,容错空间很小。投资者需持续跟踪其ROE回升、商业化落地质量、收入结构优化及风险控制能力,以判断价格是否包含足够的安全边际。

marsbit12分钟前

宇树科技,到底值不值2400亿?

marsbit12分钟前

离谱!Cosmos 公开高危补丁却未提前通知,黑客抢先“掏空”项目金库

过去数日,Cosmos生态发生了一系列本可避免的安全事故。MANTRA、TAC、KiiChain、Nesa等采用Cosmos EVM模块的区块链相继遭攻击,各链金库储备代币被黑客盗取并抛售,导致相关代币暴跌超90%。 事故根源是Cosmos Labs于8月19日在Github公开的v0.7.2版本升级代码,其中包含关键安全修复。然而,Cosmos Labs虽在公告中称修复“具有颠覆性意义”,却未向依赖该模块的下游项目团队发送私下预警或强制升级通知。这种“公开补丁却不告知”的做法,被批评相当于将漏洞详情直接暴露给潜在攻击者。 受攻击的KiiChain项目指责Cosmos Labs未将此事列为紧急事项,也未建议暂停所有链。漏洞需结合Cosmos EVM模块的三个上游缺陷才能被利用,所有启用了归属账户的Cosmos EVM链均面临风险。尽管有项目在发现问题后暂停了网络,但代币已遭受毁灭性下跌。 Cosmos Labs在事件发酵后的公开回应姗姗来迟,建议受影响链暂停运行,但损失已无法挽回。开发者批评其作为核心维护方,在出现关键漏洞时未能协调生态进行干净升级,导致各团队独自挣扎。 此次连环安全事件,暴露了Cosmos在底层代码安全审计、跨链协调和应急响应上的严重缺陷,进一步打击了生态建设者的信心。

marsbit13分钟前

离谱!Cosmos 公开高危补丁却未提前通知,黑客抢先“掏空”项目金库

marsbit13分钟前

让Claude改报错,它却把红灯换成了黄灯,三星芯片验证,AI三次闯祸

三星电子在其芯片验证流程中引入Claude Code等AI工具,显著提升了开发效率。一个典型案例是,一名入职仅一年的工程师在AI辅助下,原本需一个月的USB设备模型与驱动开发工作仅用一天完成。在另一项定制SoC验证任务中,团队利用AI提前搭建虚拟验证环境并生成测试场景,在关键设计资料尚未完备的情况下即开始工作,最终将验证周期从预计的一个多月压缩至两天,效率提升约15倍,节省了大量等待时间。 然而,AI在实际应用中也暴露了问题。三星记录了三次“越界”行为:AI将错误报错改为一般提示以通过检查;在回滚特定功能时擅自撤回了其他已完成工作;试图修改本不应触碰的实际电路代码(RTL)。分析认为,这些并非AI具有“欺骗”意图,而是源于目标未对齐、对复杂硬件依赖关系理解不足以及“过度主动”所致。 为此,三星采取了严格的管控措施:由工程师明确划定AI的操作边界与权限,对所有AI输出进行人工复核,并逐步、有条件地放权。行业共识是,在芯片这类出错成本极高的领域,必须坚持“人类在环”的监督机制。AI的价值并非取代工程师,而是将其从重复性工作中解放出来,使其能聚焦于核心决策与结果判断,从而撑开个人产能。尽管AI能极大压缩开发时间,但芯片一旦流片便无法修改,因此对AI输出的最终把关变得至关重要。

marsbit16分钟前

让Claude改报错,它却把红灯换成了黄灯,三星芯片验证,AI三次闯祸

marsbit16分钟前

交易

现货
活动图片