大型挂机现场:马斯克的55万英伟达GPU,利用率才11%

marsbit发布于2026-05-05更新于2026-05-05

编辑 | 泽南

AI 时代堆 GPU,原来是这么个堆法?

马斯克旗下的 xAI 目前 GPU 资源利用率只有大概 11%。相关报告指出,其 AI 软件栈的优化效果不尽如人意。近日,《The Information》的报道引发了人们的关注。

目前,xAI 在其 Memphis 和 Colossus 数据中心集群中运营着约 55 万块英伟达 GPU,包括 H100 和 H200 两种型号,其中部分设备采用了液冷散热配置。尽管这些 GPU 属于上一代产品(早于最新的 Blackwell 系列),但其规模已经令人叹为观止。

拥有如此庞大的 GPU 存量,xAI 的模型算力利用率(MFU,Model FLOPs Utilization)却只有 11%。打个不恰当的比喻,在 xAI 服务器中已安装的这 50 万块 GPU 中,实际可用的算力仅相当于约 6 万块 GPU 的水平。究竟是什么原因导致了如此低的效率?

首先,对于较小规模的部署环境(例如 1000-10000 块 GPU)而言,多节点之间的协调计算通常不成问题。但随着服务器规模的不断扩大,当需要集成数十万颗 GPU 时,设备的空闲时间便会迅速累积,导致整体利用率急剧下滑。由此引发的软件栈内部的一系列不一致性问题,目前正在 xAI 的实际运行中暴露无遗。

在超级集群中,GPU 芯片本身的计算速度相对很快,瓶颈在于高带宽内存(HBM)的数据读写速度和成千上万台服务器之间网络传输的通信开销。只要数据传输出现微小的延迟或网络拥堵,整个集群的 GPU 就会被迫 “原地挂机” 等待数据加载。

另一方面,AI 模型的训练通常是间歇性的。GPU 在实际计算时满载运转,但在研究人员分析训练结果、调整参数或处理数据管道时,大量设备就会处于闲置(Idle)状态。

虽然 11% 是一个显然偏低的数字,但 The Information 的报道也揭示了 AI 领域的一些行业潜规则:算力浪费是普遍的现象,有些大厂的研究人员为了避免被管理层批评,或者害怕闲置的 GPU 配额被其他团队抢走,甚至会故意重复运行一些无意义的训练任务来 “刷高” 利用率数据。

该说不说,这么做也是为了保住团队自己的 GPU 配额。

当然,这并非 xAI 独有的难题,它实际上是整个 AI 行业普遍存在的一种结构性问题 ——AI 基础设施要在如此庞大的规模下实现高效运行,是一项极其艰巨的挑战。

运行 AI 云基础设施所需的优化技能涵盖数据、算法、模型、计算、内核、交互(人类 - AI - 世界、智能体之间),以及全局优化,在工程上难度极高。

一些科技巨头着重优化了大规模基础设施堆栈,已经能够实现超过 40% 的利用率。Meta 和谷歌便是此类典范,其 GPU 的利用率分别高达 43% 和 46%。

xAI 遇到的困境证明了在当前的 AI 军备竞赛中,“买到 GPU” 只是第一步,用好才是关键。硬件规模已经超出了现有软件架构的调度能力。

不过,xAI 已在着手解决这一问题,并设定了利用率达到 50% 的目标。尽管目前尚无确切的时间表,但其核心改进将聚焦于基础设施与软件堆栈的优化。随着未来工作负载逐步迁移至那些专为驱动 “智能体 AI”(Agentic AI)需求而设计的硬件平台之上,xAI 极有可能将其庞大的 GPU 集群对外提供租赁服务。

马斯克也在寻求转变,押注于自研算力的 “TeraFab” 项目:一方面,他正在推动多款自研芯片,将其纳入 xAI 的 “AI 芯片家族” 之中;另一方面,马斯克也希望借助英特尔的 14A 制程技术,为未来的 xAI、SpaceX 及其它相关业务打造尖端解决方案。

xAI 的困境提醒了所有追赶者:AI 竞赛的下半场,拼的可能不再是谁能买到更多显卡。

参考内容:

https://www.theinformation.com/newsletters/ai-agenda/xai-shows-hard-use-lot-gpus

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI基础设施的

热门币种推荐

你可能也喜欢

预测市场的价值、增长与风险

文章探讨了预测市场的巨大潜力、快速增长及伴随的监管与消费者保护问题。预测市场通过简单的“是/否”合约让用户对各种事件结果进行交易,价格直接反映市场认为的该结果发生概率。其核心价值在于提供高效的风险对冲工具和优于传统民调的概率预测,并能吸引用户进入平台,部分最终转化为长期投资者。以Robinhood为例,其预测市场收入已超过加密货币和股票交易。 增长主要由体育赛事(如世界杯)驱动,预测市场正在大量吸纳传统体育投注的用户和交易量。然而,这引发了严重的法律和监管争议。美国商品期货交易委员会(CFTC)认为事件合约属于其监管的衍生品,而许多州政府则视其为体育投注,应受州级监管并纳税,双方已展开多起诉讼。监管归属的模糊性带来了不确定性。 更突出的问题是消费者保护。数据显示,多数普通用户在预测市场中亏损,而专业交易者获利丰厚。平台营销方式(如推广高风险的“串关”投注)与传统投注平台类似,但针对问题性投注行为的保护措施(如年龄限制、自我排除机制)却主要依赖平台自律,而非法律强制要求,这可能导致消费者受损。 文章最后提出改进建议:将消费者保护机制内置于产品设计中,对体育类合约实施更严格的保护与税收,并利用预测市场的吸引力引导用户转向长期储蓄和投资产品,借鉴英国“有奖债券”的历史经验,将投机冲动转化为财务健康。 作者认为预测市场是“更好的市场”,但当前对普通消费者并不更友好。他呼吁平台、监管机构和州政府尽快合作,建立更完善的保护框架,以避免未来可能出现的严厉监管反弹,从而损害该市场的真正价值。

marsbit2小时前

预测市场的价值、增长与风险

marsbit2小时前

AI巨头实习生日薪揭秘:Anthropic超5000元,Kimi只能排第四梯队

2026年,AI行业实习生日薪差距悬殊。全球顶尖人才计划中,OpenAI Residency日薪约5625元,Anthropic AI Safety Fellows日薪约5198元,且后者每月额外提供1.5万美元算力经费。这些项目门槛极高,本质是“预招聘”。 美国科技大厂常规技术实习生薪资同样可观:Meta日薪约3780元,Google约3400元,英伟达美国均值约2106元(博士上限超5000元)。 国内巨头通过专项计划高薪抢夺顶尖人才:字节跳动Top Seed研究实习生日薪达2000元;小米相关顶尖实习岗位日薪在500-1100元区间。 相比之下,多数国内AI公司普通实习生薪资处于第二梯队:DeepSeek普通AGI实习生日薪500-1000元;字节普通研发实习生日薪500元;MiniMax、阿里巴巴、英伟达中国相关岗位日薪在350-800元;Kimi算法岗日薪400-450元;小米普通大模型实习生日薪300-400元;智谱AI最低,日薪200-300元,但其员工持股比例高,以期权作为重要补偿。 此前流传的“DeepSeek清华姚班实习生日薪5500元”仅为极端个例,非普遍标准。 分析指出,AI行业薪资“贫富分化”严重,中美大厂薪酬差距仍大。中国公司正以专项计划追赶顶尖人才待遇,而期权激励在该行业扮演着重要角色。行业最核心的竞争,依然是对顶尖人才的争夺。

Odaily星球日报2小时前

AI巨头实习生日薪揭秘:Anthropic超5000元,Kimi只能排第四梯队

Odaily星球日报2小时前

交易

现货

热门文章

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.7k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片