越过“内存墙”，AI推理时代的晶圆级革命与算力路线

marsbit发布于2026-06-05更新于2026-06-05

文章摘要

2026年，AI产业进入新拐点：全球主要云厂商的推理资本支出首次超过训练。这意味着算力需求核心从“炼模型”转向“用模型”，瓶颈也从计算规模变为“内存墙”——即数据在GPU与片外存储间搬运带来的高能耗与延迟。为突破内存墙，Cerebras公司选择了“晶圆级计算”的激进路线。其核心产品WSE-3不切割晶圆，直接制成超大芯片，集成90万个AI核心和44GB片上SRAM，带来远超传统GPU（如英伟达B200）的片上内存带宽。其架构将模型权重存储于片外MemoryX，按需流式传输至芯片计算，从而在LLM推理，尤其是首token延迟和长上下文任务中展现出显著优势，token生成速率可达GPU的1.5-5倍。同时，其芯片内互联功耗也远低于当前GPU。但这种极致物理优化也带来挑战：通过先进制程提升SRAM容量的路径已近天花板；整片晶圆发热量大，需专用液冷；片外I/O带宽有限，难以高速扩展形成大规模集群；软件生态也与主流CUDA不兼容。与此同时，行业巨头正通过多条路径围剿：1）自研ASIC推理芯片（如谷歌TPU、微软Maia）；2）利用台积电SoW等先进封装技术将“晶圆级”能力通用化、平民化；3）探索光互联/光计算作为终极解决方案。 Cerebras还面临商业转型的挑战，巨额订单迫使其从芯片商转向云服务商，需快速建设专用数据中心，交付压力巨大。最终，AI推理时代的算力架构呈现路线分野：Cerebras向左，追求单任务下的极致低延迟；英伟达向右，以通用性应对多变负载。技术变革仍在继续，谁将主导未来，尚无定论。

2026年,全球AI的发展迎来了一个标志性的拐点——超大规模云厂商的推理资本支出,历史上第一次超过训练资本支出。产业锚点从“炼大模型”向“用大模型”转移,算力需求的结构发生了根本性翻转。

在训练时代,算力的核心矛盾是“双精度浮点与集群规模”;而步入推理时代,核心矛盾变成了“内存带宽与通信延迟”。

大模型推理的瓶颈不再仅仅是计算,而是数据搬运——模型权重、中间激活值和KV Cache需要在片外DRAM(如HBM)和GPU之间频繁交互,模型越大,数据搬移的能耗与延迟越高,最终远超计算本身的能耗,从而形成了内存墙。

英伟达GPU凭借CUDA和NVLink构筑了坚固堡垒,但仍然避免不了带宽瓶颈引发的GPU空转。

国内大模型公司智谱做了一个很简单的实验:一个512卡的推理集群,GPU不变、模型不变、代码不变,只把网络带宽上限从200GB/S换成400GGB/S,推理吞吐直接涨了10%,首token输出时延降了19%——道理很简单,只要把路拓宽,车就能跑得更快。

然而,以Cerebras为代表的非GPU架构,似乎正在内存墙上撕开一道口子。

Cerebras WSE-3 芯片与英伟达B200 GPU 尺寸对比

Cerebras的本质:一台基于SRAM的近存计算机器

Cerebras Systems由 Andrew Feldman 等人在硅谷创立,早期的创始团队悉数来自一家叫SeaMicro的低功耗微服务器,这家公司后来被AMD收购,随后:

2015年,创始团队确立“晶圆级计算”路线;

2016年,完成注册、A轮融资,进入隐身研发阶段;

2019年,发布首款产品WSE-1 芯片和CS-1系统,基于台积电16nm工艺;

2021年,发布第二代产品,基于台积电7nm工艺;

2024年,发布第三代产品(WSE-3 / CS-3),基于台积电5nm工艺,芯片和系统均在美国完成制造,是地道的纯美国制造的芯片系统。

CS-3系统配置,包含1颗 WSE-3芯片

Cerebras的晶圆级引擎(Wafer-Scale Engine, WSE)架构哲学,简单粗暴却直击痛点:用物理空间的极致放大,换取对数据搬运延迟的极致压缩。

普通芯片是把一片晶圆切成很多小芯片,比如英伟达GPU就是这种思路。 Cerebras反过来:不切,直接把几乎整片晶圆做成一颗超大芯片,叫 Wafer-Scale Engine,WSE。

传统芯片是将一整块300mm直径晶圆,切割成数百个小芯片而形成;而Cerebras选择保留整片晶圆,直接作为整个芯片。最新的WSE-3拥有4万亿晶体管、90万个AI核心,每个核心配备48KB本地SRAM,从而让整个芯片的的片上SRAM达到44GB,提供21PB/秒的片上内存带宽(on‐chip memory bandwidth)和214Pb/秒的网络带宽(fabric bandwidth),这是传统HBM带宽的数千倍。

Cerebras WSE的内存带宽是英伟达B200封装芯片的2625倍,打破了大模型推理场景下的内存带宽瓶颈。

在Cerebras的架构中,模型权重从来都不会存在SRAM上,而是在片外存储MemoryX上,并逐层向大芯片上转移。实现方式是将神经网络模型的权重存储与计算单元相互分离。

所有模型权重均外置存放于内存扩展模块MemoryX中,网络每一层计算所需的权重,会按需逐层传输至CS-3系统。权重存储在MEMORY X的DRAM与闪存内,并以满带宽速率向CS-3系统传输。这些权重不会存入CS-3系统,就连临时缓存也不会留存,CS-3依靠核心底层的数据流机制完成运算。

Cerebras凭借晶圆级架构,在受限于内存带宽的LLM推理中,展现出降维打击般的壁垒。逐Token生成时,权重按层从片外MemoryX流式传输至CS-3,跑不同的模型,token速率是英伟达B200的1.5 - 5倍。

英伟达DGX B200 GPU versus Cerebras CS-3芯片,跑不同大模型的Token速率比较

其优势核心在于:CS-3的44GB片上SRAM提供21 PB/s(B200的2625倍)超高带宽与214 Pb/s互联,使权重流传输摆脱HBM接口限制。故在TTFT(Time To First Token,从请求发出到模型返回第一个token 的时间)、长上下文以及智能体工作负载上,表现尤为突出。

虽然权重外置于MemoryX按需逐层加载且不在片上缓存,CS-3依靠核心数据流机制在SRAM完成全FP16精度无损运算;凭借线性性能扩展,其在多用户并发推理下亦释放出惊人的总吞吐。

除了带宽,还有功耗的优势。近期,中际旭创董事长刘圣演讲中也提到,客户对于光模块的要求是1 pJ/bit,而当前是10 pJ/bit。在Cerebras芯片中,互联的功耗只有0.15 pJ/bit, 而当前GPU的互联功耗是10 pJ/bit。

Cerebras互联与GPU互联架构的带宽和功耗对比

由此可见,如果Cerebras的晶圆级大芯片架构成为AI推理甚至训练的主流,也许将会对传统光模块和CPO(共封装光学)的出货量产生显著的抑制和结构性改变。核心逻辑在于:光模块和CPO的高需求,本质上是为了解决GPU集群中“芯片间互联”和“节点间互联”的带宽瓶颈;而Cerebras的架构恰恰是通过“消除分布式互联”来解决问题的。

反直觉:晶圆级大芯片的“真假”硬伤

芯片的核心永远在于Trade Off(取舍之道)。Cerebras为了片上SRAM的极致带宽,也带来一些问题。

良率低?

恰恰相反,单个AI核心尺寸减至0.05平方毫米(H100 单个运算核心尺寸的1%),因此良率反而更高。通过片上的路由,可关停和绕过有缺陷的核心,从而使得与传统多核处理器相比,缺陷容忍度提升了100倍。其实整个芯片有100万个AI核心,但是考虑了良率,对外声称是90万个AI核心。

只擅长推理,不擅长训练?

在Cerebras成立的数年之内,训练是主流课题,因此公司始终围绕着训练做了大量工作,只是推理需求火爆后,大家发现其在推理方面的优势更明显。

实际上简化的分布计算,也带来了代码复杂度降低、通信开销降低的一系列优势。

在4000块GPU上训练一个1750亿参数的模型,通常需要大约2万行分布式训练代码。

Cerebras 实现了565行代码的等效训练——整个模型可安装在晶圆上,且不需处理数据并行复杂性。

SRAM缩放已死,核心优势面临物理天花板。

第三代产品基于台积电5nm,其SRAM容量仅仅比基于台积电7nm的第二代产品增加了10%,在5nm之后,SRAM单元面积几乎不再随制程进步而缩小。

这意味着Cerebras无法再像过去那样,通过升级台积电制程(如从5nm走向3nm)来显著增加其核心优势(SRAM容量)。

受限于晶圆尺寸、散热能力及制造成本,片上SRAM等存储资源难以与计算核心同步线性扩展,资源配比遭遇瓶颈。这几乎堵死了其进化之路。

Cerebras 三代产品技术规格

散热、工艺与生态的三重炼狱。

整片晶圆集中发热,热流密度较高,必须依赖定制机房和专用液冷系统,此外,生态通用性意味着客户必须适应其定制化的软件栈,与现有CUDA等通用编程框架的兼容性弱,软件移植与适配成本高昂。

片外带宽低,成为扩展“孤岛”。

由于晶圆级物理设计的限制,WSE边缘能够引出的I/O引脚数量极其有限,导致其I/O带宽仅为150GB/s。这与英伟达NVLink动辄1.8TB/s的双向带宽相比,犹如蜗牛。这意味着WSE极难向外高速扩展。尽管Cerebras的SwarmX互联在多系统组合上做得尚可,但在需要多芯片高速互联的超大模型面前,极低的片外带宽成为了结构性的物理枷锁。

路线之争:大厂自研,Cerebras的窗口期还剩多久?

大厂解决“推理需要更高带宽+更低延迟”的方法,不止wafer-scale一条路,他们正在通过三条并行路径,对初创公司的技术红利进行围剿。

1 自研 ASIC芯片

Google TPU v8已经分裂为training-specific和inference-specific两个版本;AWS Trainium 4在路上;Microsoft Maia已在Azure内部使用,基于台积电 3nm 工艺构建,原生 FP8/FP4 张量核心,重新设计的内存系统,配备 216GB HBM3e,272MB 片上SRAM;甚至连Anthropic都开始评估自研inference chip。

这条路径的概率极高,它将直接导致“第三方inference采购”在2028年的TAM(总可达市场),上限被压缩10%到25%。

2 标准Packaging路线的工艺通用化

这是对Cerebras最直接的降维打击。

TSMC的SoW(System-on-Wafer)已经向客户广泛开放,CoWoS 9.5x interposer也将在2027年上线。

这两个产品做的事——把多颗die在wafer级别stitching——本质上就是把Cerebras的物理工艺通用化、平民化。

英伟达的Vera Rubin将在2026下半年进入这个生态。

Cerebras自家做的cross-reticle stitching虽是独占,但独占的窗口期最长只有2到3年,到2027 - 2028年之后,其工艺壁垒将被台积电的先进封装稀释。

3 光互联/光计算的突围

电子芯片的互联与内存墙已至极限,光子的高带宽、低延迟、零串扰是终极解法。

以Lumentum为代表的光学路线正在崛起。Wafer-scale的最大优势就是片上计算,但模型必然越来越大,wafer scale往上的高速互联是刚需。

随着CPO(共封装光学)和Optical Interconnects的成熟,未来我们极有可能看到光I/O直接引入WSE晶圆,打破电互联枷锁;而英伟达也可能通过收购LPU(如Groq)等具备特定架构优势的公司,结合光互联,开发兼容现有NV超节点软件的晶圆级系统。

悬崖上的狂奔:Cerebras的商业与交付

Cerebras目前正面临一场由巨额订单倒逼的悬崖式狂奔。

与OpenAI等头部大客户的交易,迫使Cerebras从一家芯片公司转型为新型云服务商。它不再只是卖硬件,而是需要在短期内锁定并建设海量的数据中心电力和设施。

根据合同要求,Cerebras需要在2026 - 2028年每年交付250MW的数据中心容量。然而,晶圆级系统对机房的要求极高,无法直接塞进传统的风冷IDC。目前,Cerebras在数据中心容量的筹备上进度已经明显落后于合同要求。

从流片到建厂,从电力审批到冷却系统部署,这是一个重资产、长周期的泥潭。

尾声:向左还是向右?

回到最初的命题,当推理算力拐点已至,算力架构的核心永远在于取舍。

没有绝对的对错,只有在最重要负载下的相对最优解。负载其实已经在变。

Cerebras向左,选择了极致的物理优化,用整片晶圆和海量SRAM换取单任务下的极致低延迟,这对首token延迟极度敏感的场景下是无敌的。

英伟达向右,选择了保持通用性,用HBM + NVLink + 超大集群吞吐,应对负载的千变万化,以不变应万变。

风起云涌,前路未卜。正是这种技术与商业的双重不确定性,才孕育着颠覆的可能。在通往AGI的算力洪流中,现在下定论还为时尚早——因为不确定,才有机会。

本文来自微信公众号“大蒜粒机研所”,作者:霹雳游侠

你可能也喜欢

卡尔达诺价格预测：霍斯金森对10亿美元RealFi的押注能否阻止ADA跌至0.14美元？

2026年7月28日，卡尔达诺（Cardano）价格上涨1%，测试0.236斐波那契回撤位0.1618美元的关键支撑。创始人Charles Hoskinson在AMA中表示，RealFi（现实世界资产金融）是Cardano在12个月内实现10亿美元总锁仓价值（TVL）最有可能的产品，并强调了其运营独立性和团队在非洲微金融领域的经验。技术分析显示，ADA目前正测试0.1618美元支撑位，若日收盘价跌破该位置，可能进一步下探至0.1386美元（六月低点）。上方阻力位包括20日均线0.1650美元和50日均线0.1739美元。其他发展动态包括：Midnight City进入公开测试阶段；Ouroboros Leios测试网上线；针对SecondFi六月被盗事件的零知识证明资金返还门户已启动。衍生品数据显示，过去24小时交易量激增159%，多头清算达280万美元，空头清算仅4.8万美元，显示市场主要由多头承受抛压。零售交易员倾向于做空，与大户的净多头头寸形成分歧。展望后市，看涨情景需守住0.1618美元支撑，并向上挑战0.1650-0.1762美元区间；看跌情景则可能跌向0.1386美元的前期低点。

cryptonews.ru2分钟前

卡尔达诺价格预测：霍斯金森对10亿美元RealFi的押注能否阻止ADA跌至0.14美元？

cryptonews.ru2分钟前

稳定币市场四年来首次大幅收缩

根据DeFiLlama数据，稳定币总市值在7月28日从5月峰值下降超100亿美元至约310亿美元，为自2022年5月Terra崩溃以来最大月度降幅。与此同时，2026年6月调整后的交易量创历史新高，达1.79万亿美元。分析认为，2025年7月生效的《GENIUS法案》是关键因素，该法案禁止发行方为支付型稳定币支付利息收益，导致追求收益的资本转向了美国国债代币化基金、DeFi借贷协议等替代产品。此类代币化RWA（现实世界资产）基金总额在五个月内从110亿增至160亿美元。交易活跃度改变了市场格局。Visa数据显示，USDC在2026年上半年占据了约70%的交易量份额，而USDT尽管在市值上保持领先，但在交易量上大幅落后。高周转速度与停滞的供应量正在重塑行业经济模型：发行方依赖储备利息的旧商业模式受冲击，收入流向支付网络和区块链基础设施，企业间（B2B）支付虽占比仍小但增长显著。综上，监管变化正驱动资本从传统稳定币流向收益型替代品，并加速了加密货币支付基础设施和企业应用的发展。

cryptonews.ru2分钟前

cryptonews.ru2分钟前

LeCun连续转发，新作VISReg攻克JEPA世界模型「表征坍塌」核心难题

近日，图灵奖得主Yann LeCun连续转发并高度认可了一项名为VISReg的自监督学习新工作。该工作旨在攻克JEPA世界模型中长期存在的“表征坍塌”核心难题。表征坍塌是指模型倾向于将不同输入映射到相同或极少数向量上，导致学到的表征缺乏判别力。传统方法多依赖复杂的启发式技巧来抑制坍塌，但训练脆弱且可解释性差。VISReg的解决思路是将正则化目标解耦为独立的“尺度”和“形状”两部分。尺度部分通过方差项防止表征幅值塌缩，并在塌缩时能保持稳定的梯度；形状部分则通过带停止梯度的归一化和切片Wasserstein距离，将表征的分布形状对齐到标准高斯分布，从而完整地约束高阶统计特性。这种方法实现了尺度和形状的优化互不干扰，有效解决了前代方法SIGReg在塌缩时梯度消失、以及尺度与形状耦合的问题。VISReg实现简洁，计算复杂度低，且易于扩展到大规模训练。实验表明，在未使用任何启发式技巧的情况下，VISReg在15个数据集（涵盖域内、分布外、医疗、天文等多领域）的综合评估中，表现优于或媲美DINO、MAE等7种主流方法。特别是在分布外泛化任务上，仅使用约十分之一的数据量，其性能便追平了使用十倍数据训练的DINOv2。此外，在迁移微调、低质量数据鲁棒性以及生成引导等任务上也显示出优势。 VISReg为自监督学习提供了一种更稳定、高效且泛化能力强的正则化方案，为构建更强大的JEPA世界模型奠定了基础。

marsbit12分钟前

marsbit12分钟前

阿根廷银行集团悄然开发面向机构市场的稳定比索币

尽管与美元挂钩的稳定币如USDC和USDT在阿根廷作为美元替代品广受欢迎，但当地金融科技公司已将目光转向本国货币稳定币。近期报告指出，两大银行控股集团正开发与阿根廷比索挂钩的稳定币，重点为机构客户提供可编程货币服务。其中，BIND集团将通过其虚拟资产服务提供商BEN开发比索稳定币，并与Circle合作，在法律框架内为BEN客户提供机构级支付和国库管理服务。另一家Petersen集团则通过子公司推进名为DIPE的项目，该项目已完成开发并拥有技术白皮书，其技术支持来自为多家银行提供解决方案的Lirium公司。这些举措的共同点在于，均由银行集团支持的公司推动，而非银行直接运营，这是因为阿根廷央行自2022年5月起禁止私有银行为客户提供加密货币相关服务。这些稳定币的主要目标用户是机构部门，可利用数字比索的智能特性进行支付，应用场景包括国库管理、基于区块链事件的支付以及抵押贷款管理等。尽管去中心化的比索替代方案已存在，但新项目将依托银行集团支持，并有望在未来扩展至私有银行。有消息称，央行正考虑解除对加密货币服务的禁令。然而，今年3月，一款名为“argt peso”的稳定币因未遵守适当规定而被国家证券监管机构认定为证券，并受到审查。

cryptonews.ru18分钟前

cryptonews.ru18分钟前

World Foundation 筹集5250万美元用于发展 World ID

World Foundation通过向战略投资者出售限制转让的WLD代币，筹集了5250万美元。本轮融资由专注于数字资产的Pantera Capital领投，参投方包括Bain Capital Crypto等机构，所购代币将锁定12个月。募集资金将用于全球推广World ID数字身份系统。该系统通过Orb设备扫描验证用户为真实人类，同时利用零知识证明等密码学技术保护个人隐私，不泄露具体身份信息。目前World Network已吸引超过3900万人加入，其中1800万用户通过Orb完成验证，系统已处理超4.75亿次World ID验证请求。公司计划借助最新推出的World ID 4.0平台，进一步扩大与企业客户和开发者的整合。

cryptonews.ru20分钟前

cryptonews.ru20分钟前

交易

现货

越过“内存墙”，AI推理时代的晶圆级革命与算力路线

文章摘要

Cerebras的本质:一台基于SRAM的近存计算机器

反直觉:晶圆级大芯片的“真假”硬伤

路线之争:大厂自研,Cerebras的窗口期还剩多久?

悬崖上的狂奔:Cerebras的商业与交付

尾声:向左还是向右?

热门币种推荐

相关问答

你可能也喜欢

卡尔达诺价格预测：霍斯金森对10亿美元RealFi的押注能否阻止ADA跌至0.14美元？

稳定币市场四年来首次大幅收缩

LeCun连续转发，新作VISReg攻克JEPA世界模型「表征坍塌」核心难题

阿根廷银行集团悄然开发面向机构市场的稳定比索币

World Foundation 筹集5250万美元用于发展 World ID

交易

热门文章

如何购买ERA

相关讨论

热门问答

热门分类

热门标签