大模型内存焦虑,办法被想到了U盘上

marsbit发布于2026-07-20更新于2026-07-20

文章摘要

大模型推理面临内存容量与成本压力,传统HBM高速但昂贵且容量有限。SanDisk与SK海力士提出新方案:利用U盘同款的NAND Flash技术,通过先进封装堆叠多颗芯片,打造高带宽闪存(HBF)。HBF专注于读取,目标实现单堆栈512GB容量和最高1.6TB/s带宽,虽速度不及HBM,但成本更低、容量更大。 其核心定位是补充而非取代HBM。在AI推理阶段,模型权重等大量静态数据只需频繁读取,无需频繁写入,这正好匹配Flash读取相对较快、写入较慢的特性。HBF可作为“大容量只读内存池”,存放海量模型参数,从而释放昂贵的HBM专用于处理热数据。这种分层设计有望缓解HBM容量瓶颈,降低部署大模型所需的加速卡数量和整体系统成本与能耗。 目前HBF标准仍在制定中,距离量产尚需时日,但它预示了AI内存架构正走向更精细的分工。未来,HBM、HBF与SSD可能形成协同的分层存储体系,让不同类型的数据驻留在性价比最合适的层级,以更经济的方式支撑持续增长的模型规模。

不是,Flash不是很慢吗?SanDisk和SK海力士怎么拿它喂大模型了???

IEEE最新刊发了一条挺反常识的新思路:大模型的内存焦虑,可能要靠U盘里的同款技术来缓解了。

没错,就是NAND Flash

在不少人的印象里,Flash最大的特点是便宜、容量大、断电还不丢数据,但要说速度,尤其是拿来驱动大模型推理,似乎怎么都不像正经方案。

但现在,SanDisk和SK海力士正在推动一种新东西:High Bandwidth Flash(高带宽闪存),简称HBF。

它的思路很直接:把HBM(高带宽内存)那套先进封装和芯片堆叠的方法,搬到NAND Flash上。

换句话说,就是让原本负责存东西的闪存,也能参与到AI推理的高速数据供给里。

根据SanDisk公开资料,HBF预计可以堆叠最多16颗NAND Flash芯片,目标单个堆栈容量最高可达512GB,目标读取带宽最高可达1.6TB/s

后续第二代、第三代路线图里,读取带宽还会进一步提升到2TB/s3.2TB/s

这个数字虽然还追不上顶级HBM,但已经不是传统闪存那种“慢吞吞存储”的状态了。

这一技术突围的背后,可能是全球存储行业亟待化解的供应紧缺困局。

就在前几天(北京时间7月11号),韩国存储巨头SK海力士的首席执行官郭鲁正曾在美股纳斯达克首秀之日公开表示,全球存储行业预计将在2027年面临史上最严重的供应短缺,该言论迅速引爆资本市场与产业舆论。

在此背景下,SK海力士携手SanDisk推出HBF,或许正是他们为了缓解存储供应紧张交出的一份技术答卷。

一起来看看吧。

Flash不是很慢吗,怎么能给AI用?

问题来了,Flash不是出了名的写入慢吗?怎么突然能给AI用?

半导体市场研究机构Objective Analysis总监Jim Handy在IEEE Spectrum采访中就提到,很多人第一反应也是这个:这怎么说得通?Flash明明慢得离谱。

但关键在于,Flash慢,主要慢在写入。

NAND Flash通过浮栅晶体管里的电荷来存储数据,并按块和页进行组织。这种机制使其断电后仍能保留数据,无需像DRAM那样不断刷新,因此天然适合长期存储,兼具高密度与低成本的优势。

不过代价就是,写入数据时,需要把电荷推进或移出绝缘栅,这个过程比给电容充放电慢得多。

所以在传统计算视角下,Flash很难和DRAM、HBM这类高速内存放在一个桌上讨论。

但如果只看读取,事情就不一样了。

按最新ONFI 6.0闪存接口标准,单颗die理论带宽最高可以到4.8GB/s。

单看这个数字,确实不算夸张。

DDR5单条DIMM最高可到70.4GB/s,HBM4E单堆栈更是能到3.6TB/s,和单颗NAND闪存芯片相比大约是750倍量级差距。

HBF要做的,就是通过3D封装和垂直堆叠,把多个NAND Flash die打包到一起,显著提高总读取带宽。

SK海力士内存系统研究高级副总裁Hoshik Kim指出:“通过将先进的3D封装和垂直堆叠技术应用于NAND闪存,HBF能够实现远超标准NVMe存储的带宽。”

正如HBM堆叠DRAM芯片一样,HBF则通过堆叠NAND闪存裸片,打造出高存储密度的芯片。

他们想做的,从来不是让单颗Flash突然变快,而是通过堆叠和封装,把读取通道堆出来。

HBF不是要取代HBM,它找准了自己的定位

HBF真正有意思的地方,不在于它要取代HBM。

而在于它找准了一个很适合Flash的场景:AI推理。

训练和推理,对内存的要求并不一样。

训练大模型时,系统要不断读取权重、计算误差,再通过反向传播更新权重;

这个过程既要大量读,也要大量写,对Flash非常不友好;

因为Flash写入慢,写多了还涉及寿命和擦写管理问题。

但推理阶段就不一样了。

在这个阶段,模型已经完成训练,权重基本冻结,大多数时候,系统需要的是把这些庞大的模型权重快速读出来,而不是频繁改写它们。

这正好落在Flash相对擅长的一侧。

SK海力士内存系统研究高级副总裁Kim表示:“在推理环境中,诸如静态的数十亿参数模型权重或预计算的KV缓存(precomputed KV cache)等海量、读密集型数据,均可稳妥地存放于HBF层级。”

这样一来,昂贵且容量有限的HBM就能被释放出来,专门充当高速暂存区。

这个架构有点像给AI加了一层“超大容量只读内存池”

HBM继续负责最紧急、最频繁的高速计算数据交换。

HBF则负责装下那些体量巨大、但不怎么改动的模型参数。

对当下的大模型推理来说,这个思路很有现实意义。

因为当前大模型推理所面临的困境早已不止于算力短缺,内存不够、带宽不够、能耗太高、部署成本太贵等多重压力正交织叠加。

尤其是在模型规模持续膨胀的大背景下,单卡显存容量不足与HBM成本高昂正成为制约其发展的显著因素。

很多时候,不是GPU算不动,而是模型装不下,或者数据喂不过来。

而HBF如果能在容量、带宽和成本之间找到平衡,就可能让更大的模型以更低的成本跑起来。

512GB一堆栈,AI服务器或可少用几张卡

SanDisk给出的第一代HBF目标参数,最高为512GB容量、1.6TB/s读取带宽。

这个组合很关键——HBM的优势是速度极快,但容量昂贵且有限;HBF虽然速度低一些,却能提供更大的容量和更低的单位成本。

这意味着,未来AI服务器在部署大模型推理时,可能不一定要把所有权重都塞进HBM。

一部分冷一点、静态一点、读多写少的数据,可以放在HBF里。

这样做的潜在收益有几个:

第一,缓解HBM容量瓶颈。

第二,减少为了装下模型而堆更多加速卡的需求。

第三,降低推理系统整体成本和能耗。

Kim的判断是:HBF与HBM并不是竞争对手,而是互为补充的工具。

他指出:“HBF能够在不牺牲数据供给速度的前提下,有效缓解HBM面临的严峻容量瓶颈,从而有望减少运行大规模模型所需的加速器数量。”

在此基础上,他预计该方案还将提升能效并降低成本,进而助力数据中心进一步扩展其AI推理硬件规模。

这也是HBF最值得关注的产业逻辑:它不是为了让Flash变成HBM,而是让AI系统里的不同数据,待在更适合自己的位置里。

热数据继续放HBM;大容量、静态、读密集数据放HBF;更低速、更便宜的数据继续放SSD或其他存储。

如果这套分层成立,AI推理硬件的内存架构可能会多出一个新层级。

规模化落地尚远,但大模型内存体系已现分工新信号

当然,HBF目前还不是一个成熟的产品。

据IEEE Spectrum报道,HBF至少还需要一年才可能出货,距离大规模部署可能还要几年。

今年2月25日,SanDisk和SK海力士已联合举办启动活动,宣布在开放计算项目OCP下推动HBF标准化工作。

作为数据中心硬件领域重要的开放产业组织,OCP主导制定了大量服务器、机柜、电源及加速器相关规范,如服务器规范DC-MHS、加速器规范OAI-OAM等。

但目前,HBF标准还在推进中,正式发布时间尚未确定——这也意味着,HBF在短期内还不会马上改变AI服务器市场。

它更像是一个提前浮出水面的信号:AI推理正在逼着存储和内存体系重新分工。

过去,大模型硬件的关注点集中在GPU、HBM和互联。

但当模型越来越大、推理请求越来越多,瓶颈就会从“算得快不快”,扩展到“装不装得下”“读不读得动”以及“电费扛不扛得住”。

HBF切入的,正是这个缝隙。

AI内存战争,可能不只属于HBM

有意思的是,SK海力士本身就是HBM最大赢家之一。

HBM正在给它带来创纪录收入,按理说,推出一种更便宜的替代性技术,似乎不太符合商业直觉。

但从系统角度看,HBF并不一定会抢HBM的饭碗。

AI服务器未来需要的不是单一内存,而是分层内存。

HBM负责极致性能,HBF负责大容量高带宽读取,SSD负责更低成本的大规模存储。

这套组合如果跑通,反而会让AI推理系统变得更可扩展。

简单说就是:不是每一份模型数据,都值得住进HBM的“豪宅”。 有些数据,只需要一个容量够大、读取够快、成本更低的位置。

HBF想做的,就是这个位置。

从U盘、SD卡里的NAND Flash,到AI服务器里的高带宽模型权重池,听起来跨度很大,但大模型的问题已经很清楚:参数越来越多,推理越来越贵,HBM越来越紧。

而解决方案,未必只来自更贵的内存,也可能来自把熟悉的老技术,重新封装一遍。

参考链接:

[1]https://spectrum.ieee.org/high-bandwidth-flash?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-07-15&itm_content=hero6

本文来自微信公众号“量子位”,作者:葛文婷

相关问答

Q什么是高带宽闪存(HBF),它与传统NAND闪存的主要区别是什么?

A高带宽闪存(HBF)是一种新型存储技术,由SanDisk和SK海力士推动。它将HBM(高带宽内存)的先进封装和芯片堆叠技术应用于NAND闪存芯片,通过堆叠最多16颗NAND芯片,目标实现最高512GB容量和1.6TB/s的读取带宽。与传统NAND闪存相比,HBF通过增加堆叠和并行通道,显著提升了读取带宽,使其能参与到AI推理的数据供给中,而不仅仅是作为低速存储设备。

QHBF技术主要针对AI的哪个应用场景?为什么是这个场景?

AHBF技术主要针对AI推理场景。因为在AI推理阶段,模型已经完成训练,权重参数基本是静态的,系统主要需要快速、频繁地读取这些庞大的模型数据,而很少进行写入操作。NAND闪存虽然写入慢,但读取性能相对较好,且成本低、容量大,正好适合存放推理所需的读密集型数据。这可以缓解昂贵且容量有限的HBM的压力。

Q文章中提到HBF预计能带来哪些潜在收益?

AHBF预计能带来以下潜在收益:1. 缓解HBM(高带宽内存)面临的容量瓶颈。2. 减少为装载大模型而需要的加速器(如GPU)数量,从而降低整体系统成本。3. 提升AI推理系统的能效。4. 通过在内存体系中增加一个“大容量、高带宽读取、低成本”的新层级,使AI推理硬件架构更具扩展性。

Q推动HBF技术发展的产业背景是什么?

A推动HBF技术发展的主要产业背景是:1. 全球存储行业预计将在2027年面临严重的供应短缺。2. 大模型规模持续膨胀,导致AI推理面临内存容量不足、带宽不够、成本高昂和能耗过大等多重压力。HBF作为一种可能的新方案,旨在利用成熟、相对低成本的NAND闪存技术,通过新的封装方式满足AI推理对海量、静态数据的高速读取需求,是对现有存储和内存体系的一种补充和优化。

Q根据文章,HBF技术目前处于什么阶段?它面临的挑战是什么?

AHBF技术目前仍处于早期阶段,尚未成熟。具体来说:1. 它至少还需要一年才可能出货,距离大规模部署可能还需几年时间。2. 其技术标准正在开放计算项目(OCP)下推动制定,正式发布时间尚未确定。面临的挑战包括:技术本身需要时间发展和验证;需要建立行业标准;需要与现有的HBM、DRAM、SSD等存储层级进行有效整合,构建高效的分层内存体系。

你可能也喜欢

大模型蒸馏时代结束:Fable 5.1改写API,彻底切断蒸馏后路

轰轰烈烈的大模型蒸馏时代面临终结。2026年9月2日,Anthropic发布了Claude Fable 5.1,对API规则进行了堪称史上最严格的反蒸馏改造。 核心改动是锁定了“思考块”——即AI在输出最终答案前的内部推理过程。此前,非法蒸馏者通过在多轮对话中篡改思考块前后的上下文(如系统提示或历史消息),能诱导模型泄露其底层逻辑。Fable 5.1引入了“上下文一致性验证”:若API检测到客户端传回的思考块与原始生成它的上下文有任何不一致,将直接报错拒绝服务。对于确需修改上下文的合法开发者,系统提供“非严格模式”,但在此模式下所有思考块将被静默删除,模型将失去先前推理记忆。 Anthropic此举事出有因。过去一年,工业级规模的非法蒸馏滥用猖獗,攻击者使用海量虚假账户和自动化脚本,通过“上下文注入”等技术“催眠”模型以提取核心能力。这导致了严重的“能力与安全脱钩”:蒸馏出的小模型继承了顶尖模型的智能,却绕过了耗费巨资构建的安全护栏与价值观对齐,可能被用于生成恶意代码或危险内容,构成巨大风险。 新规将分阶段执行,首先适用于2026年8月31日后创建的新API账户,现有老账户及消费端普通用户暂不受影响。受影响的开发者需调整代码逻辑,确保上下文完全一致或使用非严格模式。Anthropic明确,该机制未来将适用于所有账户。 新规也为合法开发者带来意外好处:由于强制上下文一致性,API服务器可实现高效的提示词缓存,从而大幅降低响应延迟和调用成本。 此次更新标志着行业分水岭,依靠套取API数据“走捷径”的训练方式将被彻底堵死。

marsbit41分钟前

大模型蒸馏时代结束:Fable 5.1改写API,彻底切断蒸馏后路

marsbit41分钟前

刚刚,Claude首次证明费马大定理,清华姚班大神出手了

近日,人工智能领域取得一项突破性进展。由清华姚班毕业生、哥伦比亚大学助理教授彭天翼带领的Anthropic研究团队,利用其AI模型Claude,在11天内完成了对费马大定理的首次端到端机器验证证明。 费马大定理是一个困扰数学界超过350年的著名数论难题,直到1995年才由英国数学家安德鲁·怀尔斯给出复杂的人类证明。此次Claude的工作并非发现新证明,而是将现有证明“形式化”——即把人类可读的数学论证转化为计算机可严格验证的代码。 整个证明过程基本由AI自主完成。Claude生成了约1300万行代码,定义了超过3万条可验证定理(其中2.95万条被最终采用),消耗了约600亿Token的计算资源。其生成的代码规模是目前全球最大数学定理库Mathlib的五倍以上,并仅依赖于三条最基础的数学公理。 成功的关键在于团队开发的全新平台“Prove2Me”。该平台通过定理任务树、陈述与证明分离、自然语言索引等技术,有效协调了几十个Claude智能体进行高效、并行的协作,克服了大模型常见的“健忘”和逻辑混乱问题,使大规模形式化证明成为可能。 这一成果获得了数学界的积极评价。有专家认为,这是现代数学文献自动形式化的重要一步,未来可用于检查现有数学成果中的错误,并验证AI生成的数学结论。该技术也展示了潜力:在后续测试中,仅用3个普通账号和3天时间,就完成了另一数论定理“维诺格拉多夫三素数定理”的形式化。 研究团队强调,AI的目标并非取代数学家,而是彻底改变数学工作的方式。通过提供强大的自动验证工具,AI有望终结数学证明中长期存在的“不确定性”,让数学家能更专注于创造性的思考,并将“附带机器可验证代码”可能成为未来数学论文的新标准。 此次突破标志着AI在深层次逻辑推理和复杂系统协作方面取得了显著进展,为数学及其他科学领域的自动化验证开启了新的可能性。

marsbit44分钟前

刚刚,Claude首次证明费马大定理,清华姚班大神出手了

marsbit44分钟前

Raoul Pal:为什么传统投资组合已然失效?

Raoul Pal指出,传统投资组合(包含债券、黄金、房地产、指数基金)在当今宏观环境下已然失效。其核心原因在于,全球经济增长高度依赖债务扩张,导致货币供应量以约每年8%的速度增长,加上日常通胀,投资者需要实现年化约11%的收益率才能维持购买力不缩水。 逐一评估主流资产:债券收益固定但无法对冲货币贬值;房地产抗贬值能力已大不如前;黄金能保值但难以创造新增财富;标普500指数在过去十年超级牛市中勉强达标。真正能持续超越11%收益基准的,只有科技资产与加密资产,因其遵循用户渗透的S型增长曲线,具备长期复利潜力。 传统分散配置失效,是因为这些资产现在都受同一宏观变量(流动性)驱动,不再提供真正的风险对冲。真正的资产配置不应只看标的数量,而应将资金集中于具有长期增长潜力的赛道。对于加密资产,底层公链作为基础设施,比押注单一应用更具确定性和增长空间。未来AI智能体作为经济参与者,将催生对可编程货币和链上结算的巨大真实需求。 投资者需正视风险:避免全仓单一资产、严禁使用杠杆。建议分层布局,保留部分传统资产以求安心,配置一部分资金于高成长性资产,并长期持有。最终,跑赢11%的基准线关乎的不仅是财富数字,更是获得人生选择权和财务自由的关键。

marsbit2小时前

Raoul Pal:为什么传统投资组合已然失效?

marsbit2小时前

交易

现货
活动图片