英伟达MoE新开源:一行import,微调加速3.7倍

marsbit發佈於 2026-06-26更新於 2026-06-26

文章摘要

英伟达开源NeMo AutoModel,为MoE大模型微调提供高效方案。该工具基于Hugging Face Transformers v5开发,用户只需添加一行import代码,即可在不改动原有API的情况下,显著提升训练效率。 实验显示,在单节点8×H100 GPU上,相比原版Transformers v5,NeMo AutoModel在Qwen3-30B-A3B等模型上可实现3.4-3.7倍的训练吞吐量提升,同时GPU显存占用减少29%-32%。其核心技术包括专家并行(EP),通过将专家权重分布到多GPU来降低内存压力;DeepEP,融合计算与通信以减少延迟;以及TransformerEngine,对注意力机制等核心运算进行内核加速。 该方案尤其适合已使用Transformers v5的用户,能以最小代码变更获得性能大幅优化。代码与详细指南已在GitHub及英伟达文档中公开。

一行import,MoE大模型微调提速3.7倍

英伟达最新研究成果现已开源:NeMo AutoModel,专为大规模构建和微调生成式AI模型而打造。

在Hugging Face Transformers v5的基础之上,NeMo AutoModel能做到不改代码API,只添一行import,就实现对MoE模型更快速的微调。

实验显示,相比Hugging Face原版Transformers v5,英伟达NeMo AutoModel能在MoE微调中实现3.4-3.7倍训练吞吐提升,并减少29%-32% GPU显存占用

在单节点8xH100 80GB GPU上,以Qwen3-30B-A3B为例,NeMo AutoModel直接把TPS/GPU(每GPU每秒吞吐量)从3075拉到11340,提升达到3.69倍。

核心技术解析

MoE已经成为当前前沿模型的主流架构,但MoE也给高效训练带来了新的挑战:

专家并行、通信融合、kernel优化......这些复杂工程都需要配套的基础设施来支持。

HuggingFace的Transformers v5是目前被用得比较多的MoE训练“通用底座”。v5增强了对MoE的原生支持,引入了expert backends、dynamic weight loading、分布式执行等MoE基础能力。

这一次,英伟达的思路就是站在前辈的肩膀上,兼容HuggingFace Transformers的API,让大家能不大改代码,就在MoE微调里获得更高训练吞吐和更低显存占用

具体来说,NeMo AutoModel在Transformers v5的基础上,增加了专家并行(EP)DeepEPTransformerEngine

专家并行(Expert Parallelism)

专家并行技术主要用来降低内存压力。

EP把专家权重分布到了多个GPU上,每张GPU不再完整持有所有expert,而是只持有其中一部分参数。

举个例子,8张GPU上ep_size=8,专家权重被分布至8块GPU,每张GPU的MoE内存占用能降到原来的1/8

从实验结果来看,对于Qwen3,这项技术能将峰值内存从68.2GiB降至48.1GiB,降幅29%。

对于Nemotron Nanomo模型,内存占用从62.1 GiB降至42.5 GiB,降幅 32%。

释放出的空间可以用来支持更大批次、更长的序列。

DeepEP

DeepEP实现了计算和通信的融合。

传统方式里,token分发和专家计算之间有明显通信成本。DeepEP把token分发和组合操作整合进优化的GPU内核,实现了通信过程和专家计算的重叠。

TransformerEngine

TransformerEngine内核为各类核心运算提供加速。

这项技术提供了融合注意力机制、线性层和RMSNorm等实现,不只加速MoE层,也加速普通Transformer层。

一行import,3倍速度提升

总结来说,对于原本就用上了Transformers v5的盆友们来说,英伟达NeMo AutoModel带来了一个无痛升级方案:

只需加上一行import代码,即可获得3倍MoE微调速度提升。

在Qwen3-30B-A3B和Nemotron 3 Nano 30B-A3B上,相较于Transformers v5,该方案可以实现3.4-3.7倍的训练吞吐量提升,同时内存消耗降低29%-32%。

英伟达还展示了Nemotron 3 Ultra 550B A55B在16个H100节点、128张GPU上的全参数微调结果。

TPS/GPU为815,TFLOP/s/GPU约为293,峰值内存为58.2GiB。

这里没跟v5对比的原因,是Transformers v5在这种规模下会直接撑爆内存 ̄_(ツ)_/ ̄

感兴趣的话,英伟达已经把代码、配置和基准测试脚本都放在GitHub上了:https://github.com/NVIDIA-NeMo/Automodel/tree/blog/transformers-v5-automodel/blog_experiments

具体使用指南在这里:https://docs.nvidia.com/nemo/automodel/latest/get-started/hf-compatibility

本文来自微信公众号“量子位”,作者:鱼羊

熱門幣種推薦

相關問答

Q英伟达的NeMo AutoModel主要解决了什么问题?

ANeMo AutoModel主要解决了在微调MoE(混合专家)大模型时面临的效率问题。它旨在提升训练吞吐量并降低GPU显存占用,通过与Hugging Face Transformers v5 API兼容,使用户无需大量修改代码即可获得显著的性能提升。

QNeMo AutoModel相比Hugging Face Transformers v5,在训练吞吐和显存占用上具体提升了多少?

A根据实验,相比Hugging Face Transformers v5,英伟达NeMo AutoModel在MoE微调中实现了3.4-3.7倍的训练吞吐提升,同时减少了29%-32%的GPU显存占用。以Qwen3-30B-A3B为例,在8xH100 GPU上,每GPU每秒吞吐量从3075提升到了11340。

QNeMo AutoModel在技术层面主要引入了哪三项关键技术?

ANeMo AutoModel在Transformers v5的基础上,主要引入了三项关键技术:1. 专家并行(EP),用于将专家权重分布在多个GPU上以降低内存压力;2. DeepEP,通过融合计算和通信来减少通信成本;3. TransformerEngine,为注意力机制、线性层等核心运算提供优化的GPU内核加速。

Q什么是专家并行(EP)?它带来了什么好处?

A专家并行(EP)是一种分布式训练技术,它将MoE模型中的专家权重分布到多个GPU上,每张GPU只持有部分专家参数。这样做的好处是大幅降低了单张GPU的内存占用(例如在8张GPU上可降至原来的1/8),从而可以支持更大的批次大小或更长的序列长度进行训练。

Q如何开始使用NeMo AutoModel来加速MoE模型的微调?

A对于已经使用Hugging Face Transformers v5的用户,只需在代码中添加一行导入(import)NeMo AutoModel的语句,无需大规模修改现有代码和API,即可实现对MoE模型更快速的微调,获得更高的训练吞吐和更低的显存占用。具体代码和指南可以在GitHub和NVIDIA NeMo文档中找到。

你可能也喜歡

解析稳定币真实使用场景与区域机会

本文基于对152亿美元已识别国家来源的链上稳定币转账数据分析,揭示了其真实使用场景与区域机会。关键发现如下: 1. **稳定币交易以“境内”为主**:在可识别交易量中,境内转账占比高达62.6%,规模达95亿美元。土耳其、韩国、墨西哥、印尼和美国是前五大市场,合计贡献近80%的境内交易量。这表明稳定币在本国市场内广泛用于支付、交易和美元储蓄,境内结算服务是当前更重要的市场。 2. **跨境资金呈现区域化流动**:包含境内转账,73%的交易量发生在发送方所在大洲内部。尤其在亚太地区,79.5%的资金留在了本区域。在跨境交易中,亚太区域内部流动依然显著,如台湾与印尼、印尼与韩国之间已形成规模可观的支付通道,为区域支付基础设施建设提供了明确需求基础。 3. **亚太地区是核心市场**:亚太地区发送和接收的交易量分别占全球的41.0%和42.1%,境内交易量占比41.6%。全球前15大跨境支付通道中,有9条涉及亚太市场,印尼在6条通道中出现。此外,亚太整体呈现稳定币净流入,印尼、新加坡和韩国是主要净流入地。 **结论**:对于机构而言,当前最值得关注的市场机会在于**为本国市场提供境内结算服务**,以及在**亚太地区构建跨境支付通道**(如台湾-印尼、印尼-韩国等)。亚太地区凭借最大的交易规模、高境内需求及资金净流入,已成为稳定币生态的核心区域。

marsbit28 分鐘前

解析稳定币真实使用场景与区域机会

marsbit28 分鐘前

2万亿美元,AI史上最大IPO进入倒计时

AI公司Anthropic预计将于今年十月进行IPO,估值可能突破2万亿美元,这将是史上最大规模的AI公司上市。其估值由六位投资人根据模型推算得出,其中有人甚至预估超过3万亿美元。公司内部对此并未设定明确目标。 Anthropic在短短五年内实现了惊人增长,从初创公司迅速跻身巨头行列。2025年底年化收入约90亿美元,到2026年5月已飙升至470亿美元,第二季度营收达115亿美元,同比激增14倍。内部预测,到2028年营收可能达到1900亿至2000亿美元。 公司收入主要依靠API和企业合同,按调用量计费,其中编程辅助工具Claude Code是增长核心,贡献近两成收入,在企业和开发者中广泛使用。 然而,公司内部正面临文化撕裂。CEO达里奥·阿莫代伊及其核心团队带有强烈的“拯救人类”使命感,被部分员工形容为“祭司阶层”,其管理风格引发基层员工不满,甚至出现了秘密的吐槽网络。员工在即将到来的财富自由与压抑的工作环境之间陷入挣扎。 Anthropic目前处境微妙:追求最安全的AI需要巨额算力投入,而这又依赖于资本市场支持,迫使公司在理想与商业现实间寻找平衡。其IPO前景虽被看好,但SpaceX上市后股价大跌的前例,以及监管、成本和内部治理等挑战,都为其未来增添了不确定性。

marsbit3 小時前

2万亿美元,AI史上最大IPO进入倒计时

marsbit3 小時前

降本增效的AI,让VC越来越烧钱

《降本增效的AI,让VC越来越烧钱》一文指出,尽管AI技术降低了创业公司的部分运营和开发成本,却推高了风险投资(VC)获取优质AI公司股权的价格。AI领域融资呈现“杠铃型”结构:一方面,普通初创企业融资规模趋于小额化;另一方面,顶尖团队(如来自OpenAI、Google DeepMind的核心人员)的早期项目估值急剧膨胀,数亿甚至上百亿美元的融资与估值在成立初期便已出现。 这种趋势导致VC持股成本显著上升。早期估值飙升的同时,创始人让渡的股权比例并未同步增加,使得VC为维持相同持股比例所需投入的资金大幅增加。为此,大型风投机构(如Accel、a16z)纷纷募集更大规模的基金,以覆盖从早期进入到后期跟投的全周期,确保在头部项目竞争中不落下风。 资金进一步向少数头部AI项目集中。2026年上半年,全球超70%的创业融资流向AI公司,其中OpenAI和Anthropic两家就占据了全球创业融资总额的43%。这种集中化加剧了VC行业的马太效应,大型基金凭借资金优势持续加码潜在赢家,而小型基金参与热门项目的能力受到削弱。 然而,高估值已提前计入了未来增长预期。若企业最终无法实现与估值匹配的商业化规模,投资回报将面临压缩。目前,许多基金的账面收益仍依赖后续融资的估值重估,而非实际退出。对大型VC而言,当下的核心策略已转变为:在技术“超级周期”中尽早押注潜在龙头,并为伴随估值飙升的持续跟投储备充足弹药。AI降低了创业门槛,却让投资优质AI公司的成本变得愈发昂贵。

marsbit4 小時前

降本增效的AI,让VC越来越烧钱

marsbit4 小時前

交易

現貨

熱門文章

如何購買ONE

歡迎來到HTX.com!在這裡,購買Harmony (ONE)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買Harmony (ONE)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的Harmony (ONE)購買Harmony (ONE)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易Harmony (ONE)在HTX的現貨市場輕鬆交易Harmony (ONE)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

1.0k 人學過發佈於 2024.12.12更新於 2026.06.02

如何購買ONE

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 ONE (ONE)幣價的意見。

活动图片