英伟达MoE新开源:一行import,微调加速3.7倍
英伟达开源NeMo AutoModel,为MoE大模型微调提供高效方案。该工具基于Hugging Face Transformers v5开发,用户只需添加一行import代码,即可在不改动原有API的情况下,显著提升训练效率。
实验显示,在单节点8×H100 GPU上,相比原版Transformers v5,NeMo AutoModel在Qwen3-30B-A3B等模型上可实现3.4-3.7倍的训练吞吐量提升,同时GPU显存占用减少29%-32%。其核心技术包括专家并行(EP),通过将专家权重分布到多GPU来降低内存压力;DeepEP,融合计算与通信以减少延迟;以及TransformerEngine,对注意力机制等核心运算进行内核加速。
该方案尤其适合已使用Transformers v5的用户,能以最小代码变更获得性能大幅优化。代码与详细指南已在GitHub及英伟达文档中公开。
marsbit06/26 07:28