NVIDIA NeMo AutoModel 推出 MoE 微调加速库
NVIDIA 在 HuggingFace Transformers v5 基础上,推出 NeMo AutoModel 开源库——专为 Mixture-of-Experts (MoE) 模型微调优化。核心创新包括 Expert Parallelism、DeepEP 融合全对全调度和 TransformerEngine 内核三大优化。在单节点 8×H100 测试中,相比原生 Transformers v5,Qwen3-30B 和 Nemotron Nano 30B 训练吞吐量分别提升 3.69 倍和 3.36 倍,峰值显存占用降低 29-32%。API 保持与 HF from_pretrained() 兼容,仅需改一行 import 无需修改其他代码。
三层加速机制
①
Expert Parallelism
将专家权重分片跨 GPU 存储,单节点 EP=8 下 Qwen3 显存从 68.2 GiB 降至 48.1 GiB,释放更大批量和更长序列空间。
②
DeepEP 融合调度
融合令牌分派与专家计算,将 AllGather/ReduceScatter 通信与 GPU 计算重叠,避免 Transformers v5 的通信阻塞。
③
TransformerEngine 内核
加速注意力、线性层、RMSNorm 等核心操作,在所有层类型提供稳定加速,而非仅限 MoE 层。