字节跳动发布 iLLaDA 扩散语言模型,基础版性能持平 Qwen2.5
字节跳动与人民大学研究人员发布 iLLaDA,一个 8B 参数的全双向掩码扩散语言模型,采用与 GPT / Claude 不同的生成方式。iLLaDA 在预训练阶段使用 12T token(前代 LLaDA 为 2.3T),在指令微调后于 12 个 epoch 完成训练。基础版 iLLaDA 性能平均得分 63.9 分,略优于 Qwen2.5 7B 的 63.3 分,在 BBH 推理测试上领先 7.6 分;但指令版本因缺少强化学习对齐而明显落后,iLLaDA-Instruct 67.1 分 vs Qwen2.5 7B Instruct 77.1 分,尤其在数学与代码任务差距明显。同期 Google 也发布了 DiffusionGemma(26B MoE),可实现 4 倍加速但精度较低,主要针对低延迟场景;iLLaDA 则是从零开始训练以追求质量,代表了扩散模型的另一条探索路线。
iLLaDA vs 传统自回归模式对比
①
架构创新
iLLaDA 采用掩码扩散而非自回归生成:从一系列占位符(掩码 token)出发,多轮并行优化每个位置,每个位置可同时关注其他所有位置,实现完全双向注意力。与从噪声逐步生成图像的扩散图像模型类似。
②
性能权衡
基础版追平自回归对手:iLLaDA-Base 63.9 分 vs Qwen2.5 7B 63.3 分,在 BBH(71.3 vs 63.9)、ARC-C(60.8 vs 51.5)、GSM8K(81.9 vs 78.9)上领先;但指令版本(67.1 分)相比 Qwen2.5 Instruct(77.1 分)有 10 分差距,主要因缺少 RL 对齐。
③
工程优化
采用分组查询注意力(grouped-query attention)降低推理显存,共享输入输出嵌入减少参数量,改进学习率调度以适配大规模训练,指令阶段采用可变长度生成提升推理效率。