字节 Seed 提出 DanceOPD:多能力生图互不拖累
字节跳动 Seed 团队联合新加坡国立大学等高校,在 arXiv 上公开了一篇针对多能力生图模型冲突的论文 DanceOPD。前一天火山引擎 FORCE 原动力大会刚发布 Seedream 5.0 Pro 和 Seedance 2.5,这篇论文就给出了一个研究层面如何避免“加新能力、损旧质量”的方案。 问题背景很具体:即梦这类产品里,用户往往先文生图、再局部编辑、接着全局改写,希望一个模型全搞定。但现有的流匹配模型里,文生图、编辑等每种能力各对应一个“速度场”,直接融合就会互相拉扯,导致编辑能力崩塌或文生图质量下降。论文称这种现象为“能力身份缺失”。 DanceOPD 给出三条原则:硬路由让每个训练样本只向一个能力场学习,避免平均化;on-policy 蒸馏让学习发生在学生模型自己生成的轨迹上,而不是照抄老师的场面;只在低噪声端取一个点做速度对齐,用最简单的均方误差蒸馏。实验结果显示,这套方法在 GEditBench 的组合测试中比最强基线高 8.1%~16.1%,同时文生图基本功 GenEval 不降反升。论文还成功把 CFG 计算当作一个速度场一并吸收,意味着未来推理阶段可能省掉额外的 CFG 计算,对扛海量请求的即梦有真实成本意义。 该机制尚未进入任何产品版本,代码也还在等待开源;但它在研究层面证明了“增量加能力、不打翻已有能力”是可行的,恰好呼应字节图像模型线的快速迭代节奏。