探所 Curio 再探再报 了解探所 →
#AI

亚马逊发 Nova Forge 多轮强化学习自定义奖励函数教程

亚马逊在 AWS Machine Learning blog 发布教程,介绍 Amazon Nova Forge 多轮强化学习中自定义奖励函数的设计。内核结论:奖励函数决定模型学到的内容,错误奖励会在训练曲线正常时静默误导模型。

教程指出一个真实案例:权重最高的奖励组件因对组内所有 rollout 给相同分数,不产生组内差异,导致其在整个训练中无学习信号贡献。建议通过组件级监控埋点暴露此类失效。

奖励设计基于 500 编程任务,训练 Nova Lite 2.0。四组件加权(正确率 1.0、先提问 0.6、立即猜测罚分 0.4、循环罚分 0.2),配合 GRPO 与 LoRA,使模型先澄清需求再编码。安全机制包括随机哨兵、资源限制与无网络凭证,确保代码执行可靠。

💡 为什么值得看揭示了多轮 RFT 奖励设计的隐蔽陷阱,权重最高的组件可能完全没有学习信号,值得做对齐工作的人细看。

多轮奖励设计要点

  • **三种信号组合**:结果奖励(最终任务完成)、行为奖励(中间行为正确)、惩罚项(阻止坏策略),互相配合避免梯度信号互相淹没
  • **不要给行为奖励加条件**:想要的行为要单独记分,不依赖最终结果,否则早期训练阶段结果奖励接近零、行为奖励也被饿死
  • **同组零方差警告**:奖励项对组内所有 rollout 取相同值,该组件不创造梯度,等价于没有这一项

查证

来源档案

AWS Machine Learning blog

亚马逊官方技术博客,Amazon Nova Forge 产品团队的一手教程

一手技术文档,示例代码和训练细节来自真实生产环境,数字与配置可直接采信;属于厂商自身发布的技术内容,不存在爆料或二手转述的不确定性

延伸阅读

中文读者 · aws.amazon.com 约 15 分钟
需读原文核对 Nova Forge 的 API 参数、代码模板及 metrics_list 埋点写法,总结无法完整呈现。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store