探所 Curio 再探再报 了解探所 →
#AI

Amazon Nova 推出 rDPO 选择性遗忘,降低过度审查

使用基础模型的企业常遇麻烦:模型内置的安全审核会误挡合法业务请求,如生成钓鱼邮件样本或处理成人语言剧本均被拦截,且这些「防卫」行为写死在模型参数中,无法通过提示词绕过。

Amazon Nova 推出 **rDPO(逆向直接偏好优化)** 选择性遗忘技术。它不止让模型「忘掉」防卫倾向,还能引导模型在放开限制的领域产出高质量回答。官方在 Nova 2 Lite 上实测,关闭安全审核后,拒绝率从 86.5% 降至 32.8%,指令遵循、数学和代码能力退化均不到 2 个百分点。

该能力通过 **CCMS(可定制内容审核设置)** 向获批客户开放,覆盖安全、敏感内容等维度,儿童保护等底线不可调整。适配器以独立模块加载,通过 AWS RAM 共享,客户用 Converse API 即可调用。

💡 为什么值得看新方法降低基础模型安全误伤率,放宽特定审核时保持回答质量,编程数学能力无显著损失。

查证

来源档案

AWS Machine Learning Blog

亚马逊云科技官方技术博客,由 Nova 模型团队撰写,详细介绍 rDPO 算法与 CCMS 产品设计

一手官方源,技术描述和内部评测数据可直接采信;实际使用效果仍依赖具体业务场景,尚未见第三方独立评测

延伸阅读

技术实现 · aws.amazon.com 约 12 分钟
博客包含 rDPO、NPO、DPO 三项损失函数的对比与训练动态图,适合做模型对齐研究参考
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store