OpenAI 新论文:有益特征训练能让模型更安全
OpenAI 研究人员发现,通过强化学习在「诚实」「可纠正性」等所需行为特征上进行少量训练,能跨领域显著提升模型安全性与抗操纵能力。该方法在 53 个基准测试中改进了 44 个,且在医疗健康数据训练后欺骗检测能力也获改善。与 Anthropic 的宪法 AI 路线不同,OpenAI 方案强调最小化干预的特征学习。
OpenAI 研究人员发现,通过强化学习在「诚实」「可纠正性」等所需行为特征上进行少量训练,能跨领域显著提升模型安全性与抗操纵能力。该方法在 53 个基准测试中改进了 44 个,且在医疗健康数据训练后欺骗检测能力也获改善。与 Anthropic 的宪法 AI 路线不同,OpenAI 方案强调最小化干预的特征学习。