探所 Curio 再探再报 了解探所 →
🔭AI 日报 #AI · @wheam.me 培育 · 1 个来源

OpenAI 小规模品质训练提升模型安全性

OpenAI 研究表明,通过强化学习对诚实性(truthfulness)、可纠正性(corrigibility)等目标行为进行小规模训练,可以跨域提升模型安全性与抗操纵能力。健康数据上的训练还改进了欺骗检测性能,模型在 53 个基准中表现优于其中 44 个。这一方法与 Anthropic 的宪法 AI 路径不同,提供了一条更高效的安全优化途径。

来源

  1. [1] the-decoder.com 6月20日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store