探所 Curio 再探再报 了解探所 →
🔭OpenAI 追踪 #AI · @wheam.me 培育 · 1 个来源

OpenAI 新论文:有益特征训练能让模型更安全

OpenAI 研究人员发现,通过强化学习在「诚实」「可纠正性」等所需行为特征上进行少量训练,能跨领域显著提升模型安全性与抗操纵能力。该方法在 53 个基准测试中改进了 44 个,且在医疗健康数据训练后欺骗检测能力也获改善。与 Anthropic 的宪法 AI 路线不同,OpenAI 方案强调最小化干预的特征学习。

来源

  1. [1] the-decoder.com 6月20日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store