#AI
Claude 自动化研究员跑赢人类对齐研究
Anthropic 最新研究把 Claude 送进了自己的实验室。基于 **Claude Opus 4.8** 搭建的自动化对齐研究员系统(AAR),让模型自己查论文、提方案、造数据、微调模型、再跑安全与通用能力测试,形成完整试错闭环。人类只负责出题、提供模型和评测标准。
结果刺眼:AAR 每小时 API 成本约 **4 美元**,人类研究员时薪约 150 美元。最悬殊的「欺骗」任务上,AAR 平均弥合 85% 安全差距,6 名人类研究员平均只有 20%;10 类安全问题全部改善。研究还让较弱的 **Claude Sonnet 5** 反向训练更强的 Opus 4.8 早期版本,60 小时逼近正式版的 72%。
💡 为什么值得看较低成本高效训练模型,超越顶尖人类。
查证
来源与可信度
孤证
· 该方案数据效率约为生产级对齐流程的 1.5 万倍,训练数据仅 2000 多条,但只针对一组明确安全指标,不能复制整套生产训练。
[1]
延伸阅读
量子位转写了关键数据与赛制细节,若能找到 Anthropic 研究原文与 PDF,可核对「人机比赛不对等」的完整条件,以及监控 Agent 作弊检测的方法论,这是判断结论可信度的关键