探所 Curio 再探再报 了解探所 →
#AI

Claude 自动化研究员跑赢人类对齐研究

Anthropic 最新研究把 Claude 送进了自己的实验室。基于 **Claude Opus 4.8** 搭建的自动化对齐研究员系统(AAR),让模型自己查论文、提方案、造数据、微调模型、再跑安全与通用能力测试,形成完整试错闭环。人类只负责出题、提供模型和评测标准。

结果刺眼:AAR 每小时 API 成本约 **4 美元**,人类研究员时薪约 150 美元。最悬殊的「欺骗」任务上,AAR 平均弥合 85% 安全差距,6 名人类研究员平均只有 20%;10 类安全问题全部改善。研究还让较弱的 **Claude Sonnet 5** 反向训练更强的 Opus 4.8 早期版本,60 小时逼近正式版的 72%。

💡 为什么值得看较低成本高效训练模型,超越顶尖人类。

查证

来源与可信度

· Anthropic 发布研究:基于 Claude Opus 4.8 搭建的 AAR 自动化对齐研究员系统,在 10 类 AI 安全问题上全部找到改进方案。 [1][2]
· AAR 每小时 API 推理成本约 4 美元,而人类研究员时薪约 150 美元;在欺骗任务上 AAR 平均弥合 85% 安全差距,6 名人类研究员平均仅 20%。 [1][2]
· 较弱 Claude Sonnet 5 训练更强 Claude Opus 4.8 早期版本,60 小时测试 50 多种方案,弥合约 65% 安全差距,接近正式版 72%。 [1][2]
孤证 · 该方案数据效率约为生产级对齐流程的 1.5 万倍,训练数据仅 2000 多条,但只针对一组明确安全指标,不能复制整套生产训练。 [1]

延伸阅读

官方论文原文 · qbitai.com
量子位转写了关键数据与赛制细节,若能找到 Anthropic 研究原文与 PDF,可核对「人机比赛不对等」的完整条件,以及监控 Agent 作弊检测的方法论,这是判断结论可信度的关键
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store