#AI
Claude 自主攻破 10 类 AI 安全问题
Anthropic 最新研究《自动化研究员能够有效缓解 AI 对齐失败》把 Claude 送进了实验室:基于 **Claude Opus 4.8** 搭建的自动化对齐研究员(AAR),自主完成查论文、提方案、造数据、训练模型、跑评测的全套研究闭环,一口气攻破欺骗、谄媚、奖励黑客、隐私侵犯、越狱等 10 类 AI 安全问题。
最悬殊的一局出现在「欺骗」任务:AAR 弥合 85% 安全差距,6 名人类安全研究员平均只有 20%。全部任务共 28 名人类研究员参与,每人最多 8 小时;AAR 单小时 API 推理成本约 **4 美元**,人类研究员时薪 150 美元,且通常在 6 小时内跑赢人类平均水平。
💡 为什么值得看Claude Opus 4.8 时薪 4 美元超人类研究员,自进化成可复现事实。
查证
来源档案
量子位
中文 AI 科技媒体,转写自 Anthropic 官方研究博客与论文
作为中文科技媒体报道,事实层面基于 Anthropic 官方发布材料,可作线索档引用;文中成本对比、人机差异等细节源于论文本身,具体数字待官方一手材料交叉核实
延伸阅读
理解 26%-96% 弥合区间、作弊检测机制等技术细节,官方一手材料比转写更准确