#AI
Anthropic 研究员 Coxon 离职,警告豪赌超级智能
Anthropic 预训练阶段研究员 **Jacob Coxon** 本周离职,在 X 上发文警告公司正「冲刺自我改进超级智能、拿我们的性命赌博」,并称那些系统「到本十年末可能杀死我们所有人」——这不是外界对 Anthropic 的批评,而是从内部发出的。
更少见的反应来自公司内部:Anthropic alignment 负责人 **Evan Hubinger** 公开附和,说自己**真心相信 AI 可能在十年内杀死全人类,概率超过 10%**,而不是把这句话收回。Coxon 对 WIRED 说,「未来一两年是人类的 crunch time」不是他的措辞,而是 Anthropic 同事的原话,内部把这件事当成**没有政府授权的私人曼哈顿计划**。
💡 为什么值得看Anthropic 高层附和警告,且正值史上最大 IPO 筹备期。
他还说了什幺
- **具体建议**:第一步是 OpenAI 与 Anthropic 协调,限制「递归自我改进」——即用 AI 造新 AI;更远则需美国与中国等大国介入协调。
- **对两家的评价**:在 OpenAI 与 Anthropic 都工作过的 Coxon 称两家「天壤之别」,Anthropic 远为负责,但结构性的竞赛压力会逼它在未来抄近路。
- **公司自己的文档**:Anthropic alignment 团队 8 月报告称当前模型「灾难性风险」为低,但承认趋势可能导向更强模型的失准,威胁模型把「人类失去对文明的控制」写入可能后果。
查证
来源与可信度
孤证
· Coxon 称「未来一两年是人类的 crunch time」是 Anthropic 同事的原话…
[2]
延伸阅读
WIRED 的问答访谈里 Coxon 讲清了 alignment 问题与灭绝风险的连接、他判断离职发声的触发点,以及他对 Anthropic 与 OpenAI 的对比——比二手的播客解读具体得多。
Ars Technica 把 Hubinger 的公开附和与 Anthropic alignment 团队 8 月报告里的原文措辞放在一起,能看出公司书面威胁模型与对外表述之间的张力。