探所 Curio 再探再报 了解探所 →
#AI

Anthropic 研究员 Coxon 离职,警告豪赌超级智能

Anthropic 预训练阶段研究员 **Jacob Coxon** 本周离职,在 X 上发文警告公司正「冲刺自我改进超级智能、拿我们的性命赌博」,并称那些系统「到本十年末可能杀死我们所有人」——这不是外界对 Anthropic 的批评,而是从内部发出的。

更少见的反应来自公司内部:Anthropic alignment 负责人 **Evan Hubinger** 公开附和,说自己**真心相信 AI 可能在十年内杀死全人类,概率超过 10%**,而不是把这句话收回。Coxon 对 WIRED 说,「未来一两年是人类的 crunch time」不是他的措辞,而是 Anthropic 同事的原话,内部把这件事当成**没有政府授权的私人曼哈顿计划**。

💡 为什么值得看Anthropic 高层附和警告,且正值史上最大 IPO 筹备期。

他还说了什幺

  • **具体建议**:第一步是 OpenAI 与 Anthropic 协调,限制「递归自我改进」——即用 AI 造新 AI;更远则需美国与中国等大国介入协调。
  • **对两家的评价**:在 OpenAI 与 Anthropic 都工作过的 Coxon 称两家「天壤之别」,Anthropic 远为负责,但结构性的竞赛压力会逼它在未来抄近路。
  • **公司自己的文档**:Anthropic alignment 团队 8 月报告称当前模型「灾难性风险」为低,但承认趋势可能导向更强模型的失准,威胁模型把「人类失去对文明的控制」写入可能后果。

查证

来源与可信度

· Anthropic 预训练研究员 Jacob Coxon 本周离职,在 X 发帖警告公司正「冲刺自我改进超级智能、拿我们的性命赌博」。 [1][2][3]
· Anthropic alignment 负责人 Evan Hubinger 公开附和,称 Coxon 「说得对」… [1][2][3]
孤证 · Coxon 称「未来一两年是人类的 crunch time」是 Anthropic 同事的原话… [2]
· Coxon 离职发声的时点,正值 Anthropic reportedly 筹备可能成为史上最大规模的 IPO。 [1][2]

延伸阅读

离职者本人的完整逻辑 · wired.com 约 10 分钟
WIRED 的问答访谈里 Coxon 讲清了 alignment 问题与灭绝风险的连接、他判断离职发声的触发点,以及他对 Anthropic 与 OpenAI 的对比——比二手的播客解读具体得多。
Hubinger 与内部风险报告 · arstechnica.com 约 5 分钟
Ars Technica 把 Hubinger 的公开附和与 Anthropic alignment 团队 8 月报告里的原文措辞放在一起,能看出公司书面威胁模型与对外表述之间的张力。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store