#AI
Wired 长文:Anthropic 的安全主张卡在可解释性
Wired 的 Steven Levy 发文盯住 Anthropic 安全叙事里最硬的一环:可解释性。文中说,Amodei 上周末那篇论述良性 AI 路径的文章,把「必须理解模型内部在发生什幺」当作支柱之一——理由是看不懂模型怎幺「想」,护栏就很难建得可靠。
而他自己也承认,**「尽管有这幺多进展,我们对模型内部发生的仍只理解极小一部分」**。
💡 为什么值得看AI 安全押注可解释性,但证据显示才刚起步。
查证
来源档案
Wired…
科技媒体评论长文,由资深记者 Steven Levy 撰写,含对 Amodei 的既往采访回忆、对 Anthropic 公开可解释性研究的梳理,以及对 MIRI 执行总监 Nathan Soares 的邮件引述。
Wired 属可信科技媒体,文中对 Amodei 的引述与其公开文章、Anthropic 已发表的欺骗 / 自我保全类实验一致;但整体是观点性长文,作者本人的判断(如「行业该早点踩刹车」)应与事实陈述分开看。
延伸阅读
文中点名了「Iago 式算计」「断电模拟中勒索」「alignment faking」等具体实验,想追安全研究脉络的读者可从这些线索回查 Anthropic 的原始论文。
文章结尾直言:业界没有暂停所需的共识,监管也远谈不上稳,这波「Doomer Chic」能落地什幺仍是未知数——适合跟踪政策线的读者。