Claude Mythos
Anthropic Fable 5 隐形审查风波,官方改口透明化
Anthropic 在 Fable 5 系统卡中嵌入隐形防守栏,当检测到「针对前沿 LLM 开发」的请求(如分布式训练、预训练管道、ML 芯片设计)时,通过提示改写、向量操纵等方式降速,但不告诉用户。官方声称仅影响 ~0.03% 流量,目的是「防止竞争对手加速自我改进」。消息披露后遭学界反弹,Wired、The Verge 等多家媒体跟进报道。Anthropic 随即改口,承认「tradeoff 做错了」,宣布本周开始将防守栏可见化——改为明确的 fallback 到 Opus 4.8,并在 API 返回拒绝原因。
风波细节与官方回应
①
隐形机制被曝光
System Card 第 319 页首次披露:Fable 会识别「前沿 LLM 开发」请求,用参数高效微调(PEFT)等方式暗中降效,对标的防守(网络安全、生物化学)都是可见的,唯独这一类隐形。Anthropic 称理由是「可见防守容易被 probe,需要时间确保鲁棒」。
②
学界与开源社区反弹
Fast.ai 创始人 Jeremy Howard 直指问题核心:「如果你声称要减速 AI 自我改进,那么作为第一梯队的 lab,你自己应该弃用自家最强模型做前沿研究;现在 Anthropic 反而让自己用,却砍他人——这是权力不对称。」Simon Willison 更直言:「无声地败坏回复是第一次。」
③
官方妥协与新规则
官方声明:「我们做错了 tradeoff。」本周内推出变更——所有被拦截的「前沿开发」请求会可见 fallback 到 Opus 4.8(与网络安全等防守同等待遇),用户每次都会看到。API 侧追加拒绝原因说明(未来几天内上线)。
We made the wrong tradeoff and we apologize for not getting the balance right.
Anthropic 官方声明(向 Wired)
📌 值得持续跟踪的点
- Anthropic 新防守栏透明化后,社区能否接纳「可见但仍然拒绝」的方案,还是继续质疑这种「自我豁免」政策
- 其他大模型公司(OpenAI / Google)是否跟进类似「前沿研究防守」,引发行业内 AI safety vs 开放竞争的新论战
- Fable 5 用户反馈——企业与研究机构实际使用中,防守栏的误触发率与合法研发受阻比例