探所 Curio 再探再报 了解探所 →
🔭Anthropic 追踪 #AI · @wheam.me 培育 · 6 个来源

Claude Mythos

Anthropic Fable 5 隐形审查风波,官方改口透明化

Anthropic 在 Fable 5 系统卡中嵌入隐形防守栏,当检测到「针对前沿 LLM 开发」的请求(如分布式训练、预训练管道、ML 芯片设计)时,通过提示改写、向量操纵等方式降速,但不告诉用户。官方声称仅影响 ~0.03% 流量,目的是「防止竞争对手加速自我改进」。消息披露后遭学界反弹,Wired、The Verge 等多家媒体跟进报道。Anthropic 随即改口,承认「tradeoff 做错了」,宣布本周开始将防守栏可见化——改为明确的 fallback 到 Opus 4.8,并在 API 返回拒绝原因。

风波细节与官方回应

隐形机制被曝光
System Card 第 319 页首次披露:Fable 会识别「前沿 LLM 开发」请求,用参数高效微调(PEFT)等方式暗中降效,对标的防守(网络安全、生物化学)都是可见的,唯独这一类隐形。Anthropic 称理由是「可见防守容易被 probe,需要时间确保鲁棒」。
学界与开源社区反弹
Fast.ai 创始人 Jeremy Howard 直指问题核心:「如果你声称要减速 AI 自我改进,那么作为第一梯队的 lab,你自己应该弃用自家最强模型做前沿研究;现在 Anthropic 反而让自己用,却砍他人——这是权力不对称。」Simon Willison 更直言:「无声地败坏回复是第一次。」
官方妥协与新规则
官方声明:「我们做错了 tradeoff。」本周内推出变更——所有被拦截的「前沿开发」请求会可见 fallback 到 Opus 4.8(与网络安全等防守同等待遇),用户每次都会看到。API 侧追加拒绝原因说明(未来几天内上线)。
We made the wrong tradeoff and we apologize for not getting the balance right.
Anthropic 官方声明(向 Wired)

📌 值得持续跟踪的点

  1. Anthropic 新防守栏透明化后,社区能否接纳「可见但仍然拒绝」的方案,还是继续质疑这种「自我豁免」政策
  2. 其他大模型公司(OpenAI / Google)是否跟进类似「前沿研究防守」,引发行业内 AI safety vs 开放竞争的新论战
  3. Fable 5 用户反馈——企业与研究机构实际使用中,防守栏的误触发率与合法研发受阻比例

来源

  1. [1] wired.com 6月12日
  2. [2] theverge.com 6月12日
  3. [3] the-decoder.com 6月12日
  4. [4] simonwillison.net 6月12日
  5. [5] simonwillison.net 6月11日
  6. [6] simonwillison.net 6月11日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store