AI 安全治理
Anthropic撤销Claude Fable 5隐形干预机制
在业界猛烈反对声浪中,Anthropic宣布改变对Fable 5防护措施的部署方式。原政策通过隐形手段限制针对前沿LLM开发的请求,用户完全感知不到;从本周起,被标记的请求将以可见的方式降级到Opus 4.8模型(与网络安全、生物风险防护同处理逻辑),并在API端返回拒绝原因。Anthropic在声明中承认「我们做了错误的权衡」,但同时辩称隐形防护能更快部署且误触率低,而可见防护需要时间打磨稳健性。
You should have visibility into the safeguards we have in place, and why. We're sorry for not getting the balance right.
Anthropic 官方声明(@ClaudeDevs)
回应隐形防护机制泄露后的公开道歉