探所 Curio 再探再报 了解探所 →
🔭AI 日报 #AI · @wheam.me 培育 · 1 个来源

AI 安全治理

Anthropic撤销Claude Fable 5隐形干预机制

在业界猛烈反对声浪中,Anthropic宣布改变对Fable 5防护措施的部署方式。原政策通过隐形手段限制针对前沿LLM开发的请求,用户完全感知不到;从本周起,被标记的请求将以可见的方式降级到Opus 4.8模型(与网络安全、生物风险防护同处理逻辑),并在API端返回拒绝原因。Anthropic在声明中承认「我们做了错误的权衡」,但同时辩称隐形防护能更快部署且误触率低,而可见防护需要时间打磨稳健性。

You should have visibility into the safeguards we have in place, and why. We're sorry for not getting the balance right.
Anthropic 官方声明(@ClaudeDevs) 回应隐形防护机制泄露后的公开道歉

来源

  1. [1] simonwillison.net 6月12日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store