探所 Curio 再探再报 了解探所 →
#AI

Anthropic 公开 Fable 5 安全分类器与越狱框架

在 Claude Fable 5 因 6 月安全事件被暂停、7 月 1 日恢复全球访问后,Anthropic 发布了网络安全防护与越狱框架的详细说明。这次披露的重点是两件事:一是随模型部署的安全分类器(safety classifiers)的四类分级逻辑,二是一份与 Glasswing 合作草拟的 AI **越狱严重度分级框架**,试图填补行业空白——至今还没有一个公认的标准来描述越狱的严重程度。 安全分类器将网络安全请求分为四档:**禁止使用**(勒索软件、数据擦除、恶意软件等几乎没有防御价值的活动,一刀切拦)、**高风险双用途**(渗透测试、漏洞利用开发等安全从业者日常行为,因其高度模拟攻击,暂拦待更精细的访问控制)、**低风险双用途**(开源情报、漏洞扫描等偏向防御的活动,监测为主但留出"安全余量"误拦一些以降低高风险漏网)和**良性使用**(安全编码、调试等,不拦)。Anthropic 强调分类器拦截了超过 99% 的已知越狱尝试,并开放了 HackerOne 项目供安全研究者提交越狱发现。 越狱分级框架目前是早期草案,意在让开发者与政府能用一套语言沟通"某个越狱有多危险",而不是各自表述。Anthropic 欢迎学界、产业和政府就框架边界提出意见(邮箱 cyber-safeguards@anthropic.com)。

💡 为什么值得看首次提出 AI 越狱严重度分级框架,为行业与政府提供共同讨论语言

查证

来源档案

Anthropic 官方博客

Anthropic 直接发布的 Fable 5 安全设计文档,涵盖分类器运作逻辑、越狱框架草案及联系渠道

一手源,直接披露产品安全架构,虽不排除策略性信息筛选但整体可信

延伸阅读

安全实践 · anthropic.com 约 8 分钟
博文内"禁止使用 / 高风险 / 低风险 / 良性"四类表附具体示例清单,适合安全团队核查模型边界
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store