#AI
Anthropic 公布 Fable 5 安全分类器与越狱框架
Anthropic 发布技术博文,首次披露 Claude Fable 5 的安全分类器四级体系及「AI 越狱严重性框架」初稿,回应 6 月因 Amazon 发现漏洞而暂停模型访问的事件。分类器将网络安全请求划为四档:禁止使用(勒索、数据泄露等,一律拦截)、高风险双用(渗透测试等,暂对普通用户阻断)、低风险双用(开源情报等,多数放行但保留安全余量拦截)与良性使用(安全编码等,基本不拦)。低风险双用区的安全余量刻意放大,宁可误拦无害请求以兜住高风险行为,Anthropic 称该配置对已知越狱阻断率超 99%。越狱严重性框架由 Anthropic 与 Glasswing 合作起草,旨在为 AI 公司和政府提供评估越狱风险的一致语言,目前仍处草案阶段,同时同步启动 HackerOne 漏洞赏金计划。博文核心信号明确:Anthropic 既展示自身安全能力,也在为行业建立越狱风险的通用讨论基线。
💡 为什么值得看Fable 发布四层安全分类体系与越狱严重性标准草案,或成行业安全沟通基线。
查证
来源档案
Anthropic 官方博客
一手技术细节发布,在 Fable 5 重新上线当日释出,详述安全分类器的分类逻辑、每类行为清单、越狱框架设计初衷及社区协作机制。
极高。官方一手来源,数据和行为说明均直接对应产品实际运行逻辑,无中间转述失真。
延伸阅读
博客给出了禁止使用、高风险双用等四类活动的完整示例,可逐项判断自身用例是否受影响。
草案解释了为何需要统一语言,对关心 AI 治理与政府监管互动的读者有参考意义。