#AI
Anthropic 发布 Constitutional Classifiers++,算力开销降至约 1%
Anthropic 发布了下一代模型防护系统 **Constitutional Classifiers++**,把它上一代「宪法分类器」的代价问题按下去了一大截。
官方给出的对比是:误拒率从 0.38% 降到 **0.05%**,算力开销从 23.7% 降到**约 1%**——上一代最大的两个批评点,新的两个数字分别低了约 87% 和一个数量级。第一代分类器曾把越狱成功率从 86% 压到 4.4%。
💡 为什么值得看算力从 23.7% 降至 1%,误拒从 0.38% 降至 0.05%,尚无通用越狱。
查证
来源档案
Anthropic Research(官方博客)
Anthropic 官方研究发布页,配套论文,含红队数据与部署指标
官方一手口径,数字可信;但鲁棒性与检测率均为 Anthropic 自述的对抗测试结果,无第三方复现,红队细节见原文与论文。
延伸阅读
两阶段级联如何把第一阶段的误判升级而非直接拒绝,以及复用模型内部激活的探测器为何更难被绕过,是这套系统真正的技术新点。
原文对重构攻击、输出混淆两类残余风险有具体描述,还提到某些越狱手法会让 GPQA Diamond 成绩从 74% 掉到 32%——这条对判断「越狱是否划算」很关键。