AWS 发文阐释前沿模型安全发布实践 | Fable 5 回归 Bedrock
2026 年 7 月 1 日,AWS 官方安全博客发布《安全发布前沿模型给客户》一文,系统阐述了其在 Bedrock 平台上线 Anthropic Claude Fable 5 的安全考量。这是头部云厂商首次以长文形式公开讨论前沿模型发布的攻防平衡框架,结合了 Project Glasswing 的实际经验。 核心信息:Claude Fable 5 已在 Amazon Bedrock 重新上线,并配备更强的防护措施。该模型搭载了 Mythos 级别的能力(尤其在网络安全领域显著增强),但 AWS 和 Anthropic 通过专门的 guardrails 机制限制了其在高风险领域的表现——当模型收到有害的网络安全、生物、化学、健康相关提示时,会自动降级到 Opus 4.8 进行响应。AWS AI 红队与 Anthropic 合作进一步优化了这些防护,目标是让防守方获得强大的深度漏洞研究能力,同时防止攻击者利用这些能力作恶。 AWS 在文中明确提出了一个行业核心矛盾:前沿模型在网络攻防两端都具有变革性——你可以用它让关键基础设施更安全,但也可能赋予对手前所未有的漏洞发现能力。Project Glasswing 就是为了解决这个矛盾而生的行业协作项目。
①
Fable 5 回归 Bedrock
Claude Fable 5 于 7 月 1 日正式在 Amazon Bedrock 恢复可用。该模型在几乎所有测试基准上达到前沿水平,尤其擅长长时间运行的异步任务、复杂软件工程、知识工作负载以及视觉理解。Anthropic 发表的《Redeploying Fable 5》博客详细说明了其对网络能力模型的响应承诺和 SLA 框架。
②
防护机制:自动降级到 Opus 4.8
Fable 5 内置了按领域分类的 guardrails——当检测到涉及网络安全、生物、化学、健康的可能有害提示时,模型不会执行 Fable 5 的能力,而是自动回退到 Opus 4.8 给出响应。这套机制经 AWS AI 红队和 Anthropic 联合优化,目标是「保留大部分推理能力的提升,同时不赋予对手显著的新安全能力」。
③
Project Glasswing 的实战基础
AWS 称通过 Project Glasswing 亲身体验了 Mythos 级模型的网络攻防能力。Anthropic 红队的公开评估显示,Mythos Preview 能够在所有主流操作系统和主流浏览器中识别并利用零日漏洞。英国 AISI 的独立评估也确认了其在 CTF 挑战和多步骤网络攻击模拟中的显著提升。Anthropic 已为此项目投入 1 亿美元模型使用额度。