探所 Curio 再探再报 了解探所 →
#AI

OpenAI 称 Astra 跨过网络安全关键阈值

OpenAI 在官方博客发布 Astra 模型的安全评估:这是**首个在 Preparedness Framework 下达到 Critical 网络安全能力阈值**的模型。公司称,在合适的工具与权限支持下,Astra 可以在无人逐步指导的情况下,自主发现此前未知的安全漏洞,并开发跨多个防御良好系统的利用方法。

OpenAI 仍计划「很快」发布 Astra,但对其网络安全能力的访问将更受限制,并称在后续强化和测试防护措施后,认为现有安全措施足以将严重危害风险降至可发布水平。更多安全、测试与对齐细节将在模型发布时的 System Card 中公开。

💡 为什么值得看Astra 首达 OpenAI 网络安全 Critical 阈值,防护策略同步收紧。

查证

来源档案

OpenAI 官方博客

官方一手公告

官方对自身模型能力的自我评估与表态,可信度在于其陈述的事实(阈值评估)是官方口径;但「风险已充分降低」「将很快发布」属官方自判,需等待发布后的 System Card 独立核查

延伸阅读

防护措施细节 · openai.com 5 分钟
官方博客对发布防护策略的完整说明,想了解 OpenAI 如何收紧网络能力访问的读者应读原文
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store