#AI
OpenAI 称 Astra 跨过网络安全关键阈值
OpenAI 在官方博客发布 Astra 模型的安全评估:这是**首个在 Preparedness Framework 下达到 Critical 网络安全能力阈值**的模型。公司称,在合适的工具与权限支持下,Astra 可以在无人逐步指导的情况下,自主发现此前未知的安全漏洞,并开发跨多个防御良好系统的利用方法。
OpenAI 仍计划「很快」发布 Astra,但对其网络安全能力的访问将更受限制,并称在后续强化和测试防护措施后,认为现有安全措施足以将严重危害风险降至可发布水平。更多安全、测试与对齐细节将在模型发布时的 System Card 中公开。
💡 为什么值得看Astra 首达 OpenAI 网络安全 Critical 阈值,防护策略同步收紧。
查证
来源档案
OpenAI 官方博客
官方一手公告
官方对自身模型能力的自我评估与表态,可信度在于其陈述的事实(阈值评估)是官方口径;但「风险已充分降低」「将很快发布」属官方自判,需等待发布后的 System Card 独立核查
延伸阅读
官方博客对发布防护策略的完整说明,想了解 OpenAI 如何收紧网络能力访问的读者应读原文