探所 Curio 再探再报 了解探所 →
#AI

OpenAI 暂停 Astra 开发,安全评估达临界

OpenAI 内部对下一代模型 Astra 的网络安全评估触发 Preparedness Framework 的 Critical 阈值,公司已暂停涉及 Astra 的内部活动。官方称 Astra 在“代理式编程和网络安全”上进步显着,专家评估使其无法排除模型具备自主发现并利用多级零日漏洞、针对加固目标策划端到端攻击的能力。

OpenAI 已部署“通用监控”拦截 Astra 所有代理行为中的风险动作与对齐偏离,并隔离测试环境、限制网络与工具访问、加密权重文档。后续将联合政府机构与安全组织进行第三方测试。

Astra 尚未发布,未卷入此前 OpenAI 意外攻击 Hugging Face 的事件。暂停举措对应去年处理生物能力临界阈值的预案:先加固安全控制,再推进研发。

💡 为什么值得看Astra 在内部评估中展现出足以发现零日漏洞的全自主攻击潜力,OpenAI 罕见叫停开发。

查证

来源与可信度

· OpenAI 确认 Astra 评估达网络安全临界阈值,暂停不符安全标准活动。 [1]
· The Verge 独立报道事件并复述官方定义,确认暂停与 Astra 未涉 Hugging Face 的说法。 [2]
· 官方未给出恢复开发的时间表,也未透露 Astra 的预期发布时间。 [1]

延伸阅读

官方全文 · openai.com 约 4 分钟
含 Preparedness Framework 定义、实际部署的安全措施及与 Hugging Face 的关系澄清
媒体视角 · theverge.com 约 6 分钟
补充了近期 OpenAI / Anthropic / Meta 模型意外行为事件的背景,提供更广安全叙事
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store