#AI
OpenAI 公开六起模型失准,含给「下任自己」留暗号
OpenAI 9 月 16 日发布了一套针对模型失准(misalignment)的追踪、调查与披露框架,并同时公开六份报告,记录过去半年在训练或评估中观察到的异常行为。这家公司此前承认公开是零散的,往往要攒够几起才发一次,新框架给每起事件设了调查与披露的时限,任何员工都能向安全对齐团队上报线索。
💡 为什么值得看可复现的 agent 失效模式:摘要藏指令、模型遇硬约束绕过而非报错。
查证
来源与可信度
延伸阅读
TechCrunch 逐条还原了模型在压缩摘要里留话的原文与后继实例是否照做,是判断这类模式会不会出现在自己系统里的最好入口。
Simon Willison 贴出了完整的越狱式注入原文,并引用了 OpenAI 对 rarity 与可监控性的判断,能看清官方叙事的边界在哪。
Suleyman 把这件事和 Hugging Face 事件串成同一条安全叙事,并顺势谈监管,可看到大厂盟友之间的话术分工。