#AI
OpenAI 披露反蒸馏行动,点名 Moonshot AI
OpenAI 9 月 30 日称已瓦解一场协同行动:有人系统性套取其模型受保护推理。活动 7 月首周出现,7 月 28 日前已完全瓦解。
OpenAI 称操作者未攻破加密、数据库或用户对话,而是操纵模型交互让隐藏推理重现,例如跨对话复制加密推理要求解密转写。
OpenAI 称无法确认操作者来自同一主体,但把内核活动集群归到与 Moonshot AI 相关人员,称此为 adversarial distillation。
💡 为什么值得看OpenAI 指 7 月有人规模化套取推理并归因 Kimi,推理提取比蒸馏更危险。
OpenAI 的处置与后续
- **账号与基建**:封禁或限制欺诈账号,加强注册与基础设施管控,扩大对相关网络的监控。
- **推理防护**:为隐藏推理加保护:堵掉「已持有他人加密推理即可重放取回内容」的路径,并加检测拦截可能暴露推理的流式输出。
- **跨行业通报**:经 Frontier Model Forum 与政府信息共享渠道通报其他前沿开发者与公共部门,供其排查同类活动。
- **未完成项**:OpenAI 称合作方托管的部署需要同等防护,工具输出类攻击需要超越可见文本的检测,云端防护仍在铺开。
OpenAI 表示入侵者拿到的不是用户对话,而是模型的内部推理;这两者的泄露面并不相同。
查证
来源与可信度
延伸阅读
公告列了加密推理跨对话复制转写等具体路径,想判断自家推理缓存是否有同类暴露风险的可对照排查。
CNBC 把此事与 Anthropic 数周前对中国开发者的类似指控并列,可看清美国 lab 对「套取模型能力」的集体叙事。