探所 Curio 再探再报 了解探所 →
#AI

OpenAI 披露反蒸馏行动,点名 Moonshot AI

OpenAI 9 月 30 日称已瓦解一场协同行动:有人系统性套取其模型受保护推理。活动 7 月首周出现,7 月 28 日前已完全瓦解。

OpenAI 称操作者未攻破加密、数据库或用户对话,而是操纵模型交互让隐藏推理重现,例如跨对话复制加密推理要求解密转写。

OpenAI 称无法确认操作者来自同一主体,但把内核活动集群归到与 Moonshot AI 相关人员,称此为 adversarial distillation。

💡 为什么值得看OpenAI 指 7 月有人规模化套取推理并归因 Kimi,推理提取比蒸馏更危险。

OpenAI 的处置与后续

  • **账号与基建**:封禁或限制欺诈账号,加强注册与基础设施管控,扩大对相关网络的监控。
  • **推理防护**:为隐藏推理加保护:堵掉「已持有他人加密推理即可重放取回内容」的路径,并加检测拦截可能暴露推理的流式输出。
  • **跨行业通报**:经 Frontier Model Forum 与政府信息共享渠道通报其他前沿开发者与公共部门,供其排查同类活动。
  • **未完成项**:OpenAI 称合作方托管的部署需要同等防护,工具输出类攻击需要超越可见文本的检测,云端防护仍在铺开。

OpenAI 表示入侵者拿到的不是用户对话,而是模型的内部推理;这两者的泄露面并不相同。

查证

来源与可信度

强 · OpenAI 9 月 30 日发文称,已识别并瓦解一场旨在提取其模型受保护推理的协同行动。 [1][2]
强 · OpenAI 称该活动最早出现在 7 月首周,7 月 24 至 25 日出现高峰,两天内来自 4000 多名用户的 16000 次请求。 [1][2]
强 · OpenAI 无法确认所有操作者来自同一主体,但把内核活动集群归因于与 Moonshot AI(Kimi 开发者)相关的人员。 [1][2]
孤证 · OpenAI 称相关 prompt 活动涉及超过 15000 名用户的集群,已于 7 月 28 日前完全瓦解。 [1][2]

延伸阅读

攻击手法细节 · openai.com 5 分钟
公告列了加密推理跨对话复制转写等具体路径,想判断自家推理缓存是否有同类暴露风险的可对照排查。
与中国 AI 公司的整体脉络 · cnbc.com 3 分钟
CNBC 把此事与 Anthropic 数周前对中国开发者的类似指控并列,可看清美国 lab 对「套取模型能力」的集体叙事。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中