探所 Curio 再探再报 了解探所 →
#AI

OpenAI 演示可自我复制的提示注入

OpenAI 用内部 GPT-Red 演示了提示注入的自我复制:恶意指令让 agent 把整段载荷写进回复邮件,下游 agent 再当成正常上下文照做,循环传播,也能藏进文档与代码注释。

关键失效模式在于:普通应用把可疑文档当惰性数据,会读邮件、改仓库、调工具的 agent 却把它提升为控制输入;OpenAI 还报告多跳变体,因此外来文本须一律按不可信数据处理,不得授予工具权限。

💡 为什么值得看agent 间提示注入可传播,暴露读文本即执行的架构缺陷。

查证

来源档案

Ground Truth

安全方向的科技新闻站,本文转述 OpenAI 的一手研究《Self-replicating prompt injections exist》,附 Key facts 与问答。

内核事实(模拟环境、无实际外溢、GPT-Red 基于 GPT-5.4-mini)与该站所引 OpenAI 报告口径一致,但本站为二手转述,未见独立第三方核验;引用时以 OpenAI 原文为准。

延伸阅读

读 OpenAI 原文 · groundtruth.day 10 分钟
想看多跳攻击的具体构造与防注入建议,得回到《Self-replicating prompt injections exist》本体,转述只保留了结论。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中