#AI
OpenAI 演示可自我复制的提示注入
OpenAI 用内部 GPT-Red 演示了提示注入的自我复制:恶意指令让 agent 把整段载荷写进回复邮件,下游 agent 再当成正常上下文照做,循环传播,也能藏进文档与代码注释。
关键失效模式在于:普通应用把可疑文档当惰性数据,会读邮件、改仓库、调工具的 agent 却把它提升为控制输入;OpenAI 还报告多跳变体,因此外来文本须一律按不可信数据处理,不得授予工具权限。
💡 为什么值得看agent 间提示注入可传播,暴露读文本即执行的架构缺陷。
查证
来源档案
Ground Truth
安全方向的科技新闻站,本文转述 OpenAI 的一手研究《Self-replicating prompt injections exist》,附 Key facts 与问答。
内核事实(模拟环境、无实际外溢、GPT-Red 基于 GPT-5.4-mini)与该站所引 OpenAI 报告口径一致,但本站为二手转述,未见独立第三方核验;引用时以 OpenAI 原文为准。
延伸阅读
想看多跳攻击的具体构造与防注入建议,得回到《Self-replicating prompt injections exist》本体,转述只保留了结论。