#AI
逆语言模型可重建 LLM 提示词
IIT Bombay 与 Adobe Research 的研究者训练了「逆向语言模型」,方法为 Previous-Token Prediction(PTP),可仅凭 LLM 输出文本近乎原样重建原始提示词。该逆向模型学习预测前一个 token,训练数据完全来自目标模型生成的合成文本,无需访问模型权重。
单个回复既能重建精确提示词,也能生成多个语义相近变体。一个在 Qwen-3-0.6B 上训练的逆向模型,甚至能重建 GPT-4o 输出的提示词含义,攻击者无需知晓原始模型身份。
对依赖专有系统提示的公司,这可能暴露商业机密、审核规则或特殊指令;个人敏感查询也可被提取。论文未对商业系统做实际攻击声明,但若方法在现役生产模型上有效,AI 厂商需尽快修补。
💡 为什么值得看对依赖专有系统提示的公司,这可能暴露商业机密、审核规则或特殊指令。若该方法在商业系统复现,Anthropic 等厂商需修补。
查证
来源档案
The Decoder
德国 AI 行业媒体,本文是对 IIT Bombay 与 Adobe Research 论文的二手报道
二手报道;方法与结论来自论文,但未附论文链接或 arxiv 号,具体数字需回原论文核对;单源,暂按线索档处理
延伸阅读
报道里有具体重建案例,如询问竞争对手定价策略的提示词被逐字还原,比探报更直观