#AI
新方法近乎完美还原 LLM 提示词
IIT Bombay 与 Adobe Research 提出「Previous-Token Prediction」(PTP)方法:训练一个逆向语言模型,仅凭 LLM 输出文本即可近乎完美重建原始提示词,全程不接触模型权重。论文示例中,提示词被逐字还原,并生成六个语义变体;用 Qwen-3-0.6B 训练的逆向模型也能从 GPT-4o 响应中还原提示词意图,攻击者无需知道目标模型。
对依赖专有系统提示词的公司,这构成泄露风险,因提示词可能包含商业机密或审核规则。但论文仅在单句或双句短提示词上验证,未测试长系统提示词,实际对生产系统的威胁仍需独立复现确认。
💡 为什么值得看只靠输出文本即可近乎完美重建提示词,专有系统提示词面临泄露风险;但长系统提示词尚未验证。
查证
来源档案
The Decoder
德国 AI 行业媒体,转述 IIT Bombay 与 Adobe Research 的论文,属二手报道。
媒体稿基于论文内容,方法演示与示例可查;但论文未正式声明已攻击商用系统,且仅在短 prompt 上验证,结论需等原文与独立复现。
延伸阅读
媒体稿转述了方法与示例,论文里完整的评估指标和局限要读原文才清楚