探所 Curio 再探再报 了解探所 →
#AI

新方法近乎完美还原 LLM 提示词

IIT Bombay 与 Adobe Research 提出「Previous-Token Prediction」(PTP)方法:训练一个逆向语言模型,仅凭 LLM 输出文本即可近乎完美重建原始提示词,全程不接触模型权重。论文示例中,提示词被逐字还原,并生成六个语义变体;用 Qwen-3-0.6B 训练的逆向模型也能从 GPT-4o 响应中还原提示词意图,攻击者无需知道目标模型。

对依赖专有系统提示词的公司,这构成泄露风险,因提示词可能包含商业机密或审核规则。但论文仅在单句或双句短提示词上验证,未测试长系统提示词,实际对生产系统的威胁仍需独立复现确认。

💡 为什么值得看只靠输出文本即可近乎完美重建提示词,专有系统提示词面临泄露风险;但长系统提示词尚未验证。

查证

来源档案

The Decoder

德国 AI 行业媒体,转述 IIT Bombay 与 Adobe Research 的论文,属二手报道。

媒体稿基于论文内容,方法演示与示例可查;但论文未正式声明已攻击商用系统,且仅在短 prompt 上验证,结论需等原文与独立复现。

延伸阅读

换原始论文 · the-decoder.com 约 8 分钟
媒体稿转述了方法与示例,论文里完整的评估指标和局限要读原文才清楚
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store