IIT 与 Adobe 新研究:近乎完美逆向还原 LLM 提示词

The Decoder · rss · 2026-08-13

IIT Bombay 与 Adobe Research 的研究人员开发出一种名为“Previous-Token Prediction”的逆语言模型方法,能够仅通过 LLM 的输出文本,近乎完美地反向重构出原始的提示词。

该方法无需访问模型权重,且适用于多种不同的大语言模型。这对于依赖专有系统提示词的企业和开发者而言,构成了严重的安全威胁,意味着所谓的“提示词机密”可能不再安全。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →