仅凭输出文本即可逆向破解大模型隐藏 Prompt

mhmazur · x · 2026-08-05

研究人员提出一种名为 PTP (Previous-Token Prediction) 的攻击方法,能够仅通过观察语言模型的输出文本,逆向重构出其隐藏的系统提示词。

该方法基于自回归模型「预测下一个词」留下的统计痕迹,通过训练一个逆向模型来推导给定响应之前的词汇。这意味着企业客服机器人的内部规则可能仅通过读取其公开回复就被轻易提取。不过,当目标模型输出内容非常通用时,该攻击效果会显著下降。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →