仅凭输出文本即可逆向破解大模型隐藏 Prompt
mhmazur · x · 2026-08-05
研究人员提出一种名为 PTP (Previous-Token Prediction) 的攻击方法,能够仅通过观察语言模型的输出文本,逆向重构出其隐藏的系统提示词。
该方法基于自回归模型「预测下一个词」留下的统计痕迹,通过训练一个逆向模型来推导给定响应之前的词汇。这意味着企业客服机器人的内部规则可能仅通过读取其公开回复就被轻易提取。不过,当目标模型输出内容非常通用时,该攻击效果会显著下降。
「安全」频道最新
- Dean Ball 辟谣末日论:适度谨慎能让 AGI 造福人类 — AaronBergman18 · 2026-08-05
- 开发者质疑:AI 应用获全量数据 API 访问权限合规吗? — jonathan_wilke · 2026-08-05
- 美联邦 AI 预算 907 亿美元,近 99% 涌向国防部 — ChrisUniverse · 2026-08-05
- 前员工回归创业,为自主智能体打造访问控制 — gabriel1 · 2026-08-05
- 李飞飞等学者发文:世界模型将带来物理风险,亟需新治理 — StanfordHAI · 2026-08-05
- 前芝加哥大学博士创立 CRISTAL Lab,专注大模型对齐与安全 — ChenhaoTan · 2026-08-05