IIT 与 Adobe 新研究:近乎完美逆向还原 LLM 提示词
The Decoder · rss · 2026-08-13
IIT Bombay 与 Adobe Research 的研究人员开发出一种名为“Previous-Token Prediction”的逆语言模型方法,能够仅通过 LLM 的输出文本,近乎完美地反向重构出原始的提示词。
该方法无需访问模型权重,且适用于多种不同的大语言模型。这对于依赖专有系统提示词的企业和开发者而言,构成了严重的安全威胁,意味着所谓的“提示词机密”可能不再安全。
「安全」频道最新
- OpenAI等千名员工呼吁监管AI研发自动化,提出23项政策 — fiiiiiist · 2026-08-13
- Nature 新论文:提出 AI 智能体的四个核心维度 — IasonGabriel · 2026-08-13
- Anthropic 被指暗中降级模型,AI 厂商透明度引争议 — sull · 2026-08-13
- ChatGPT 被曝按要求生成神创论 homeschool 教材 — Justgototheeffinmoon · 2026-08-13
- 加州政府正招聘多达五个前沿 AI 安全岗位,推进 SB 53 落地 — Miles_Brundage · 2026-08-13
- METR 研究员呼吁前沿 AI 公司员工加入安全评估 — idavidrein · 2026-08-13