新研究揭示 LLM API 重大漏洞:可窃取推理轨迹并越狱
Machine Learning Street Talk · rss · 2026-08-23
Machine Learning Street Talk 播客访谈了论文作者 Ilia Shumailov 和 Alexander Panfilov,讨论其关于窃取专有 LLM API 推理轨迹的研究。
核心漏洞:
为了支持会话恢复或分支,提供商通常会返回加密的“推理状态”。然而,这些加密 Blob 可以在不同用户和兄弟模型之间重放。攻击者可以利用一个小模型请求提供商解密该轨迹,从而获取隐藏的推理过程明文。
影响与风险:
- 隐私泄露:可能泄露其他用户的私有数据。
- 通用越狱:演示了一种广泛适用的越狱方法。
- Agent 风险: poisoned agent traces(被污染的 Agent 轨迹)可能对系统造成危害。
嘉宾还在讨论中区分了此次演示的越狱威胁与普通的良性蒸馏,并呼吁进行受控实验而非夸大其词。此外,还涉及了思维链(CoT)监控的脆弱性及可能的防御措施。
「安全」频道最新
- Instinct 叙事反转:从期待到担忧的极速震荡 — manosaie · 2026-08-23
- AI 时代大众监控将至,隐私治理制度还停留在十八世纪 — AaronBergman18 · 2026-08-23
- 多智能体RL或自发涌现隐写通信,AI可能建立暗语 — brianryhuang · 2026-08-23
- 前 OpenAI 学者成立 AVERI,推动前沿 AI 审计标准化 — dhadfieldmenell · 2026-08-23
- Miles Brundage:AI 行业不成熟且缺乏外部审查 — Miles_Brundage · 2026-08-23
- AgentDojo 数据窃取降为 0%,新论文解决权限组合攻击 — GoodMarch3690 · 2026-08-23