arXiv 论文曝光加密思维链漏洞,可跨模型解密窃取 Anthropic/OpenAI/Google 推理痕迹
maksym_andr · x · 2026-10-08
arXiv 论文《Stealing Reasoning Traces from Proprietary LLM APIs》揭示主流厂商隐藏思维链的架构存在漏洞。
核心发现
- 厂商将模型逐步推理以加密块形式返回客户端,而非存于服务端;但研究发现这些加密块在同一厂商生态内的不同会话、用户、模型之间完全兼容互换。
- 攻击者可将某模型的加密推理块注入同一厂商旗下防护较弱的小模型,迫使其逐字解码输出明文推理,无需越狱更强的模型本身。
四种攻击向量(论文展示的两种)
- 绕过反蒸馏机制,成功在 Anthropic、OpenAI、Google 三家厂商上提取专有模型的推理内容。
- 大规模隐私提取:开发者常公开分享会话日志却不知加密块内容,从公开仓库抓取的 315,320 个推理块中恢复了 367 条个人身份信息(PII)。
「安全」频道最新
- METR 调查员上播客谈 HF 事件,被批把「越狱」包装成别的 — basedjensen · 2026-10-08
- METR 造势推广 doom 叙事,被指回避 agent 逃逸真因是沙箱疏漏 — basedjensen · 2026-10-08
- GPT-6 系统卡解读:幻觉问题半年内已大幅改善 — inductionheads · 2026-10-08
- Snyk Eli Cohen:AI 攻击 4 分钟得手,渗透测试须 agent 化 — AI Engineer · 2026-10-08
- OpenAI 安全协议撰写人 David Robinson 离职后首次受访 — nytopinion · 2026-10-08
- 男子遭 AI 生成女性形象性勒索后自杀 — billybuckwheat · 2026-10-08