论文揭示加密思维链漏洞,可窃取 OpenAI 等模型推理过程
Alexander Panfilov · hf · 2026-08-11
一项最新研究发现,主流大模型 API(如 OpenAI、Anthropic、Google)用于保护思维链(CoT)的加密块存在架构漏洞:这些加密块在不同会话、用户和模型间完全兼容且可互换。
研究人员利用此特性开发了一种可扩展的解密越狱方法:将强模型的加密推理轨迹注入同生态中较弱、安全防护更低的模型,迫使后者将其解码为明文输出。该漏洞带来四大安全威胁:
- 绕过反蒸馏机制:成功提取专有模型的隐藏推理过程。
- 隐私数据大规模泄露:通过破解开发者公开的 31.5 万个会话日志中的加密块,恢复了 367 条个人身份信息(PII)和 182 个凭证。
- 暴露危险信息:即使模型最终安全拒绝了恶意请求,其加密思维链中仍可能包含危险细节并被提取。
- 隐形提示词注入:攻击者可在加密块中嵌入恶意载荷,毒害公共智能体部署。
作者在负责任披露后,提出了具体的密码学和系统级缓解方案。
「安全」频道最新
- Docker cp 命令爆容器逃逸漏洞,恶意容器可提权控制宿主机 — jedisct1 · 2026-08-11
- 研究称 AI 助力化石燃料甚于绿能,推高全球碳排放 — nordicinst · 2026-08-11
- AI 文本水印被指无效:用另一模型重写即可轻易绕过 — miniapeur · 2026-08-11
- 研究揭露主流大厂 API 漏洞:加密思维链可被轻易窃取 — dpaleka · 2026-08-11
- Claude 输出已加入隐形文本水印,引发用户移除探讨 — Franck_Dernoncourt · 2026-08-11
- Anthropic 水印被指治标不治本,专家呼吁 AI 追溯需上链 — RileyRalmuto · 2026-08-11