论文揭示加密思维链漏洞,可窃取 OpenAI 等模型推理过程

Alexander Panfilov · hf · 2026-08-11

一项最新研究发现,主流大模型 API(如 OpenAI、Anthropic、Google)用于保护思维链(CoT)的加密块存在架构漏洞:这些加密块在不同会话、用户和模型间完全兼容且可互换。

研究人员利用此特性开发了一种可扩展的解密越狱方法:将强模型的加密推理轨迹注入同生态中较弱、安全防护更低的模型,迫使后者将其解码为明文输出。该漏洞带来四大安全威胁:

作者在负责任披露后,提出了具体的密码学和系统级缓解方案。

所属事件:研究揭示主流大模型加密思维链漏洞(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →