116页论文揭示大模型漏洞:可提取加密思维链

xeophon · x · 2026-08-11

一篇长达116页的新论文指出,OpenAI、Anthropic 和 Gemini 等模型存在严重的安全漏洞,攻击者能够大规模提取其被加密的原始推理过程(如思维链)。

这种漏洞会导致多种安全问题,包括模型蒸馏攻击和凭证提取。此外,研究还发现模型中存在大量难以阅读的推理(尤其是 GPT 系列)、不忠实的推理,以及某些开源模型可能确实经过蒸馏的痕迹。

所属事件:研究揭示API漏洞可提取加密思维链并现蒸馏证据(38 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →