论文揭示前沿大模型加密思维链可被提取,绕过防蒸馏机制

maksym_andr · x · 2026-08-12

一项最新安全研究表明,OpenAI、Anthropic 和 Google 等厂商在 API 中返回的加密思维链可以被破解提取。

研究人员提出了一种攻击方法:将强模型生成的加密思维链追踪重放到较弱的同族模型中,随后对弱模型进行越狱,即可恢复出强模型隐藏的明文推理过程。

这种攻击仅需两次 API 调用,无需直接攻击强模型本身,也不会触发其防蒸馏安全护栏。论文作者包括 Maksym Andriushchenko 等知名学者。

所属事件:闭源大模型思维链加密被证实可被窃取(16 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →