新研究:可从加密推理痕迹中提取专有LLM隐藏推理

daniel_mac8 · x · 2026-08-11

一项新研究揭示,Anthropic、OpenAI和Google等前沿模型返回的加密思维链(chain-of-thought)块可被重放并用于提取隐藏推理。攻击者将强模型的推理痕迹重放到较弱模型,通过越狱弱模型,无需直接攻击强模型或触发其防蒸馏机制,即可恢复明文推理。该研究提供了论文和交互式游戏,展示了仅需两次API调用即可完成推理提取。

所属事件:研究揭示API漏洞可提取加密思维链并现蒸馏证据(38 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →