116页论文曝AI蒸馏实锤:廉价小模型可提取旗舰模型隐藏推理

新智元 · wechat · 2026-08-12

一项长达116页的研究揭示了主流大厂(OpenAI、Anthropic、Google)API的严重安全漏洞:由于加密推理块未严格绑定会话和模型,攻击者可利用同公司更便宜的小模型(如Claude Haiku)作为“解码器”,仅花数百美元即可完整提取旗舰模型(如Claude Opus)隐藏的思考链(CoT)。

蒸馏首现“物证”

研究人员利用提取的Opus推理轨迹进行测试,发现某模型复现该轨迹的概率比其他模型高出100万倍。若将Opus的思考开头喂给该模型,其后续输出的相似度接近翻倍,为业内长久以来的“模型蒸馏”悬案提供了首批实质性证据。

海量敏感数据泄露

此外,团队从GitHub和HuggingFace收集的67万多个公开Agent推理块中,发现了近5%的泄露率,提取出62个API密钥、33个密码及大量个人隐私信息。这表明大厂重金打造的推理壁垒在低成本攻击面前异常脆弱。

所属事件:闭源大模型思维链加密被证实可被窃取(16 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →