116页论文曝AI蒸馏实锤:廉价小模型可提取旗舰模型隐藏推理
新智元 · wechat · 2026-08-12
一项长达116页的研究揭示了主流大厂(OpenAI、Anthropic、Google)API的严重安全漏洞:由于加密推理块未严格绑定会话和模型,攻击者可利用同公司更便宜的小模型(如Claude Haiku)作为“解码器”,仅花数百美元即可完整提取旗舰模型(如Claude Opus)隐藏的思考链(CoT)。
蒸馏首现“物证”
研究人员利用提取的Opus推理轨迹进行测试,发现某模型复现该轨迹的概率比其他模型高出100万倍。若将Opus的思考开头喂给该模型,其后续输出的相似度接近翻倍,为业内长久以来的“模型蒸馏”悬案提供了首批实质性证据。
海量敏感数据泄露
此外,团队从GitHub和HuggingFace收集的67万多个公开Agent推理块中,发现了近5%的泄露率,提取出62个API密钥、33个密码及大量个人隐私信息。这表明大厂重金打造的推理壁垒在低成本攻击面前异常脆弱。
所属事件:闭源大模型思维链加密被证实可被窃取(16 条相关)→
「安全」频道最新
- AI 安全研究员发文评 OpenAI 事件,称其如生化危机 — JacquesThibs · 2026-08-13
- TrustedSec 深度文章:AI 进攻并非穿墙外挂 — cyb3rops · 2026-08-13
- 马萨诸塞州一青少年涉嫌在 ChatGPT 协助下杀害母亲与兄弟 — nbcnews · 2026-08-13
- AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单 — sebkrier · 2026-08-13
- AI对齐探讨升温:多元视角聚焦价值与治理困境 — sebkrier · 2026-08-13
- 教授断言:再强的 ASI 也造不出无法破解的 AI 水印 — emollick · 2026-08-13