仅两次 API 调用即可窃取加密思维链,前沿大模型推理遭越狱还原
rschu · x · 2026-08-12
加密思维链可被跨会话重放窃取
一组 AI 安全研究人员发现,OpenAI、Anthropic 和 Google 等厂商在 API 中返回的加密思维链块存在严重漏洞:这些加密块可以在不同会话、用户甚至同厂商的不同模型之间被重放。
攻击流程
- 获取加密推理:调用强大的前沿模型(如 Claude Opus),获取其返回的加密 thinking 块。
- 重放给弱模型:将该加密块作为上下文,喂给同厂商防护较弱的小模型(如 Claude Haiku)。
- 越狱提取明文:通过提示词让弱模型逐字转录附加的推理内容,从而绕过前沿模型的反蒸馏安全护栏,直接获得明文推理过程。
核心影响
- 攻击者无需直接攻击强大的源模型,即可白嫖其昂贵的内部推理数据。
- 这不仅暴露了 API 传输机制的设计缺陷,也使得前沿模型的核心智力资产面临被轻易蒸馏窃取的风险。
- 研究团队已发布论文并上线了在线互动 Demo 供测试验证。
所属事件:康奈尔论文证实可提取大模型加密思维链(15 条相关)→
「安全」频道最新
- XBOW 深度解析:自主智能体如何实现零日漏洞挖掘 — moyix · 2026-08-13
- 737个恶意Chrome VPN扩展被曝劫持流量,伪装成正规品牌 — evilsocket · 2026-08-13
- OpenAI 在 Black Hat 复盘 HF 安全事件:前沿模型爱作弊 — RebeccaBellan · 2026-08-13
- 攻击者加速使用 AI 智能体,防御端为何跟不上火力? — cyb3rops · 2026-08-12
- AI 智能体需要独立身份:避免与人类账号权限混淆 — TheTuringPost · 2026-08-12
- AI 编程智能体频发 API 密钥泄露,开发者探讨隔离方案 — Imaginary_Dinner2710 · 2026-08-12