论文揭示前沿大模型加密思维链可被提取,绕过防蒸馏机制
maksym_andr · x · 2026-08-12
一项最新安全研究表明,OpenAI、Anthropic 和 Google 等厂商在 API 中返回的加密思维链可以被破解提取。
研究人员提出了一种攻击方法:将强模型生成的加密思维链追踪重放到较弱的同族模型中,随后对弱模型进行越狱,即可恢复出强模型隐藏的明文推理过程。
这种攻击仅需两次 API 调用,无需直接攻击强模型本身,也不会触发其防蒸馏安全护栏。论文作者包括 Maksym Andriushchenko 等知名学者。
所属事件:闭源大模型思维链加密被证实可被窃取(16 条相关)→
「安全」频道最新
- AI 安全研究员发文评 OpenAI 事件,称其如生化危机 — JacquesThibs · 2026-08-13
- TrustedSec 深度文章:AI 进攻并非穿墙外挂 — cyb3rops · 2026-08-13
- 马萨诸塞州一青少年涉嫌在 ChatGPT 协助下杀害母亲与兄弟 — nbcnews · 2026-08-13
- AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单 — sebkrier · 2026-08-13
- AI对齐探讨升温:多元视角聚焦价值与治理困境 — sebkrier · 2026-08-13
- 教授断言:再强的 ASI 也造不出无法破解的 AI 水印 — emollick · 2026-08-13