研究揭示加密思维链漏洞:可跨模型重放窃取推理逻辑
rschu · x · 2026-08-12
一项引发热议的 AI 安全论文指出,当前主流 LLM 使用的加密思维链存在严重安全漏洞。研究人员发现,这些加密推理块可以在同一提供商的不同会话和模型间被重放。
通过将强大模型的加密推理过程喂给较弱、安全防护较低的模型,攻击者能让弱模型用明文复现大部分隐藏推理逻辑。该攻击在 Anthropic、OpenAI 和 Google 的模型上均验证成功。
这不仅暴露了隐私和安全风险,也引发了模型蒸馏争议。有趣的是,研究人员在测试 Kimi K3 时,发现它对 Opus 和 GPT 的推理片段表现出异常的兼容性。虽然这不能证明 Kimi K3 蒸馏自这些模型,但结合此前 Anthropic 指控 Moonshot AI 蒸馏 Claude 的事件,这一发现极具启发性。
所属事件:闭源大模型思维链加密被证实可被窃取(16 条相关)→
「安全」频道最新
- 影响上亿 AMD CPU:新漏洞可解锁微码与系统管理模式 — OwariDa · 2026-08-13
- AI 安全研究员发文评 OpenAI 事件,称其如生化危机 — JacquesThibs · 2026-08-13
- TrustedSec 深度文章:AI 进攻并非穿墙外挂 — cyb3rops · 2026-08-13
- 马萨诸塞州一青少年涉嫌在 ChatGPT 协助下杀害母亲与兄弟 — nbcnews · 2026-08-13
- AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单 — sebkrier · 2026-08-13
- AI对齐探讨升温:多元视角聚焦价值与治理困境 — sebkrier · 2026-08-13