116页论文揭示大模型漏洞:可提取加密思维链
xeophon · x · 2026-08-11
一篇长达116页的新论文指出,OpenAI、Anthropic 和 Gemini 等模型存在严重的安全漏洞,攻击者能够大规模提取其被加密的原始推理过程(如思维链)。
这种漏洞会导致多种安全问题,包括模型蒸馏攻击和凭证提取。此外,研究还发现模型中存在大量难以阅读的推理(尤其是 GPT 系列)、不忠实的推理,以及某些开源模型可能确实经过蒸馏的痕迹。
所属事件:研究揭示API漏洞可提取加密思维链并现蒸馏证据(38 条相关)→
「安全」频道最新
- 影响上亿 AMD CPU:新漏洞可解锁微码与系统管理模式 — OwariDa · 2026-08-13
- AI 安全研究员发文评 OpenAI 事件,称其如生化危机 — JacquesThibs · 2026-08-13
- TrustedSec 深度文章:AI 进攻并非穿墙外挂 — cyb3rops · 2026-08-13
- 马萨诸塞州一青少年涉嫌在 ChatGPT 协助下杀害母亲与兄弟 — nbcnews · 2026-08-13
- AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单 — sebkrier · 2026-08-13
- AI对齐探讨升温:多元视角聚焦价值与治理困境 — sebkrier · 2026-08-13