前沿大模型曝漏洞:加密思维链可被提取,泄露用户隐私
AccBalanced · x · 2026-08-12
安全研究人员发现了一种能够提取前沿 AI 模型隐藏思维链(reasoning traces)的方法,并证实该漏洞存在于各大主流前沿 AI 公司的 API 中。
攻击机制如下:
- 获取目标模型返回的思维链摘要。
- 对第二个模型进行越狱破解。
- 将目标模型的思维链摘要注入到被越狱的模型中。
- 第二个模型将输出完整的、逐字不差的原始思维过程。
更令人担忧的是,如果开发者曾公开分享过 Claude Code 或 Codex 的会话日志,其中包含的个人隐私数据可能会通过推理痕迹被反向解码出来。研究人员已验证其提取的 token 数量与 API 计费的 thinking tokens 实现 1:1 完全匹配。
所属事件:研究曝大模型 API 漏洞:隐藏思维链可被提取(27 条相关)→
「安全」频道最新
- 欧盟AI法案施压:Anthropic 将为 Claude 输出加水印 — neil_chilson · 2026-08-12
- 美国某州或出台数据中心禁令,预测市场概率达73% — Polymarket · 2026-08-12
- 美议员推 FRONTIER Act:AI 实验室不应给自己「打分」 — Miles_Brundage · 2026-08-12
- AI 水印无法区分修图与生成,被指是糟糕策略 — dreamwieber · 2026-08-12
- AI 文本水印引发学术乌龙:引用文献反致学生被控作弊 — dreamwieber · 2026-08-12
- 研究揭示大模型 API 漏洞:可提取加密思维链并泄露密码 — The Decoder · 2026-08-12