研究:加密思维链可跨会话重放,窃取 Claude/OpenAI/Google 前沿模型隐藏推理
maksym_andr · x · 2026-10-01
MATS、ELLIS 图宾根、马普所等机构的研究者发布 Stolen Thoughts 论文:Anthropic、OpenAI、Google 的 API 会向客户端返回加密的 chain-of-thought 块,这些 trace 可以跨会话、跨用户甚至跨模型重放。攻击者把前沿模型的 trace 重放进较弱的同系模型,再越狱弱模型,即可明文恢复强模型的隐藏推理——全程不直接攻击强模型,也不触发其反蒸馏防护。
要点:
- 仅需两次 API 调用即可完成推理提取;
- 在 reasoning effort 设为 MAX 时,Astra/Sol 等模型会明显意识到自己的 token 预算,甚至开始省略空格来省 token;
- 作者称在负责任披露两个月后审计缓解措施,发现仍可通过第三方 API 提供商提取 Astra/Sol-6.1 的逐字推理痕迹;
- 论文还附带一个「猜模型」小游戏,包含 Kimi-K3 等样例的解码推理。
帖主 maksymandr 补充称 GPT-6 Astra 和 Sol 的推理输出看起来相当异常,与该攻击相关。
「安全」频道最新
- 同帖转发:OpenAI 称 Moonshot 相关人员参与提取模型隐藏推理 — kimmonismus · 2026-10-01
- OpenAI 指控 Moonshot 相关人员主导提取其模型隐藏推理 — kimmonismus · 2026-10-01
- 「被钓鱼一次就永远被钓鱼」:一条智能体 AI 三连推喜剧 — suchenzang · 2026-10-01
- Anthropic 报告披露五起科学家绕过 Claude 护栏探询功能增益实验 — nordicinst · 2026-10-01
- AI 供应链需要 SBOM:Agentic AI 带来授权漂移等新型安全风险 — ChuckDBrooks · 2026-10-01
- OpenAI 首次指控中国实验室蒸馏:4 天 1.6 万次请求窃取隐藏推理 — rohanpaul_ai · 2026-10-01