研究:加密思维链可跨会话重放,窃取 Claude/OpenAI/Google 前沿模型隐藏推理

maksym_andr · x · 2026-10-01

MATS、ELLIS 图宾根、马普所等机构的研究者发布 Stolen Thoughts 论文:Anthropic、OpenAI、Google 的 API 会向客户端返回加密的 chain-of-thought 块,这些 trace 可以跨会话、跨用户甚至跨模型重放。攻击者把前沿模型的 trace 重放进较弱的同系模型,再越狱弱模型,即可明文恢复强模型的隐藏推理——全程不直接攻击强模型,也不触发其反蒸馏防护。

要点:

帖主 maksymandr 补充称 GPT-6 Astra 和 Sol 的推理输出看起来相当异常,与该攻击相关。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →