研究揭示利用元数据可精准窃取大模型隐藏思维链

npinto · x · 2026-08-13

研究人员在《Stolen Thoughts》论文中指出了一种提取大模型隐藏思维链(CoT)的方法:利用响应元数据中始终可用的 ground truth token 数量。当提取的 token 数量与真实数量完全一致时,就能极高概率确认成功窃取了真实推理过程。然而,有开发者指出一种简单的防御手段:直接禁用模型自带的思考功能,转而提供一个 deepthink 工具,让模型以内部 CoT 格式去调用它,从而规避上述提取攻击。

所属事件:欧洲团队破解三大顶级大模型加密思维链(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →