研究证实:可通过弱模型提取闭源大模型加密思维链

tw1st3d_m3nt4t · reddit · 2026-08-12

一项新研究揭示了主流大模型 API 的严重安全隐患:Anthropic、OpenAI 和 Google 等厂商返回的加密思维链区块,可以被跨会话、跨用户和跨模型重放。

研究人员通过将前沿模型生成的加密轨迹重放到较弱的同族模型中,对弱模型进行越狱,最终成功以纯文本形式恢复了强模型的隐藏推理过程。这种攻击方式无需直接攻击强大的目标模型,也不会触发其防蒸馏安全护栏。

所属事件:研究称加密思维链可被破解并用于窃取模型推理能力(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →