研究破解三大厂商加密思维链,可还原前沿模型隐藏推理

matthew_d_green · x · 2026-08-11

一项新研究成功破解了 Anthropic、OpenAI 和 Google 前沿模型 API 返回的「加密」思维链(CoT)。

研究人员将前沿模型生成的加密思维轨迹重放给较弱的同族模型,随后对弱模型进行越狱,迫使其逐字转录附带的推理内容。这种方法无需直接攻击强模型或触发其防蒸馏机制,即可在纯文本中恢复其隐藏推理。研究还发布了一款在线游戏,挑战玩家识别解码后的推理属于哪个模型。

所属事件:116页论文揭示大模型API漏洞:加密思维链可被提取(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →