新研究:可从加密思维链中提取OpenAI等模型隐藏推理

dpaleka · x · 2026-08-11

一项新研究显示,Anthropic、OpenAI和Google的前沿模型返回的加密思维链(chain-of-thought)块可被重放并用于提取隐藏推理。研究者将强模型的推理痕迹重放到较弱的兄弟模型中,通过越狱弱模型,无需直接攻击强模型即可恢复其明文推理。论文还确认了OpenAI模型有时使用类似外星语言进行推理,自称“我们”或“它”,并出现“vantages”、“marinades”等循环。

所属事件:研究揭示API漏洞可提取加密思维链并现蒸馏证据(38 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →