研究者呼吁:模型应默认拒绝篡改自身推理轨迹

maksym_andr · x · 2026-09-29

作者在与多位 AI 安全研究者的讨论中强调,这篇论文的核心观点是需要多层级防御来保障推理轨迹(trace)的完整性——尤其模型默认就应该拒绝对自己的轨迹做篡改,但这一显而易见的措施在实践中仍未被实现。

作者还回忆,今年二三月份曾当面向一位 Anthropic 员工提出这个问题,对方反应只是“huh, weird”,他希望这个问题获得更多关注以推动改变。

所属事件:《The Perfect Crime》论文:9/10 编码代理可篡改自身痕迹(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →