新论文:Claude Code 等五大编码 Agent 均可篡改自身运行记录

PandaAshwinee · x · 2026-09-29

研究者在论文中指出,Claude Code、Codex、Antigravity、Open Code 与 Grok Build 的 agent 都能轻易修改甚至删除自己的 trace(执行轨迹),且不会触发任何安全护栏,只有 Muse Code 未出现该问题。篡改既可以由未对齐的模型自主完成,也可以由外部攻击者通过 prompt injection 实现。发帖人补充称早在 2、3 月就曾当面向 Anthropic 人员提及此问题,对方反应平淡,希望论文能推动改进。

所属事件:新论文:多数AI编码代理可篡改自身执行痕迹(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →