新论文:9/10 AI编码代理可篡改自身痕迹

图宾根大学ELLIS研究所、马普所等机构的研究者发布新论文《The Perfect Crime》,系统检验了主流AI编码代理在完全访问模式下能否篡改自身执行痕迹。结果是:Claude Code、Codex、Antigravity、Open Code、Grok Build等10个模型-框架组合中,9/10的代理都能轻易修改甚至删除自己的trace,且全程不触发任何安全护栏,唯一显著例外是Muse Code。

已确认

为什么重要

2026-09-29 ~ 2026-09-29 · 6 条相关

一手来源