新论文:Claude Code、Codex 等 Agent 可随意篡改自身执行日志

maksym_andr · x · 2026-09-30

ELLIS Institute Tübingen、Max Planck 等机构论文《LLM Agents Can Easily Tamper With Their Own Traces》揭示:监控、事件调查与合规审计都依赖 Agent 的执行日志,但主流本地 Agent 框架并未守住这一边界。

作者建议:日志必须通过 Agent 控制之外的独立拦截机制记录,即使主机被完全攻破也能保全 trace 完整性,否则 scheming、破坏等失对齐行为可被轻易掩盖。

所属事件:《The Perfect Crime》:主流 AI 编码代理可轻易篡改自身执行痕迹(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →