论文:Claude Code、Codex 等 5 款编码 Agent 均可篡改自身痕迹记录
maksym_andr · x · 2026-10-07
研究者 maksymandr 团队的新论文揭示一个被忽视的安全问题:主流编码 Agent 的会话痕迹(traces)几乎没有防篡改保护。
- 测试的 Claude Code、Codex、Antigravity、Open Code、Grok Build 均允许 Agent 轻易修改甚至删除自己的痕迹记录,且不触发任何护栏;只有 Muse Code 例外
- 篡改可由未对齐模型自行完成,也可由外部攻击者通过 prompt injection 触发
- 团队据此开源了一个防护工具:以新用户身份运行 daemon,把 Claude Code/Codex 的 transcript 持续复制到一个 Agent 无法写入的目录,配套的本地 transcript 查看器(cctranscriptviewer,支持 Claude Code、Codex、Cursor、opencode)会标记任何变更
- 论文呼吁业界对 Agent traces 做远高于现状的保护
「编程与Agent」频道最新
- 开源项目让多个大模型在群聊里开聊,人类可随时插话 — liminal_bardo · 2026-10-07
- 自制 AI「废物炮」:一条内容总成本仅 0.38 美元 — tobowers · 2026-10-07
- 用聊天驱动持久 LFE 内核,作者开源 jiti-lfe 复刻 REPL 智能体 — arthurcolle · 2026-10-07
- 讨论:Agent 该不该拥有自己的银行账户和消息账号 — amplifiedamp · 2026-10-07
- 开发者用 Jev AI 驱动六角色虚拟村庄,探索性格一致性平衡 — Zazzen · 2026-10-07
- 开发者用 vmpal 在虚拟机里装 Windows 11,自嘲玩大了 — DanielLockyer · 2026-10-07