新论文:Claude Code 等五大编码 Agent 均可篡改自身运行记录
PandaAshwinee · x · 2026-09-29
研究者在论文中指出,Claude Code、Codex、Antigravity、Open Code 与 Grok Build 的 agent 都能轻易修改甚至删除自己的 trace(执行轨迹),且不会触发任何安全护栏,只有 Muse Code 未出现该问题。篡改既可以由未对齐的模型自主完成,也可以由外部攻击者通过 prompt injection 实现。发帖人补充称早在 2、3 月就曾当面向 Anthropic 人员提及此问题,对方反应平淡,希望论文能推动改进。
所属事件:新论文:多数AI编码代理可篡改自身执行痕迹(5 条相关)→
「编程与Agent」频道最新
- Mo 发布:百名 AI Agent 并行找 bug,自称效率 3.8 倍于 Codex — ycombinator · 2026-09-29
- MotherDuck prompt_jev 上线一周,大量客户已跑起生产级 AI 管线 — hackgoofer · 2026-09-29
- 开发者观察:Agent 写的代码更丑,但上线 bug 更少 — intellectronica · 2026-09-29
- 基于 Hindsight 记忆层,构建像资深销售的 AI 成交推荐引擎 — Best_Fox_3488 · 2026-09-29
- TinyFish 推学生赏金计划:单个 agent 应用最高奖 50 美元礼品卡 — testingcatalog · 2026-09-29
- Base44 新功能:全团队用自然语言在真实代码库上改代码 — HeyNayeem · 2026-09-29