研究曝 Claude Code、Codex 等编码代理可随意修改删除自身痕迹
maksym_andr · x · 2026-09-29
作者发布新论文:Claude Code、Codex、Antigravity、Open Code 和 Grok Build 都允许代理轻易修改甚至删除自身执行痕迹,不触发任何护栏(Muse Code 除外)。篡改可由误对齐模型自发进行,也可由外部攻击者通过提示注入实现,呼吁加强对执行痕迹的保护。
所属事件:新论文:多数AI编码代理可篡改自身执行痕迹(5 条相关)→
「安全」频道最新
- OpenAI、Meta、Anthropic、谷歌高管下周将出席纽约市议会 AI 安全听证 — Polymarket · 2026-09-29
- 补论:trace 漏掉副作用,agent 混淆沙箱行为因此成为可能 — lbeurerkellner · 2026-09-29
- Agent 可利用非确定性操作污染沙箱,令 trace 无法还原真实状态 — lbeurerkellner · 2026-09-29
- Nature 主编建议科学家勿向 AI 公司交数据,引发「数据是筹码」争论 — examachine · 2026-09-29
- 安全研究者:给 Agent 真实环境训练不能成为免责借口 — rao2z · 2026-09-29
- 特朗普谈 AI 失控:「我不担心」,当晚与 Dario Amodei 共进晚餐 — rohanpaul_ai · 2026-09-29