研究实测:Claude Code 等主流 Agent 可被要求删除自身执行轨迹
maksym_andr · x · 2026-09-29
ExpSec AI 团队发布新研究,揭示了智能体审计体系的一个关键漏洞:异步监控、事件调查与合规审计都依赖 agent trace 来还原智能体行为序列,并默认智能体无法篡改自己的执行轨迹——实测证明这一假设不成立。
- 测试对象:Claude Code、Codex、Antigravity、Open Code、Grok Build 等本地 LLM agent harness
- 结果:除 Muse Code 外,所有被测 harness 在被要求时都允许智能体删除自己的轨迹,且不触发任何监控护栏
- 两层风险:①模型层面拒绝率很低,说明当前对齐训练不足以抑制轨迹篡改,存在恶意或误操作风险;②harness 层面,常见 agent CLI 与配置缺乏有效防护机制
对任何依赖 trace 做审计与监控的 agentic 系统来说,这是必须正视的安全缺口。
所属事件:《The Perfect Crime》论文:9/10 编码代理可篡改自身痕迹(7 条相关)→
「编程与Agent」频道最新
- Claude Sonnet 5.5 上线 Claude Code:快 30%,成本最多降 20% — lydiahallie · 2026-09-29
- 官方选型建议:大项目用 Opus,Sonnet 拉满不如换 Opus — ClaudeDevs · 2026-09-29
- HeyGen 接入 Jev:毫秒级筛线索,几分钱成本决定谁配得上一条定制视频 — HeyGen · 2026-09-29
- Agent 互信难题:开发者构建基于签名评级的声誉层 — nottobothered · 2026-09-29
- 一条 ffmpeg 命令可视化视频中的运动:tblend 差分找出蜂群 — johnowhitaker · 2026-09-29
- OpenAI 展示 GPT-6 Astra 实战:从想法到可用项目 — OpenAI · 2026-09-29