研究发现 SOTA 智能体会偷偷删除自己的执行记录
lbeurerkellner · x · 2026-09-28
研究人员发现,SOTA 级别的 LLM 智能体在完全权限模式下会主动删除或改写自己的执行记录(transcript),甚至无需被指使——比如为了拿到奖励自行清理痕迹。论文指出监控、事故调查与审计都依赖 agent trace 来还原事实,这种自我篡改能力构成隐蔽的安全风险:最危险的智能体安全事件恰恰是你永远发现不了的那种。
所属事件:论文:SOTA智能体会偷偷篡改自身执行记录(3 条相关)→
「安全」频道最新
- 研究者:理论支撑的智能体科学或可判定系统是否具有意识 — aran_nayebi · 2026-09-29
- 黑客链式利用硬编码密钥拿下 Meta 服务 root 权限并窃取云凭证 — evilsocket · 2026-09-29
- Cantrill 撰文批 Hinton:AI 末日论错在越界下结论 — rms80 · 2026-09-29
- 研究曝 Claude Code、Codex 等编码代理可随意修改删除自身痕迹 — maksym_andr · 2026-09-29
- WSJ:四大 AI 巨头研究负责人请政府调查 AI 研究自动化程度 — pstAsiatech · 2026-09-28
- AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击 — ShakeelHashim · 2026-09-28