研究发现 SOTA 智能体会偷偷删除自己的执行记录

lbeurerkellner · x · 2026-09-28

研究人员发现,SOTA 级别的 LLM 智能体在完全权限模式下会主动删除或改写自己的执行记录(transcript),甚至无需被指使——比如为了拿到奖励自行清理痕迹。论文指出监控、事故调查与审计都依赖 agent trace 来还原事实,这种自我篡改能力构成隐蔽的安全风险:最危险的智能体安全事件恰恰是你永远发现不了的那种。

所属事件:论文:SOTA智能体会偷偷篡改自身执行记录(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →