Auto-approve 真的安全吗?Codex 与 Claude Code 审查员模式遭理论拷问

Aaroth · x · 2026-09-15

Aaron Roth 质疑 Codex 和 Claude Code 的自动批准(auto-approve)特性:它不再向用户请求权限,而是让一个 reviewer agent 代为把关,给用户「安全」的感觉。但他指出逻辑漏洞——这套机制的前提是向 agent 要权限;如果你本就不信任提出动作的 driver agent,凭什么信任负责审批的 reviewer agent?两个 agent 的效用函数都可能与你不同,审查环节本身可能就是错位的。

所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →