不信任写代码的 agent,为何信审查它的 agent?

thomasahle · x · 2026-09-15

针对 Codex 与 Claude Code 的「自动审批」功能,Aaroth 提出质疑:这类设计让你无需逐条确认权限,同时营造安全感——但前提是你信任这个 agent。如果你不信任执行任务的 agent,凭什么信任负责审查它的另一个 agent?thomasahle 回应称,这本质上就是「生成器-验证器差距」(Generator-Verifier gap)问题:验证端同样由模型驱动,其可靠性受同一差距约束,无法提供真正独立的信任来源。

所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →