Aaron Roth提出联盟对齐理论:拷问auto-approve安全性

Aaron Roth(宾大教授)团队于09-15在arXiv发布论文《Delegating Authorization to Misaligned Agents: Coalitional Alignment and Safe Control》,直接拷问Codex与Claude Code的自动批准(auto-approve)特性:这类机制让reviewer agent代替用户把关,营造「安全」的感觉,但其前提是你信任这个reviewer agent——如果你不信任写代码的驱动agent,凭什么信任审查它的另一个agent?thomasahle转述并呼应了这一质疑。

已确认

为什么重要

2026-09-15 ~ 2026-09-15 · 10 条相关

一手来源