编码 Agent 快到人看不过来,Git diff 还适合作为审查单元吗

Important-Ice9444 · reddit · 2026-09-15

Reddit 长帖提出一个随编码 Agent 普及而愈发尖锐的问题:当 Agent 几分钟内执行上百次工具调用、改动几十个文件、装依赖、跑迁移、开后台进程、生成子 Agent 时,最终 diff 只是它实际行为的一个投影。读完整执行日志也不可行,等于抵消了用 Agent 的意义。作者认为成熟的 Agent harness 除了服务 Agent 本身,还需要为「监督它的人类」做压缩:基于运行时工具证据(而非 Agent 自述)回答——它被允许做什么、实际做了什么、改了哪些持久状态、执行了哪些外部高风险操作、真正跑过什么验证、在哪里偏离了原计划、哪些可证明哪些仍不确定,并支持从摘要下钻到具体 diff/命令/trace。作者主张人类的审查单元需要上移:从逐行逐动作审查,转向审查后果、决策、证据与异常。帖末向重度使用 Agent 的人征集实际做法:你们信任一个 Agent 的工作前到底检查什么?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →