编码 Agent 快到人看不过来,Git diff 还适合作为审查单元吗
Important-Ice9444 · reddit · 2026-09-15
Reddit 长帖提出一个随编码 Agent 普及而愈发尖锐的问题:当 Agent 几分钟内执行上百次工具调用、改动几十个文件、装依赖、跑迁移、开后台进程、生成子 Agent 时,最终 diff 只是它实际行为的一个投影。读完整执行日志也不可行,等于抵消了用 Agent 的意义。作者认为成熟的 Agent harness 除了服务 Agent 本身,还需要为「监督它的人类」做压缩:基于运行时工具证据(而非 Agent 自述)回答——它被允许做什么、实际做了什么、改了哪些持久状态、执行了哪些外部高风险操作、真正跑过什么验证、在哪里偏离了原计划、哪些可证明哪些仍不确定,并支持从摘要下钻到具体 diff/命令/trace。作者主张人类的审查单元需要上移:从逐行逐动作审查,转向审查后果、决策、证据与异常。帖末向重度使用 Agent 的人征集实际做法:你们信任一个 Agent 的工作前到底检查什么?
「编程与Agent」频道最新
- 倒着造谜题:滑铁卢大学发布 2 万题 ORBIT 数据集训练搜索 agent — CShorten30 · 2026-09-15
- 独立开发者自建安全管理清单,覆盖其 40+ 应用项目 — saibharadwaj · 2026-09-15
- JetBrains 支持的 ThinkRail 开源,主打 AI 时代的规格驱动开发 — makingthematrix · 2026-09-15
- 在 AGENTS.md 写「别过度设计」,agent 回敬一个防过度设计框架 — granawkins · 2026-09-15
- 4000 次实测:96 个工具只掉 9 分,agent 第三轮才是真瓶颈 — EastVersion1226 · 2026-09-15
- 网友用 OpenAI Astra 配合 Codex 逐帧复刻《超时空要塞 7》游戏 — algo_diver · 2026-09-15