102 万个 PR 研究:Agent 代码评审更快,却未提升质量
rohanpaul_ai · x · 2026-07-27
- 这项研究分析了 207 个 GitHub 项目的 102 万个 pull request,比较了从纯人工评审到 LLM 辅助、再到 agentic review 的迁移过程。
- 结果显示:在 agent 时代,渐进式采用 AI 或 快速转向 agent 的项目,评审时间分别下降了 每千行代码 2.5 天 和 4.5 天。
- 但早期大量引入 LLM reviewer 的项目,并没有显著的效率收益。
- 研究者认为,差异来自评审交互模式:agent 发起 和 多 agent 的评审通常更快达成决定,因为 agent 先完成初步检查和总结,留给人工 reviewer 的回合更短。
- 不过,AI 参与的流程也出现更多质量问题:相关模式中,78%–94% 的 PR 出现 review smells,而纯人工评审约为 69%–76%。
- 作者指出,问题部分来自把同一个 AI reviewer 身份反复分配出去,这会压缩 reviewer 多样性。
「编程与Agent」频道最新
- 有人吐槽:HTTP 对 AI 代理最好只读别写 — rickasaurus · 2026-07-27
- HTTP 对 AI 来说太“可写”了,只读更安全 — rickasaurus · 2026-07-27
- 编程智能体的自动模式,怎么做审批才顺手 — rickasaurus · 2026-07-27
- 基于 bento 改造的 Skill 可生成可编辑 HTML PPT — vista8 · 2026-07-27
- 团队称 Fable 吃掉了首周 AI 工作流 30% 成本 — gabrielchua · 2026-07-27
- PRO-LONG 用日志式 harness 在 ARC-AGI-3 得到 97.4% — srchvrs · 2026-07-27