From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
Suzhen Zhong, Shayan Noei, Bram Adams, Ying Zou
cs.SE
2026-07-15
研究分析 207 个 GitHub 开源项目 102 万条 PR,发现 Agent 参与代码审查可使决策提速 2.5~4.5 天/KLOC,但所有 AI 介入模式的「固定审查者」代码异味显著高于纯人工审查,效率收益与质量改善无法同步兑现。
代码审查是软件质量的关键把关环节,但随着 AI 生成代码量暴增——Google 报告 75% 的新代码已由 AI 生成——人工审查者正面临前所未有的积压压力。与此同时,GitHub 上的 LLM 审查工具和 AI Agent 审查工具已经开始大规模参与 PR 流程,形成了「纯人工、LLM 辅助、Agent 审查」三代并存的格局。学界缺乏横跨三个时代的大规模实证证据:这种转变究竟如何影响审查效率?代码审查质量是否随之提升?这正是本文要回答的核心问题。
研究团队从 GitHub 抽取了 2,490 个候选项目,筛选出在 2022 年 5 月至 2026 年 2 月间持续活跃、且每个时代均有 400 条以上 PR 的 207 个开源项目,最终得到 102 万条带有审查记录的 PR 数据集。
数据标注:通过 GitHub REST API 区分人类账号与 Bot 账号,再人工核查官方文档,将 Bot 分为规则型 Bot、传统 ML 审查工具、LLM 审查工具(如 LlamaPReview)和 AI Agent 审查工具(如 Claude Code)四类。随机抽取 384 条 Agent 时代 PR 进行人工核验,其中 360 条含有明确的规划、上下文检索或提交等 Agent 行为证据。
三类采纳模式识别:以月度 AI 参与率为时间序列,使用软 DTW 聚类将 207 个项目分组。最优聚类数=3(轮廓系数 0.40),形成三种采纳模式。
审查质量度量:效率指标为从 PR 创建到最终决策的天数/KLOC(代码变更千行数),规避了大 PR 对时长的放大效应。质量指标采用六类「代码审查异味」,包括睡眠审查(超 2 天无决策)、固定审查者(同一审查者覆盖作者 50% 以上 PR)、大变更集(超 500 行)等。
协作模式提取:将每条 PR 的审查评论按时间序列化为审查者类型序列,再用 Markov 链+期望最大化(EM)算法抽象为 10 种协作模式,以 BIC 最小化选择最优模式数量。
三种采纳模式:渐进式采纳(46% 项目)在 Agent 时代审查效率显著提升 -2.5 天/KLOC;快速 LLM 采纳(22% 项目,LLM 参与率 91%)审查效率无显著变化,但代码异味率在 LLM 时代上升 8.0 个百分点;快速 Agent 采纳(32% 项目,主要来自微软、谷歌等大公司)在 Agent 时代效率提升 -4.5 天/KLOC。
效率与质量的悖论:在 Agent 时代,以 Agent 发起(Agent-Init)或多 Agent 参与(Multi-Agent)的 PR,在渐进式采纳和快速 Agent 采纳中均跻身效率最优分组,快于纯人工审查。但几乎所有含 AI 的协作模式的代码异味率显著高于纯人工审查(78%94% vs 69%76%),且差距主要源于固定审查者异味:LLM 参与模式下该比例从人工的 16% 升至 60%,Agent 参与下升至 53%。
解释性模型发现:一旦 LLM 或 Agent 参与,人-AI 协作模式成为解释审查效率和固定审查者异味的最强因子,超越了传统的 PR 规模、审查活跃度等指标。
这是首个横跨人工、LLM、Agent 三个代际的大规模代码审查纵向实证研究。它用 102 万条真实 PR 打破了一个朴素预设:AI 加入审查不等于质量提升。效率改善与质量改善之间存在真实的权衡,快速铺开 LLM 审查甚至带来了质量下滑。
研究发现,Agent 发起审查比人类发起更快,因为 Agent 负责了检查摘要这一步骤,人工只需作最终确认;但这也使团队对特定 AI 审查账号的依赖度急剧上升。对于正在规划 AI 辅助代码审查流程的工程团队,这些发现提供了具体的操作参考:渐进引入、按 PR 类型匹配、避免单一 AI 审查账号垄断。
因果性缺失:逻辑回归模型描述的是统计关联而非因果关系。观察到「Agent 参与→更多固定审查者异味」并不意味着 Agent 直接导致了质量下滑,可能是团队在引入 Agent 时恰好已形成了固定审查习惯。
外部效度:数据集仅覆盖开源 GitHub 项目,企业内部私有代码库的审查文化可能截然不同。研究时窗止于 2026 年 2 月,而 AI 审查工具能力迭代极快,当前结论有时效性。
审查质量的代理指标争议:代码审查异味反映的是流程风险,并非直接测量代码缺陷密度或后续 Bug 率。固定审查者是否真的导致更多线上问题,仍需后续研究验证。