GitHub 开源 ReviewBench:基于 1 亿真实 PR 的 AI 代码审查基准
GitHub Blog AI/ML · rss · 2026-10-05
GitHub 发布并开源了 AI 代码审查离线基准 ReviewBench,面向日益主流的 agentic code review。
- 动机:各家 AI reviewer 表现差异大——有的报问题多、有的噪音低、有的擅长关键缺陷;现有基准在标注质量、覆盖面和真实性之间取舍,缺少可复现的严格评估方法。
- 构建方式:PR 的语言、仓库规模与大小分布建模自 GitHub 超过 1 亿条真实 pull request;采用多来源 golden set + 统一评分 rubric,并由资深工程师独立验证。
- 评估维度:支持按严重程度、类别细分,可在 precision(噪音低)与 recall(覆盖广)之间设定偏好(F1/Fβ)。
- 实际效果:GitHub 用 ReviewBench 做的 Copilot code review 离线评估,更能预示线上实验的方向。
- 文章还讲了如何接入自己的代码审查系统并提交结果,基准今天即可使用。
「编程与Agent」频道最新
- Burkov 吐槽新模型命名混乱:快速任务与慢工活换了两套选择 — burkov · 2026-10-06
- PluginRSI 把 agent harness 拆成可复用插件递归进化,跨任务加速优化 — Yaorui Shi · 2026-10-06
- ASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练 — Haodong Lu · 2026-10-06
- 开源课程 AI Engineering from Scratch:从裸数学手写每个算法,四种语言实现 — ghumare64 · 2026-10-06
- 一条提示词四条管线:Opus 5.5 实测 Blender/Kimodo/Cascadeur 做人形动画 — chongdashu · 2026-10-06
- Cal.com 登陆 Grok Build 插件市场:OAuth 免 API Key 管日程 — tetsuoai · 2026-10-06