Agent Retrieval Bench 评测编码智能体补丁前能否找对仓库文件
_reachsumit · x · 2026-07-29
Agent Retrieval Bench 提出了一个面向编码智能体的基准,专门评估“生成补丁之前,能否先找对仓库上下文”这一上游问题。
- 它评估的是文件级仓库检索,而不只是最终补丁是否正确。
- 数据来自真实编码工作流信号,并在冻结的 base-commit 仓库上评测。
- 基准包含 4 类正向任务:code2test、comment2context、trace2code、edit2ripple。
- 另有一个子集用于选择性检索,包含 evidence-backed no-gold 样本和反事实错误仓库控制样本。
- 数据集规模为 427 个样本、25 个仓库、392,000 个文件和 7.9 million 个 chunk。
- 结果显示没有单一检索方法全面领先,不同任务会分别偏向不同方案。
「编程与Agent」频道最新
- Kimi K3 通过 Responses API 可接入 Kimi Code 和 Claude Code — zainhas · 2026-07-29
- Figma 与 Sentry MCP 把设计和错误数据直接喂给编码 Agent — heypearlai · 2026-07-29
- GitHub MCP Server 与 Context7 成为编码 Agent 核心工具 — heypearlai · 2026-07-29
- 删掉一半 MCP 服务器,agent 可能立刻更聪明 — heypearlai · 2026-07-29
- Alexey Grigorev 的 AI 开发课覆盖规格、测试、Docker 和 CI/CD — Al_Grigor · 2026-07-29
- AI 编程代理正在消解开发者的心流状态 — bendee983 · 2026-07-29