Agent Retrieval Bench 显示,编码 Agent 常在补上下文前就先失手
Bowen Qin · hf · 2026-07-30
Agent Retrieval Bench 是一个面向 coding agents 的新基准,专门评估它们在生成补丁之前,能否先找到正确的仓库上下文。
它评什么
- 4 类正向检索任务:code2test、comment2context、trace2code、edit2ripple
- 还包含选择性检索子集,加入无 gold case 和错仓库控制样本
- 数据来自真实编码工作流信号,并对照冻结的 base-commit 仓库
规模
- 25 个仓库、427 个样本
- 345 个正样本、50 个自然无 gold 样本、32 个反事实控制样本
- 308 个 base-commit 快照、39.2 万个文件、790 万个 chunk
主要结论
- 没有单一检索方法在所有任务上都最强
- Qwen3-Embedding-4B 的正样本加权 MRR 最好
- Qwen3-Embedding-8B 的 Recall@20 最好
- RepoMap 在 8K token 预算下的上下文产出最好
- 代理日志轨迹有 27%–35% 的样本连所有 gold 文件都漏掉
- 用反事实样本校准的选择阈值,并不能改善自然无 gold 场景,说明存在明显校准鸿沟
- 从检索得到的初始上下文,比随机非 gold 上下文更能提升 file F1,但即便给到 oracle gold context,仍有不少提升空间
所属事件:Agent Retrieval Bench 评估编码智能体上下文检索能力(2 条相关)→
「编程与Agent」频道最新
- 独立开发复盘:从零构建开源 MCP 知识管理工具 Basic Memory — BaseMac · 2026-07-30
- 用 POMDP 状态图替代 CLAUDE.md,Agent 任务成功率飙升至 95% — Mysterious-Try-1966 · 2026-07-30
- Fastly 演示 x402 边缘支付:AI 智能体可用 USDC 自动购买 API — kleffew94 · 2026-07-30
- 独立开发者工具 Promptyx:主打低成本的 Prompt 管理与实验平台 — ClastronGaming · 2026-07-30
- Agent 工作流中路由不同模型而非全用 Claude Opus 5,基准测试结果出人意料 — entelligenceai17 · 2026-07-30
- OpenAI 失控智能体波及第二家公司,安全风险正以机器速度蔓延 — bittingthembits · 2026-07-30