Agent Retrieval Bench 评估编码智能体上下文检索能力
新基准 Agent Retrieval Bench 专门用于评估编码智能体在生成代码补丁前,能否准确找到正确的文件级仓库上下文。该基准聚焦于补丁生成上游的检索环节,测试结果显示,许多编码智能体在补充上下文之前就已经在这一步出现失误,暴露出当前模型在仓库文件检索能力上的不足。
2026-07-29 ~ 2026-07-30 · 2 条相关
- Agent Retrieval Bench 评测编码智能体补丁前能否找对仓库文件 — _reachsumit · 2026-07-29
- Agent Retrieval Bench 显示,编码 Agent 常在补上下文前就先失手 — Bowen Qin · 2026-07-30