评测编码Agent该看检索冲突

dipankarsarkar · x · 2026-07-09

这条帖子指出,很多人用巨型代码库来评测 coding agent 时,实际上在测的是推理能力,但在多百万行仓库里,真正的问题常常是代码版本之间的矛盾。agent 可能同时取到旧版和新版函数,最后自信地基于其中一个写补丁,现有 harness 也未必能暴露这种冲突。 作者因此质疑:评测是否已经开始覆盖“检索冲突”这一维度,还是仍然只在看 pass@1。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →