多轮编码评测 EvoCode-Bench:10 轮后通过率跌至 7.7%

dl_weekly · x · 2026-08-03

传统编码基准测试(如 SWE-bench)多采用单轮提示,而 EvoCode-Bench 专为测试多轮交互下的智能体表现而设计。该基准包含 26 个任务、共 227 个连续轮次,要求智能体在持久化工作区中应对不断演进的指令(如扩展代码库、纠正逻辑或处理需求冲突),并在每轮后累积测试所有要求。

实测数据显示,智能体的任务通过率从第 1 轮的 46.7% 暴跌至第 10 轮的 7.7%。失败原因主要并非缺少新功能,而是代码在迭代中发生了回归。这暴露出当前 AI 编码智能体在长周期、多轮修改场景下的脆弱性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →