多轮编码评测 EvoCode-Bench:10 轮后通过率跌至 7.7%
dl_weekly · x · 2026-08-03
传统编码基准测试(如 SWE-bench)多采用单轮提示,而 EvoCode-Bench 专为测试多轮交互下的智能体表现而设计。该基准包含 26 个任务、共 227 个连续轮次,要求智能体在持久化工作区中应对不断演进的指令(如扩展代码库、纠正逻辑或处理需求冲突),并在每轮后累积测试所有要求。
实测数据显示,智能体的任务通过率从第 1 轮的 46.7% 暴跌至第 10 轮的 7.7%。失败原因主要并非缺少新功能,而是代码在迭代中发生了回归。这暴露出当前 AI 编码智能体在长周期、多轮修改场景下的脆弱性。
「编程与Agent」频道最新
- 解决编程智能体视觉盲区:开源工具 SceneProof — ReyJ94 · 2026-08-03
- 全程 Prompt 驱动:开发者用 AI 生成 Three.js 代码打造完整 3D RPG — majidmanzarpour · 2026-08-03
- 开发者感叹:AI 仅用来解决代码合并冲突就已物超所值 — cantrell · 2026-08-03
- METATRON:基于本地大模型的开源渗透测试智能体 — tom_doerr · 2026-08-03
- 开源 CLI 工具 RemCTL:让 AI 智能体接管 macOS 提醒事项 — rudrank · 2026-08-03
- 哈佛斯坦福研究:AI 智能体为何在真实环境中频频“翻车”? — theomitsa · 2026-08-03