ICAE-Bench 把 coding agent 放进模糊需求做项目场景

Zhongyuan Peng · hf · 2026-07-24

ICAE-Bench:把 coding agent 放进“交互式做项目”场景评测

这篇论文指出,现有 coding agent 基准大多还停留在“题目写清楚、代码补完整”的静态任务上,跟现在越来越常见的 vibe-coding 工作流不匹配:真实场景里,代理要把模糊产品意图逐步变成可运行的软件,过程中还要会规划、澄清需求、调工具、排错和仓库级构建。

ICAE-Bench 的核心设计是:

它的目标是把 coding agent 评测从“答题”推进到“协作做项目”。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →