ICAE-Bench 把 coding agent 放进模糊需求做项目场景
Zhongyuan Peng · hf · 2026-07-24
ICAE-Bench:把 coding agent 放进“交互式做项目”场景评测
这篇论文指出,现有 coding agent 基准大多还停留在“题目写清楚、代码补完整”的静态任务上,跟现在越来越常见的 vibe-coding 工作流不匹配:真实场景里,代理要把模糊产品意图逐步变成可运行的软件,过程中还要会规划、澄清需求、调工具、排错和仓库级构建。
ICAE-Bench 的核心设计是:
- 从真实开源仓库出发,保留其可执行行为,但把需求改造成模糊的产品目标
- 用自动化 User Agent 模拟交互,既能揭示隐藏约束,又不引入新需求或泄露实现细节
- 评估时结合 黑盒测试 与多维诊断指标,包括:
- 功能正确性
- 语义与 API 相似度
- 结构一致性
- 设计质量
- 交互质量
它的目标是把 coding agent 评测从“答题”推进到“协作做项目”。
「编程与Agent」频道最新
- Webcmd 认为浏览器智能体把 token 浪费在导航而不是任务本身 — heyshrutimishra · 2026-07-24
- AREX 提出内外双循环的递归自改进研究智能体 — _reachsumit · 2026-07-24
- 一个本地开源 Agent Skill 能标出多余的 diff 改动 — Saboo_Shubham_ · 2026-07-24
- 别给 Agent 暴露上千工具,改用代码沙箱 — edgestone22 · 2026-07-24
- “让 Claude 看代码库,基本等于开源” — _Stocko_ · 2026-07-24
- Roboto Agents 新增根因分析,直连机器人日志与源码 — Scobleizer · 2026-07-24