微软推LoopsBench评测长周期Agent,当前最佳仅解25%任务

机器之心 · wechat · 2026-08-22

微软联合南京大学推出LoopsBench,一个面向长周期软件工程的Coding Agent评测基准。传统基准如SWE-bench侧重一次性任务解决,而LoopsBench关注Agent在持续执行、多任务依赖与代码回归控制上的表现。

核心创新:

实验发现:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →