微软LoopsBench评测长周期编码Agent,最强配置Opus-4.7只解出25%任务

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

cs.SE, cs.CL

2026-08-01

微软把112个真实开发任务做成带依赖DAG的LoopsBench。最强配置Opus-4.7加Claude Code外循环只解出25%;规划只还原部分前置依赖,各loop都还有回归。

这篇在解决什么

编码Agent已经从「修一个issue」扩到连续很久的软件开发。基础设施也在变:Claude Code、Codex的goal mode,以及动态工作流,都是在harness上面再套一层loop,让目标、进度标准和任务分配跨很长的执行过程还在。

现有基准大多只看终态。SWE-bench一类给自包含issue,FeatureBench一类把改动做大,评分仍是最后过不过测试。中间节点保没保住、有没有回归、依赖顺序走没走对,都看不见。

微软、南大、UCL、上交的LoopsBench把评测对象从harness engineering改成loop engineering。

方法

每个任务是一张依赖DAG。节点是可单独测试的开发单元,边是有源证据的前置关系:顺序PR链、模块复用、生产者-消费者API、组合分层。热文件和锁文件进黑名单,避免假依赖。图给出一个源上恢复的开发顺序,当描述性参照,不当最优解。

112个任务来自三类真实材料:29条PR序列、57个课程实验、26条研究演化,覆盖8种语言、9个领域,中位依赖深度6,开发单元超过5300。入选门槛是时间跨度至少2.5个月、源相关规模至少1200。

评测运行时按就绪前沿放测试:前置全过,后继测试才计入得分;过了的节点一直留着当回归义务。Agent可以乱序改代码,但不许假装不知道依赖。双容器快照把编辑和判分拆开,按真实改动点记loop trace。

任务说明书用Claude Code离线从gold diff恢复验收意图,抹掉实现路径、仓库名和论文标题,降低污染。Agent看不到gold解和当前就绪单元。

结果

最强配置是Opus-4.7加Claude Code再加外循环续跑,Resolve Rate 25.00%,测试通过率53.05%,归一化依赖深度0.61。去掉外循环只剩16.96%。GPT-5.5在Codex上带外循环是21.43%。固定Claude Code时,GPT-5.5到20.54%,GLM-5.1和DeepSeek-V4P都是18.75%。开源loop更弱:OpenHands 9.82%,SWE-agent 8.93%,mini-swe-agent 7.14%(均带外循环)。

规划对源DAG还原不全。Claude Code的边F1是0.71,层相关0.65;mini-swe-agent掉到0.27和0.22。闭源loop偏树状并行,宽度比略高于1;开源loop接近一条链。对最终解出的单元,补丁长度是gold的1.58到2.54倍,自写测试远少于原生套件,Claude Code回归率7.11%。轻量loop回归看起来低,是因为能回归的已通过义务本来就少。

四种loop画像里,Claude动态工作流每轮97.96次上下文预算、Resolve Rate 24.11%,Ralph只有13.24轮和7.84%。动态工作流每轮仍有0.36次回归事件,刷新上下文消不掉回归压力。

为什么重要

谁在做长周期编码Agent,单刷SWE-bench不够。这篇把loop实现和模型拆开测:同一模型换loop,成绩差一截;同一loop换模型,成绩也差一截。真正掉点的地方是全局计划、残差任务路由、以及已完成义务的回归保持。

可落地的诊断是那组trace指标:边F1、宽度比、补丁膨胀、自写测试数、回归率。闭源loop会过并行,开源loop会串成链,两边都缺测试。外循环续跑能减少早停,但不能把后期单元从前期未完成义务里救出来。

局限与存疑

恢复出的DAG是下界,会漏配置、数据格式、构建系统和跨服务依赖。固定图当评测契约,探索性推翻前置需求的任务不在范围内。任务池偏向有可审计证据的仓库、课程和论文实现,移动、偏前端和硬件项目基本没有。

正确率绑在放出的测试套件上,不是语义等价。检查点对Agent不可见,回归率混进了反馈不足。构建管线用了Claude Code和Opus-4.7,措辞、单元边界和测试可能带模型偏好,公开源也有污染风险。评测贵,专有模型输出会漂。LoopsBench量的是一份可执行契约,不是上线就绪。

术语

原文与代码

社区讨论

相关论文

全部论文解读