微软推LoopsBench评测长周期Agent,当前最佳仅解25%任务
机器之心 · wechat · 2026-08-22
微软联合南京大学推出LoopsBench,一个面向长周期软件工程的Coding Agent评测基准。传统基准如SWE-bench侧重一次性任务解决,而LoopsBench关注Agent在持续执行、多任务依赖与代码回归控制上的表现。
核心创新:
- Dependency DAG:将长周期任务拆解为多个可验证的Development Unit,并根据真实代码调用或继承关系构建依赖有向无环图(DAG),不再只看最终结果,而是评估执行路径是否合理。
- Flow-aware Runtime:评测器仅评测依赖已满足(处于Ready Frontier)的任务;已完成的单元会转化为Regression Obligation,迫使Agent在后续开发中保护既有功能。
- 数据来源:包含112个任务、5300个开发单元,源自大学课程实验、连续的GitHub PR序列及研究代码演化。
实验发现:
- 即便最佳配置,任务完整解决率(Resolve Rate)仅为25%,测试通过率53.05%。
- 引入外部循环(Continuation)可将解决率从约17%提升至25%,但无法解决深层依赖推进问题。
- 现有Agent在规划层面常无法完整恢复任务依赖关系,容易将并行任务压成线性链,或过早并行化本应串行的任务。
「编程与Agent」频道最新
- Keep.md 新手引导升级:Fable 设计助优化 AI Agent 素材管理 — iannuttall · 2026-08-22
- 构建高价值 AI 系统前:先禁止 AI 写代码 — aryanXmahajan · 2026-08-22
- AI 代码重构的风险:可能误删重要技术债 — sebpaquet · 2026-08-22
- MiniMax M3 挂机一夜,自己写出模糊测试又转静态分析,挖出 TypeScript 编译器崩溃 bug — DanielLockyer · 2026-08-22
- Claude Code 防失控:10 种指令放置机制详解 — bibryam · 2026-08-22
- 实战复盘:Codex 编写与 Claude Code 审查的双工模式 — Vegetable-Try807 · 2026-08-22