微软南大提出 LoopsBench:评估 Agent 长期编程维护能力

jiqizhixin · x · 2026-08-27

微软与南京大学提出 LoopsBench,一个用于评估 AI 智能体长期软件工程能力的基准。它包含 112 个任务、5300 多个开发单元和 8 种语言,中位数任务依赖深度为 6。该基准测试智能体在长时间执行中维护计划、代码和测试状态的能力,而不仅仅是单次任务解决。结果表明,即使最佳配置的任务解决率仅 25%,测试通过率 53%,引入“延续”机制可显著提升表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →