微软南大提出 LoopsBench:评估 Agent 长期编程维护能力
jiqizhixin · x · 2026-08-27
微软与南京大学提出 LoopsBench,一个用于评估 AI 智能体长期软件工程能力的基准。它包含 112 个任务、5300 多个开发单元和 8 种语言,中位数任务依赖深度为 6。该基准测试智能体在长时间执行中维护计划、代码和测试状态的能力,而不仅仅是单次任务解决。结果表明,即使最佳配置的任务解决率仅 25%,测试通过率 53%,引入“延续”机制可显著提升表现。
「编程与Agent」频道最新
- EgoSuite 数据集可视化浏览器工具开源 — jonstephens85 · 2026-08-27
- 周报:利用 76 个信源与 AI Agent 智能筛选 188 条未来信号 — ben_r · 2026-08-27
- 开源 1 万+ 图像生成提示词库,支持 Claude 等智能体检索 — tom_doerr · 2026-08-27
- Agent 间通信无需复杂协议,仅需审批即可实现安全协作 — jasonkneen · 2026-08-27
- MiniMax M3 模型发布:百万上下文与 SOTA 编码能力 — MiniMax_AI · 2026-08-27
- 使用本体论作为概率型 Agent 的语义护栏 — JeremyCMorgan · 2026-08-27