LoopArena 基准测试:模型做循环工程控制器的成功率仅 25%

dair_ai · x · 2026-09-01

LoopArena 是一个新的基准,用于评估模型作为“循环工程”中控制器的表现,即指导一个固定的编码 Agent 完成长周期软件开发任务的能力。研究发现,在全任务上的最佳结果仅约 25%,可靠的长周期循环控制仍极具挑战性。该测试将控制器与执行 Worker 解耦,从而能更准确地判断任务成败是源于引导策略还是 Agent 本身。常见的失败模式包括信任过时的进度笔记、跳过必要的验证以及在任务未完成前过早停止。

所属事件:LoopArena 基准发布:模型控制编码 Agent 成功率仅约 25%(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →