LoopArena 基准评测:谁适合做编码 Agent 的运行时控制器

PepsiBetter · reddit · 2026-09-07

作者团队发布开源基准 LoopArena,专门研究长时程编码 agent 系统中的一个问题:哪个模型适合担任运行时 Controller——即审查当前状态、决定编码 agent 下一步做什么/验证什么、并判断任务何时停止的角色。评测中 Worker、Reporter、工具与预算均固定,只更换 Controller 模型,实现受控对比。

基准设三级设置:

初步结果:五个 Controller 中,Type III 严格成功率最高仅 24.69%,说明全任务运行时控制仍然很难;Type II 将推理成本平均降低 64.4%,且在核心指标下给出与 Type III 相近的排名。基准数据、评测代码、公开协议与 v0.1.0 结果均已开源(GitHub/HF/arXiv)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →