LoopArena 基准评测:谁适合做编码 Agent 的运行时控制器
PepsiBetter · reddit · 2026-09-07
作者团队发布开源基准 LoopArena,专门研究长时程编码 agent 系统中的一个问题:哪个模型适合担任运行时 Controller——即审查当前状态、决定编码 agent 下一步做什么/验证什么、并判断任务何时停止的角色。评测中 Worker、Reporter、工具与预算均固定,只更换 Controller 模型,实现受控对比。
基准设三级设置:
- Type I:无需实际运行 Worker 的下一步控制决策评测
- Type II:在选定任务切片上做重复 Controller 决策
- Type III:从原始起始状态控制完整软件任务
初步结果:五个 Controller 中,Type III 严格成功率最高仅 24.69%,说明全任务运行时控制仍然很难;Type II 将推理成本平均降低 64.4%,且在核心指标下给出与 Type III 相近的排名。基准数据、评测代码、公开协议与 v0.1.0 结果均已开源(GitHub/HF/arXiv)。
「编程与Agent」频道最新
- 开发者自嘲:被叫 vibe coder,「我能 15 分钟不看 Google 写完 FizzBuzz」 — tlakomy · 2026-09-07
- 同时照看 4 个并行 agent,开发者直呼像带娃 — smlpth · 2026-09-07
- 把文本扩展器交给 AI 管家:一篇别致的自动化工作流长文 — bfrench · 2026-09-07
- 开发者晒 Astra 一键清理破坏性容器,直呼效果惊艳 — Dimillian · 2026-09-07
- Codex 应用现怪异 bug:发出首个 prompt 后输入框消失 — theteknosaur · 2026-09-07
- kevins8 分享一句话 prompt:让编码 agent 大幅简化实现代码 — steipete · 2026-09-07