LoopArena 论文:Agent 循环控制器才是瓶颈,最强模型成功率仅 24.7%
rohanpaul_ai · x · 2026-09-03
论文《LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering》把「管理编码 Agent 的循环」从「写代码的模型」中剥离出来评测:
- 实验固定 Qwen3.7-Plus 作为编码 Worker,只更换决定其下一步任务的 Controller;
- 在完整 27 任务测试中,最好的控制器 GPT-5.5 的 Strict Success Rate 也只有 24.69%;
- 每轮简单复述原始目标的基线得 18.52%——与完全不加控制让 Worker 自由跑完全相同;
- 结论:有效的控制必须根据演化的证据在实现、验证、恢复、停止之间切换,而不是反复说「继续」;
- 启示:评测 agent 系统时应把「管理循环的模型」与「写代码的模型」分开测。
「编程与Agent」频道最新
- Firecrawl 开源 anydoc:毫秒级把 Word/PDF 等文档转 Markdown — tom_doerr · 2026-09-03
- 清华发布 Frontis-MA1:35B 模型在 MLE-Bench 冲到 71% — ceciletamura · 2026-09-03
- Codex Remote 更新:iOS 排队消息自动同步,无需保持前台 — Dimillian · 2026-09-03
- 全自动开源模型追踪站上线:新 HF 模型 1 天内收录并给出理论最高 tok/s — helloiamleonie · 2026-09-03
- 清理 Codex 近 900 条自动化聊天记录,瞬间感觉轻快 — CtrlAltDwayne · 2026-09-03
- 纯 fragment shader 实现 radix sort:零 compute 每秒 50 亿键值对 — Michael_Moroz_ · 2026-09-03