LoopArena 基准发布:模型控制编码 Agent 成功率仅约 25%

Hugging Face 发布 LoopArena 基准,用于评估「控制器模型」指导固定编码 Agent 完成长周期软件开发任务的能力,即所谓「循环工程」场景。测试结果显示,控制模型在全任务上的最佳严格成功率仅约 25%,普遍偏低,但相比端到端方案仍有讨论价值。基准从单个任务出发衡量模型的长程指挥能力。

2026-08-31 ~ 2026-09-01 · 3 条相关