腾讯混元发布长程终端基准,前沿模型表现不佳

腾讯混元发布了 Long-Horizon-Terminal-Bench,用于测试智能体在长链路、长时程终端任务中的能力边界。它之所以值得关注,在于这类评测不再聚焦几分钟即可完成的短任务,而是转向持续多步、耗时更长、对稳定执行要求更高的真实终端工作流。

关键细节

根据官方帖文,这一 benchmark 包含 46 个长时任务,覆盖 9 类场景。@akhaliq 补充称,其核心设计之一是采用基于密集奖励的评分方式,以更细粒度地衡量 agent 在复杂持续任务中的完成情况,而不只看最终是否做完。多条帖子还提到,单项任务最长可达 90 分钟,并在统一环境中对约 20 个前沿模型进行了评测。

结果与信号

@iamfakhrealam 总结称,这组测试暴露了现有模型在长程终端执行上的明显短板:Grok 4.5 排名第一,但最佳模型也只完成 46 个任务中的 13 个;29 个任务没有任何模型能够解决,约 55% 的运行得分低于预期。整体信号是,大模型在长时间、多步骤、需要持续操作和保持稳定性的终端任务上,距离可靠胜任仍有明显差距。

2026-07-13 ~ 2026-07-14 · 6 条相关

一手来源