腾讯混元发布长程终端基准,前沿模型表现不佳
腾讯混元发布了 Long-Horizon-Terminal-Bench,用于测试智能体在长链路、长时程终端任务中的能力边界。它之所以值得关注,在于这类评测不再聚焦几分钟即可完成的短任务,而是转向持续多步、耗时更长、对稳定执行要求更高的真实终端工作流。
关键细节
根据官方帖文,这一 benchmark 包含 46 个长时任务,覆盖 9 类场景。@akhaliq 补充称,其核心设计之一是采用基于密集奖励的评分方式,以更细粒度地衡量 agent 在复杂持续任务中的完成情况,而不只看最终是否做完。多条帖子还提到,单项任务最长可达 90 分钟,并在统一环境中对约 20 个前沿模型进行了评测。
结果与信号
@iamfakhrealam 总结称,这组测试暴露了现有模型在长程终端执行上的明显短板:Grok 4.5 排名第一,但最佳模型也只完成 46 个任务中的 13 个;29 个任务没有任何模型能够解决,约 55% 的运行得分低于预期。整体信号是,大模型在长时间、多步骤、需要持续操作和保持稳定性的终端任务上,距离可靠胜任仍有明显差距。
2026-07-13 ~ 2026-07-14 · 6 条相关
一手来源
- 腾讯混元发布长链路Agent基准 — Tencent-Hunyuan ·
- 长时程终端智能体评测基准 — _akhaliq ·
- 长程任务评测暴露模型短板 — iamfakhrealam ·
- 【源头】腾讯混元发布长链路Agent基准 — Tencent-Hunyuan · 2026-07-13
- 【源头】长程任务评测暴露模型短板 — iamfakhrealam · 2026-07-13
- 长周期终端任务评测:大模型仍难胜任 — iamfakhrealam · 2026-07-13
- 新长程终端基准发布 — minchoi · 2026-07-14
- 【源头】长时程终端智能体评测基准 — _akhaliq · 2026-07-14
- 长程终端任务智能体基准 — _akhaliq · 2026-07-14