新长程终端基准发布
minchoi · x · 2026-07-14
新发布的 Long-Horizon Terminal-Bench 用来测长时程终端任务能力,而不是几分钟内就能跑完的短任务。
- 基准包含 46 个真实终端任务,覆盖 9 类场景
- 评测了 18 个前沿模型,统一使用 Terminus-2 harness
- 单任务最长可到 90 分钟、约 120–320 步
- 采用隐藏的、基于回放的 verifier,尽量防止捷径和 reward hacking
- 还引入连续部分得分,避免把“有进展”简单压成 0/1
作者的结论是:
- 最好的模型平均奖励也只有 0.505
- 还有 29/46 个任务没有任何模型能完成
- 长程 agent 现在能“开始工作”,但离“把活干完”还差得很远
帖子里还提到 Grok 4.5 暂时排在榜首,但整体来看,当前模型离真正可靠的终端执行仍然很远。
所属事件:腾讯混元发布长程终端基准,前沿模型表现不佳(6 条相关)→
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11