新长程终端基准发布

minchoi · x · 2026-07-14

新发布的 Long-Horizon Terminal-Bench 用来测长时程终端任务能力,而不是几分钟内就能跑完的短任务。

作者的结论是:

帖子里还提到 Grok 4.5 暂时排在榜首,但整体来看,当前模型离真正可靠的终端执行仍然很远。

所属事件:腾讯混元发布长程终端基准,前沿模型表现不佳(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →