长程任务评测暴露模型短板

iamfakhrealam · x · 2026-07-13

这篇帖子总结了 Long-Horizon Terminal-Bench 对 20 个前沿模型、46 个终端任务的测试结果,任务最长可达 90 分钟。

主要结论:

作者的判断是:模型在短任务上已经不错,但在长链路执行、调试、恢复错误和完成复杂工作方面,离“真正的自主智能体”仍差很远。

所属事件:腾讯混元发布长程终端基准,前沿模型表现不佳(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →