长程终端任务智能体基准

_akhaliq · x · 2026-07-14

这条指向论文 Long-Horizon-Terminal-Bench,主题是测试智能体在长时程终端任务上的能力边界。

论文标题说明作者关注的是:

从命名和介绍看,这项工作更像是一个面向 agent 的评测基准/方法,用来系统检验模型在长链路终端任务中的表现,而不是单纯展示某个模型刷榜。

所属事件:腾讯混元发布长程终端基准,前沿模型表现不佳(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →