Terminal-Bench 团队推出 Frontier-Bench 智能体评测

BenBlaiszik · x · 2026-07-24

Terminal-Bench 团队发布了全新的智能体基准测试 Frontier-Bench,旨在随着模型能力的快速演进而持续动态更新,避免测试集“一经发布即过时”的问题。

目前发布的 v0.1 版本包含 74 项任务,表现最好的智能体得分率约为 34%。任务类别中,除了软件工程(SWE)外,科学类任务成为第二大类别,旨在推动学术界在智能体评测中获得与编程同等程度的关注。

所属事件:Frontier-Bench 基准发布:专测前沿 AI 智能体(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →