评估智能体新标尺:Frontier-Bench 基准测试发布

ajratner · x · 2026-07-24

Terminal-Bench 和 Harbor 团队发布了 Frontier-Bench,这是一个旨在衡量并随前沿智能体工作共同演进的全新基准测试。

目前发布的 v0.1 版本包含 74 项任务,当前最优秀的 AI 智能体在这些任务上的最高得分仅为约 34%。Snorkel AI 作为任务作者和数据合作伙伴参与了该项目的贡献。

所属事件:Frontier-Bench基准发布以评估前沿AI智能体(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →