Terminal-Bench 团队推出 Frontier-Bench 智能体评测
BenBlaiszik · x · 2026-07-24
Terminal-Bench 团队发布了全新的智能体基准测试 Frontier-Bench,旨在随着模型能力的快速演进而持续动态更新,避免测试集“一经发布即过时”的问题。
目前发布的 v0.1 版本包含 74 项任务,表现最好的智能体得分率约为 34%。任务类别中,除了软件工程(SWE)外,科学类任务成为第二大类别,旨在推动学术界在智能体评测中获得与编程同等程度的关注。
所属事件:Frontier-Bench 基准发布:专测前沿 AI 智能体(4 条相关)→
「编程与Agent」频道最新
- The Primeagen 说 AI 编程工具已足够强做结构重构 — nicolascraske · 2026-07-24
- 开发者称安全拦截太多,受限编程模型越来越难用 — kristoph · 2026-07-24
- ChatGPT 桌面端新功能:执行任务时可语音实时追问与重定向 — kevinkern · 2026-07-24
- Dimillian 盛赞 Codex:可随时打断并动态创建任务 — Dimillian · 2026-07-24
- Andrew Ng 总结从循环到图的 4 个智能体步骤 — theomitsa · 2026-07-24
- Liveclip MCP 服务器可先用 snippets 暴露文档提纲 — firasd · 2026-07-24