Terminal-Bench 团队推出 Frontier-Bench 智能体评测
BenBlaiszik · x · 2026-07-24
Terminal-Bench 团队发布了全新的智能体基准测试 Frontier-Bench,旨在随着模型能力的快速演进而持续动态更新,避免测试集“一经发布即过时”的问题。
目前发布的 v0.1 版本包含 74 项任务,表现最好的智能体得分率约为 34%。任务类别中,除了软件工程(SWE)外,科学类任务成为第二大类别,旨在推动学术界在智能体评测中获得与编程同等程度的关注。
所属事件:Frontier-Bench v0.1 发布,最强智能体仅得 34%(5 条相关)→
「编程与Agent」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11