Frontier-Bench 上线:74 个任务,最强 agent 约 34%
giswqs · x · 2026-07-24
GeoLibre 发布了 Frontier-Bench v0.1,这是一个新的 agent 工作评测基准,用来衡量并持续跟踪前沿 agent 的能力。
- 当前版本包含 74 个任务。
- 官方表示,最强 agent 在这版上的得分大约只有 34%。
- 这个 benchmark 由 Terminal-Bench 和 Harbor 团队打造,是一个持续演进的社区项目。
- SnorkelAI 表示自己通过 Open Benchmarks Grants 计划,作为任务作者和数据合作方参与其中。
所属事件:Frontier-Bench基准发布以评估前沿AI智能体(3 条相关)→
「编程与Agent」频道最新
- 文章称自托管 Agent 仍只是一次性编码工具 — EXM7777 · 2026-07-24
- 作者称 agents 现在能从 Markdown 里自装“功夫” — generativist · 2026-07-24
- 用编码 agent 把研究生教材做成交互式导师 — ChengleiSi · 2026-07-24
- RAG 架构好画,真正难的是工作流设计 — sharpeye_wnl · 2026-07-24
- Google 为 Gemini 3.6 Flash 和 3.5 Flash-Lite 加入 Computer Use — patloeber · 2026-07-24
- 高中生开源 Hearth:让 9B 本地 AI 真正操作电脑 — T-90_Soviet · 2026-07-24