Frontier-Bench v0.1 发布,最强智能体仅得 34%
Terminal-Bench 和 Harbor 团队正式发布了全新的智能体评测基准 Frontier-Bench v0.1,旨在衡量并持续追踪前沿 AI 智能体的实际工作能力。目前,表现最好的智能体在该基准的 74 项任务中得分仅为 34%,凸显了当前模型在处理复杂任务时的巨大局限性,该基准值得开发者密切关注。
已确认
Frontier-Bench 首个版本 v0.1 包含 74 项任务,官方强调这些任务具备高难度、多样化和高质量的特点。在当前的首轮测试中,最强智能体的得分仅约为 34%。
为什么重要
据多位关注者(如 @tokenbender 和 @ajratner)转述,该基准的核心价值在于其“动态演进”机制。传统评测基准往往面临一经发布就迅速过时的问题,而 Frontier-Bench 团队计划定期加入新任务并持续改进现有任务,使其能够始终与前沿智能体的能力同步增长,从而更客观地评估模型在实际工作中的表现。
2026-07-24 ~ 2026-07-24 · 5 条相关
一手来源
- 评估智能体新标尺:Frontier-Bench 基准测试发布 — ajratner ·
- Frontier-Bench 发布 v0.1,带来 74 个任务的持续更新基准 — tokenbender ·
- 【源头】评估智能体新标尺:Frontier-Bench 基准测试发布 — ajratner · 2026-07-24
- Frontier-Bench 上线:74 个任务,最强 agent 约 34% — giswqs · 2026-07-24
- 【源头】Frontier-Bench 发布 v0.1,带来 74 个任务的持续更新基准 — tokenbender · 2026-07-24
另有 2 条近重复转述:BenBlaiszik · ajratner