Frontier-Bench v0.1 发布,最强智能体仅得 34%

Terminal-Bench 和 Harbor 团队正式发布了全新的智能体评测基准 Frontier-Bench v0.1,旨在衡量并持续追踪前沿 AI 智能体的实际工作能力。目前,表现最好的智能体在该基准的 74 项任务中得分仅为 34%,凸显了当前模型在处理复杂任务时的巨大局限性,该基准值得开发者密切关注。

已确认

Frontier-Bench 首个版本 v0.1 包含 74 项任务,官方强调这些任务具备高难度、多样化和高质量的特点。在当前的首轮测试中,最强智能体的得分仅约为 34%。

为什么重要

据多位关注者(如 @tokenbender 和 @ajratner)转述,该基准的核心价值在于其“动态演进”机制。传统评测基准往往面临一经发布就迅速过时的问题,而 Frontier-Bench 团队计划定期加入新任务并持续改进现有任务,使其能够始终与前沿智能体的能力同步增长,从而更客观地评估模型在实际工作中的表现。

2026-07-24 ~ 2026-07-24 · 5 条相关

一手来源

另有 2 条近重复转述:BenBlaiszik · ajratner