评估智能体新标尺:Frontier-Bench 基准测试发布
ajratner · x · 2026-07-24
Terminal-Bench 和 Harbor 团队发布了 Frontier-Bench,这是一个旨在衡量并随前沿智能体工作共同演进的全新基准测试。
目前发布的 v0.1 版本包含 74 项任务,当前最优秀的 AI 智能体在这些任务上的最高得分仅为约 34%。Snorkel AI 作为任务作者和数据合作伙伴参与了该项目的贡献。
所属事件:Frontier-Bench基准发布以评估前沿AI智能体(3 条相关)→
「研究」频道最新
- FLUX.3 [dev] 将开放图像、视频、音频和机器人动作权重 — multimodalart · 2026-07-24
- Black Forest Labs 预热开放权重多模态骨干 FLUX.3 — multimodalart · 2026-07-24
- DSPy 和 GEPA 用户常靠自定义 proposer 降低过拟合 — dbreunig · 2026-07-24
- 机器人模型在任务中途换手后仍能重新完成动作 — E0M · 2026-07-24
- 用编码 agent 把研究生教材做成交互式导师 — ChengleiSi · 2026-07-24
- 模型突然“开窍”比平滑收敛更有戏剧感 — alex_peys · 2026-07-24