Frontier-Bench基准发布以评估前沿AI智能体

GeoLibre联合Terminal-Bench与Harbor团队正式发布了Frontier-Bench v0.1基准测试。该基准旨在衡量并持续跟踪前沿AI智能体处理复杂工作的能力。目前版本共包含74个任务,而当前表现最强的AI智能体在该基准上的完成率仅约为34%,凸显了现有智能体在实际复杂任务执行上的巨大提升空间。

2026-07-24 ~ 2026-07-24 · 3 条相关