评测者:现有 benchmark 单任务太小,已测不出前沿模型

pvncher · x · 2026-09-22

有人指出,最新模型在长程工作上已经强到让传统 benchmark 失去意义:这些基准一次只给模型一个微小任务,大多 5 分钟内就能完成,根本不足以逼近能力上限。行业需要专门考察长时程、多步骤工作的新基准,这一观点与各家陆续推出长程评测的趋势相呼应。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →