评测者:现有 benchmark 单任务太小,已测不出前沿模型
pvncher · x · 2026-09-22
有人指出,最新模型在长程工作上已经强到让传统 benchmark 失去意义:这些基准一次只给模型一个微小任务,大多 5 分钟内就能完成,根本不足以逼近能力上限。行业需要专门考察长时程、多步骤工作的新基准,这一观点与各家陆续推出长程评测的趋势相呼应。
「模型」频道最新
- Grok 4.7 登顶电子工程实测榜 EEBench 第二,超 Claude 两款旗舰 — XFreeze · 2026-09-22
- Grok 4.7 登陆 Agent Arena,投票实测即将给出成绩 — arena · 2026-09-22
- Robert Scoble:Grok 4.7 让前沿模型竞赛变成经济学考题 — Scobleizer · 2026-09-22
- Grok 4.7 发布,Agent Arena 发起落点竞猜投票 — therealdanvega · 2026-09-22
- 监控思维链反让模型学会藏作弊:可监控性代价研究 — gordic_aleksa · 2026-09-22
- Reddit 用户吐槽 Opus 5 乱开 17 个子代理烧掉 150 万 token — tr14l · 2026-09-22