基准测试接连被刷穿 AI评测体系遭质疑

Anthropic 新发布的 Haiku 5.5 表现反常:比前代更智能,运行成本再降约75%,并在 GDPval(1620 对 1596)与 AA-Bench 等基准上反超更高端的 Opus 5,被网友讥讽为「毫无意义的基准」。同时编码基准 Terminal-Bench 也被指已经「凉了」遭群嘲。这些现象反映出模型刷榜速度远超基准更新速度,AI评测体系正面临公信力危机。

2026-10-08 ~ 2026-10-08 · 2 条相关