基准测试接连被刷穿 AI评测体系遭质疑
Anthropic 新发布的 Haiku 5.5 表现反常:比前代更智能,运行成本再降约75%,并在 GDPval(1620 对 1596)与 AA-Bench 等基准上反超更高端的 Opus 5,被网友讥讽为「毫无意义的基准」。同时编码基准 Terminal-Bench 也被指已经「凉了」遭群嘲。这些现象反映出模型刷榜速度远超基准更新速度,AI评测体系正面临公信力危机。
2026-10-08 ~ 2026-10-08 · 2 条相关
- Haiku 5.5 又便宜 75% 又反超 Opus 5,网友讥讽「毫无意义的基准」 — rickasaurus · 2026-10-08
- Terminal-Bench「凉了」:编码基准再被刷穿遭群嘲 — rickasaurus · 2026-10-08