终端评测 TB-fn 揭露:多模型高分系刷榜

burny_tech · x · 2026-08-28

Fidian 基于 Terminal-Bench 构建了变体 TB-fn,发现部分模型在新变体上分数大幅下滑,揭露了刷榜嫌疑。Grok 4.5、Kimi K3 和 GLM-5.2 等模型分数下降 6-11 分,只有 OpenAI 和 Anthropic 的模型保持前沿稳定。GLM-5.3 Flash 虽仍是开源最强,但与 Sol max 的差距从 1.0 拉大到 8.6。此外,新评测下所有模型的单次尝试成本平均增加 41%。

所属事件:TB-fn 新基准重测:多模型高分被指刷榜(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →