新基准 TB-fn 揭秘:部分终端模型排名大幅下滑

abeirami · x · 2026-08-27

针对 Terminal Bench 2.1 排行榜头部模型的真实能力引发质疑,研究者推出了 TB-fn 基准。TB-fn 通过增加步骤、收紧要求或需要更复杂算法重新设计了相同的 89 个任务,并移除了捷径解。结果显示,在 TB-2.1 上聚集的模型在 TB-fn 上分布到了更多层级,GPT-5.6 Sol 和 Opus 5 保持领先,而其他模型性能显著下降。模型在 TB-fn 上的平均工作量增加了 38%。

所属事件:新基准 TB-fn 揭露终端模型刷榜乱象(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →