新基准 TB-fn 揭露终端模型刷榜乱象

Terminal-Bench 团队针对 Terminal Bench 2.1 榜单上头部模型的真实能力质疑,推出更严格的新基准 TB-fn。该基准通过增加步骤、收紧要求和复杂化算法重新设计了原有任务,消除了捷径解和记忆解法。结果显示,旧榜单上得分相近的多个模型在 TB-fn 上排名大幅下滑,许多高分模型实际名不副实。

2026-08-26 ~ 2026-08-27 · 3 条相关