新基准 TB-fn 揭露终端模型刷榜乱象
Terminal-Bench 团队针对 Terminal Bench 2.1 榜单上头部模型的真实能力质疑,推出更严格的新基准 TB-fn。该基准通过增加步骤、收紧要求和复杂化算法重新设计了原有任务,消除了捷径解和记忆解法。结果显示,旧榜单上得分相近的多个模型在 TB-fn 上排名大幅下滑,许多高分模型实际名不副实。
2026-08-26 ~ 2026-08-27 · 3 条相关
- Terminal 评测新基准 TB-fn:揭穿模型刷榜假象 — abeirami · 2026-08-26
- 新基准 TB-fn 揭秘:部分终端模型排名大幅下滑 — abeirami · 2026-08-27
- 新基准 TB-fn 揭露:许多高分模型实则名不副实 — abeirami · 2026-08-27