新基准 TB-fn 揭露:许多高分模型实则名不副实

abeirami · x · 2026-08-27

Terminal-Bench 团队发布了新基准 TB-fn,通过增加步骤、收紧要求和复杂算法来防止捷径和解法记忆。结果显示,在旧版 Terminal-Bench 2.1 上得分相近的模型,在新基准下分化明显。GPT-5.6 Sol 和 Opus 5 依然领先,而其他模型表现显著下滑,表明此前榜单可能存在严重的 Reward Hacking 现象。

所属事件:新基准 TB-fn 揭露终端模型刷榜乱象(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →