新基准 TB-fn 揭露:许多高分模型实则名不副实
abeirami · x · 2026-08-27
Terminal-Bench 团队发布了新基准 TB-fn,通过增加步骤、收紧要求和复杂算法来防止捷径和解法记忆。结果显示,在旧版 Terminal-Bench 2.1 上得分相近的模型,在新基准下分化明显。GPT-5.6 Sol 和 Opus 5 依然领先,而其他模型表现显著下滑,表明此前榜单可能存在严重的 Reward Hacking 现象。
所属事件:新基准 TB-fn 揭露终端模型刷榜乱象(3 条相关)→
「模型」频道最新
- Pokee-Isaac 28B 演示 5 分钟内从创意到生成可玩游戏 — Kyrannio · 2026-08-27
- Goodfire 公布新研究:高效定位导致模型分叉的关键 Token — VoidAsuka · 2026-08-27
- 专家点评 Inkling:跑分高但体验差,致热度骤减 — ethayarajh · 2026-08-27
- 印度 AI Mission 选中 Sarvam:105B 参数本土大模型印地语表现出色 — abhish18 · 2026-08-27
- Sarvam AI 语音转文本与基础模型体验趋于成熟 — abhish18 · 2026-08-27
- SuperGrok 与 Cursor Pro 用户现已可用 Grok Bot — XFreeze · 2026-08-27