新基准 TB-fn 揭秘:部分终端模型排名大幅下滑
abeirami · x · 2026-08-27
针对 Terminal Bench 2.1 排行榜头部模型的真实能力引发质疑,研究者推出了 TB-fn 基准。TB-fn 通过增加步骤、收紧要求或需要更复杂算法重新设计了相同的 89 个任务,并移除了捷径解。结果显示,在 TB-2.1 上聚集的模型在 TB-fn 上分布到了更多层级,GPT-5.6 Sol 和 Opus 5 保持领先,而其他模型性能显著下降。模型在 TB-fn 上的平均工作量增加了 38%。
所属事件:新基准 TB-fn 揭露终端模型刷榜乱象(3 条相关)→
「模型」频道最新
- Deepseek V4 Flash 刷新纪录:单流解码达 420 tok/s — HankYeomans · 2026-08-27
- Grok Bot 提效并放宽频率限制,用户称短时间内巨大改进 — XFreeze · 2026-08-27
- 部分模型近期审查变严?社区讨论“越狱”难度上升 — Connect-Cost-5504 · 2026-08-27
- Pokee-Isaac 28B 演示 5 分钟内从创意到生成可玩游戏 — Kyrannio · 2026-08-27
- Goodfire 公布新研究:高效定位导致模型分叉的关键 Token — VoidAsuka · 2026-08-27
- 印度 AI Mission 选中 Sarvam:105B 参数本土大模型印地语表现出色 — abhish18 · 2026-08-27