Terminal 评测新基准 TB-fn:揭穿模型刷榜假象

abeirami · x · 2026-08-26

针对 Terminal Bench 2.1 榜单上高频出现的新模型,研究者推出了更严格的评测基准 TB-fn。TB-fn 通过增加步骤、收紧要求和复杂化算法,消除了捷径解,并确保验证器仅检查预期标准。结果显示,在原榜单上表现接近的模型在 TB-fn 上差距拉大,仅有少数模型保持领先,而开源模型与前沿模型的差距在更高难度下显现。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →