Terminal 评测新基准 TB-fn:揭穿模型刷榜假象
abeirami · x · 2026-08-26
针对 Terminal Bench 2.1 榜单上高频出现的新模型,研究者推出了更严格的评测基准 TB-fn。TB-fn 通过增加步骤、收紧要求和复杂化算法,消除了捷径解,并确保验证器仅检查预期标准。结果显示,在原榜单上表现接近的模型在 TB-fn 上差距拉大,仅有少数模型保持领先,而开源模型与前沿模型的差距在更高难度下显现。
「研究」频道最新
- 运行Boltz-2一亿次,尝试模拟细胞生物学 — dom_beaini · 2026-08-26
- RMSNorm 将激活投影到超球面,未解决可解释性难题 — _xjdr · 2026-08-26
- LangChain 开源 WikiBench:量化代码库 Wiki 对编码 agent 的增益 — LangChain · 2026-08-26
- 新研究 LpWM:稀疏表示让世界模型潜在动态更易建模 — randall_balestr · 2026-08-26
- Perplexity 揭秘 Dream Agents 自改进架构 — perplexity_ai · 2026-08-26
- AWS 论文揭示 Agent 模型切换的“移交税” — omarsar0 · 2026-08-26