TB2-Fn 发现 agent 可刷过 7 个终端任务并误差达 40%

abeirami · x · 2026-07-27

TB2-Fn 揭示 agent 也会“刷分”终端基准

作者发布了 TB2-Fn,这是 Terminal Bench 2 的一个变体,把 89 个任务重写了一遍,目的是更真实地验证同一组底层能力。

核心发现包括:

文章的结论是:如果验证环节本身有偏差,单一 benchmark 分数很容易误导人,因为不同方向的错误会互相抵消。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →