新基准 TB2-Fn 发布:修复原版 38% 误判任务
abeirami · x · 2026-07-28
Fidian AI 发布了重构版的终端智能体基准测试 Terminal-Bench 2 Fidian Edition (TB2-Fn)。
- 修复原版缺陷:团队审查原版 TB2 时发现,89 个任务中有约 38% 存在系统性验证问题。其中 7 个任务存在漏洞导致分数虚高,27 个任务因指令模糊或环境配置错误导致分数虚低。
- 提升测试难度:新版本重写了指令、环境和验证逻辑,不仅修复了误判,还提高了对前沿模型的挑战难度。
- 评估真实能力:通过改变任务的表面形式,如果 AI 智能体能同时通过 TB2 和 TB2-Fn,说明其真正掌握了底层技能;若两者表现差异大,则说明存在过拟合现象。
所属事件:新基准TB2-Fn揭示终端智能体评测存在严重误差(3 条相关)→
「编程与Agent」频道最新
- Agent 已能处理反馈,还能给自己做 onboarding 界面 — jasonkneen · 2026-07-28
- 一张关于让 LLM 停推理、自己调 Python 函数的梗 — ctjlewis · 2026-07-28
- Meta 研究员称 coding-agent 基准已接近饱和,需转向目标导向评测 — agihouse_org · 2026-07-28
- Gauntlet Loop 把目标拆给 builder 和盲审 critic — mattshumer_ · 2026-07-28
- Gauntlet Loop 正成他几乎所有项目的默认流程 — mattshumer_ · 2026-07-28
- MCP 开发者讨论:真实使用何时变成 stars 和付费 — ResponsibleOne6307 · 2026-07-28