TerminalBench 深度评测:GPT-5.6 领跑,多模型降级
abeirami · x · 2026-08-27
TerminalBench 2.1 前二十名模型在更严格的 TB-fn 基准中接受重测。结果显示,模型间差距拉大,GPT-5.6 Sol 和 Opus 5 保持领先,部分模型性能显著下降。TB-fn 增加了任务步骤并剔除捷径解,平均任务难度提升 38%。此外,成本与成功率帕累托前沿显示,GPT-5.6 Luna 和 DeepSeek V4 Flash 表现优于 ox-alpha。
所属事件:新基准 TB-fn 重测:多个终端模型排名大幅下滑(4 条相关)→
「模型」频道最新
- Zai 发布 GLM-5.3 Flash:首支持多模态,成本更低 — michellechen · 2026-08-27
- 曝 Anthropic 将发 Fable 5.1,领先对手 3-4 个月 — bindureddy · 2026-08-27
- Gemma 4 轻松过 Google 自家 reCAPTCHA v2,作者拟再测 Qwen — Hour-Wish8158 · 2026-08-27
- 智谱 GLM-5.3-Flash 上线 OpenRouter,支持百万上下文 — AccBalanced · 2026-08-27
- Artificial Analysis 榜单:GLM 5.3 Flash 追平 Sol 5.6 Max — PilgrimofHaqq2 · 2026-08-27
- AI 进入青春期:小模型在特定领域击败大模型 — DhruvBatra_ · 2026-08-27