TerminalBench 深度评测:GPT-5.6 领跑,多模型降级

abeirami · x · 2026-08-27

TerminalBench 2.1 前二十名模型在更严格的 TB-fn 基准中接受重测。结果显示,模型间差距拉大,GPT-5.6 Sol 和 Opus 5 保持领先,部分模型性能显著下降。TB-fn 增加了任务步骤并剔除捷径解,平均任务难度提升 38%。此外,成本与成功率帕累托前沿显示,GPT-5.6 Luna 和 DeepSeek V4 Flash 表现优于 ox-alpha。

所属事件:新基准 TB-fn 重测:多个终端模型排名大幅下滑(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →