Terminal-Bench 3.0 榜单更迭:评测模型与 Agent 系统的综合能力

teortaxesTex · x · 2026-08-12

Terminal-Bench 3.0 评测榜单发生变动,该基准旨在让 AI Agent 在真实终端环境中完成复杂任务(如提交模型权重、形式化证明等)并直接检查结果。

目前榜单前三名均采用了「模型 + Agent」的组合:Claude Opus 5 Max 搭配 mini-SWE-agent 登顶,GPT-5.6 Sol Max 和 Claude Fable 5 紧随其后。由于不同 Agent 框架会显著影响工具调用和上下文处理,该榜单实际衡量的是整套系统的综合能力,而非单一模型本身的绝对实力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →