Terminal-Bench 3.0 榜单更迭:评测模型与 Agent 系统的综合能力
teortaxesTex · x · 2026-08-12
Terminal-Bench 3.0 评测榜单发生变动,该基准旨在让 AI Agent 在真实终端环境中完成复杂任务(如提交模型权重、形式化证明等)并直接检查结果。
目前榜单前三名均采用了「模型 + Agent」的组合:Claude Opus 5 Max 搭配 mini-SWE-agent 登顶,GPT-5.6 Sol Max 和 Claude Fable 5 紧随其后。由于不同 Agent 框架会显著影响工具调用和上下文处理,该榜单实际衡量的是整套系统的综合能力,而非单一模型本身的绝对实力。
「模型」频道最新
- Falcon-Perception 0.6B 模型实现高效本地图像分割 — vanstriendaniel · 2026-08-12
- 微软 MAI Code 1.1 Flash 发布,性能与价格遭 DeepSeek 全面碾压 — The Decoder · 2026-08-12
- Nemotron 3.5 本地实测:24GB 内存可跑,编码能力拉胯但工具调用惊艳 — curiousily_ · 2026-08-12
- DeepSeek Harness WebUI疑似泄露,界面与DeepSeek-Web相似 — teortaxesTex · 2026-08-12
- Mistral 推出欧盟数据处理与优先访问,但均附带限制 — The Decoder · 2026-08-12
- 中科院提出GMC剪枝法:视觉Token压缩90%性能不降 — 量子位 · 2026-08-12