Terminal-Bench 4.0 发布:Opus 5 领跑,GLM 5.3 成最佳开源

Terminal-Bench 基准测试发布 4.0 版本,涵盖科学、软件、机器学习、运维、安全、硬件和媒体等领域的 66 项任务。本次更新校准了各任务所需的计算资源(时间、CPU、内存),修复了部分任务错误,并移除已饱和的任务,使基准迭代速度与模型发展保持同步。评测结果显示,Opus 5 表现优于 Fable 5,GLM 5.3 成为最佳开源模型。

2026-08-29 ~ 2026-08-29 · 4 条相关