TB 4.0 榜单:GLM-5.3、Qwen 3.8、Muse 1.3、DeepSeek v4.1 领跑

himanshustwts · x · 2026-09-22

作者称 GLM-5.3、Qwen 3.8、Muse 1.3 和 DeepSeek v4.1 领跑 Terminal Bench 4.0 榜单,并表示会把相关模型放到同一批 evals 里做对比测试,后续可关注实测结果。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →