Terminal Bench v4 榜单发布 GLM-5.3 领跑获认可

Reddit 用户整理 Terminal Bench v4 成绩,GLM-5.3 以 41.9% 的成绩一骑绝尘。社区认为该榜单比智能指数更能反映模型的真实编码与终端能力,排名与开源闭源模型的口碑基本一致。知名研究者 JJitsev 也点名 Terminal Bench 4.0,称其为少数能真实反映模型能力的评测之一,进一步提升了该榜单的公信力。

2026-09-10 ~ 2026-09-11 · 2 条相关