GLM 5.3 等模型 Terminal-Bench 3 评测结果出人意料

8 月 22 日公布的 Terminal-Bench 3 评测结果引发关注。在 Pass@K 指标的 pass@k 扫描测试中,GLM 5.3、Fable 5 和 GPT-5.6 Sol 三款模型表现出人意料,各模型成绩差异明显,且与它们在 DeepSWE 基准上的表现恰好相反。有发帖者引用并讨论了这一数据,认为该结果为模型在终端任务上的真实能力提供了新的参考。

2026-08-22 ~ 2026-08-22 · 2 条相关