GLM 5.3 等模型 Terminal-Bench 3 评测结果出人意料
8 月 22 日公布的 Terminal-Bench 3 评测结果引发关注。在 Pass@K 指标的 pass@k 扫描测试中,GLM 5.3、Fable 5 和 GPT-5.6 Sol 三款模型表现出人意料,各模型成绩差异明显,且与它们在 DeepSWE 基准上的表现恰好相反。有发帖者引用并讨论了这一数据,认为该结果为模型在终端任务上的真实能力提供了新的参考。
2026-08-22 ~ 2026-08-22 · 2 条相关
- GLM 5.3 等 3 模型 Terminal-Bench 3 测试结果与 DeepSWE 表现相反 — zainhas · 2026-08-22
- Terminal-bench评测:GLM 5.3与Fable 5表现各异 — mariofilhoml · 2026-08-22