Terminal-Bench 4.0 发榜:GLM-5.3 超越 GPT-5.6
eyishazyer · x · 2026-08-29
新的 Terminal-Bench 4.0 榜单结果令人惊讶,由于测试难度提升,模型得分普遍下降,不再像旧版那样集中在高分段。
- Claude Opus 5:以 51.8% 的准确率位居第一,仅略超一半任务,相比旧版近 90% 的成绩大幅下滑。
- GLM-5.3:位列第三,甚至超过了 OpenAI 的旗舰智能体模型 GPT-5.6 Sol,表现亮眼。
这一变化反映了基准测试在更具挑战性时,更能真实区分模型能力。
「模型」频道最新
- MiniMax H3 Max 在 Fal 平台被指审查极其严格 — MrUtterNonsense · 2026-08-29
- 用户预测 Qwen 4-27B 将是颠覆性模型 — Steus_au · 2026-08-29
- AlayaWorld 登顶世界模型榜单,为首个开源权重领先者 — Obvious_Set5239 · 2026-08-29
- 用户实测 Minimax H3:同角色身份泄漏与长文崩坏 — Kooky-Mode3047 · 2026-08-29
- Qwen3.8 27B 16GB 显存跑满 10 万上下文 50 tok/s — qaf23 · 2026-08-29
- GLM-5.3-Flash 无审查权重发布,拒绝率降至 11% — lipeng0820 · 2026-08-29