GLM 5.3 等 3 模型 Terminal-Bench 3 测试结果与 DeepSWE 表现相反

zainhas · x · 2026-08-22

数据显示,GLM 5.3、Fable 5 和 GPT-5.6 Sol 在 Terminal-Bench 3 的 pass@k 扫描测试中结果出人意料。这些模型在该基准上的表现与其在 DeepSWE 上的 pass@k 结果呈相反趋势。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →