Terminal-bench评测:GLM 5.3与Fable 5表现各异

mariofilhoml · x · 2026-08-22

Mariofilhoml 引用了关于 Terminal-bench 3 的评测结果。在 Pass@K 指标下,GLM 5.3、Fable 5 和 GPT-5.6 Sol 表现出了不同的趋势,这一结果与它们在 DeepSWE 上的 Pass@K 表现截然相反。

所属事件:GLM 5.3 等模型 Terminal-Bench 3 评测结果出人意料(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →