DeepSWE 测评:GLM-5.3 胜率达 69%,成本仅为 Fable 5 的 1/4
zainhas · x · 2026-08-23
Together Compute 在 DeepSWE 基准上对比了 GLM-5.3 与 Claude Fable 5 的表现。结果显示,GLM-5.3 在单次解决率上与 Fable 5 持平,且随着多次尝试,表现优于 Fable 5。
核心数据对比:
- 胜率:GLM-5.3 (69.0%) vs. Fable 5 (69.7%)
- 成本:GLM-5.3 ($3.99/任务) vs. Fable 5 ($21/任务)
- Token 消耗:GLM-5.3 (80k) vs. Fable 5 (114k)
- 交互轮次:GLM-5.3 (124) vs. Fable 5 (85)
结论指出,在重试成本极低的情况下,使用 GLM-5.3 的经济效益极具吸引力。
所属事件:DeepSWE 实测:GLM-5.3 编码持平 Fable 5,成本仅约五分之一(4 条相关)→
「模型」频道最新
- 0813 成最强开源模型?ProgramBench 测评数据揭秘 — teortaxesTex · 2026-08-23
- ProgramBench 评测结果:Opus 5 依然领先,0813 为最强开源模型 — teortaxesTex · 2026-08-23
- Qwen3.8-27B 发布一周:社区全方位评测汇总 — Jonathan_Rivera · 2026-08-23
- 微调 Gemma 4 12B:工具调用能力提升 2.7 倍 — TheOneWhoWil · 2026-08-23
- Boson AI 推出 Higgs 实时语音模型,支持百种语言 — smolix · 2026-08-23
- 曝 Nvidia 借 60 亿美元 Poolside 交易打造挑战中美前沿的开源模型 — BenBajarin · 2026-08-23