同预算下 GLM-5.3 任务完成量超 Fable 5 五倍
togethercompute · x · 2026-08-24
在 DeepSWE 评测中,给予 GLM-5.3 和 Fable 5 同样的 100 美元预算,GLM-5.3 完成了约 17 个任务,而 Fable 5 仅完成 3 个。尽管两者首次尝试的表现相近,但 GLM-5.3 在总产出上展现了超过 5 倍的效率优势。
所属事件:GLM-5.3 在 DeepSWE 实测中性价比碾压 Fable 5(2 条相关)→
「模型」频道最新
- 开源 Carnice-V3-27b:3090 本地跑赢 10 倍参数模型 — TheMoonMidas · 2026-08-24
- Grok 成功将 DOOM 移植至 ESP32,高帧率运行 — yunta_tsai · 2026-08-24
- 开源模型非仅降本,训练可突破帕累托边界 — ypatil125 · 2026-08-24
- 量化模型分数超原版?实测揭示评测陷阱与过拟合 — teortaxesTex · 2026-08-24
- Gemini 3.X 因知识截止将 8 月误判为 2024 年 — bclavie · 2026-08-24
- Claude 隐形水印发布数小时即被破解,绕过代码获两万收藏 — deliprao · 2026-08-24