Together 实测 GLM-5.3 级联路由:成本降 57%,DeepSWE 得分反升 12 点
togethercompute · x · 2026-08-29
Together AI 发布 GLM-5.3 与 GLM-5.3 Flash 在 DeepSWE 编码基准上的深度对比与路由策略实测:
- 级联策略最优:先跑 Flash,测试不通过再升级到完整版 GLM-5.3,可解决 80.9% 的 DeepSWE 任务,单任务成本 \$1.70;单独用 GLM-5.3 为 69.0%、\$3.99——高 12 个百分点且成本低 57%。
- 差距只在首试:pass@1 差 5.6 分(69.0% vs 63.4%),到 pass@4 只差 2.6 分(87.6% vs 85.0%)。蒸馏去掉的是可靠性而非能力,而重试恰好能买回可靠性。
- 价格差 17 倍:\$3.99 vs \$0.24 每次 rollout;每 \$100 预算 Flash 能解 264 个任务,完整版只有 17 个。
- 能力保留、一致性丢失:完整版解出的 99 个任务中 Flash 仍能解 93 个,还额外稳定了 15 个完整版不稳定的任务、攻克 3 个完整版完全卡住的任务。
- Flash 的短板:在不稳定任务上,长跑命中率为 46%(完整版 61%),低于抛硬币;且更容易破坏已通过的基线测试(6.9% vs 4.4%),上线前需加回归门禁。
「编程与Agent」频道最新
- Omarchy 智能体自创工具:生成任务管理工作台 — BLUECOW009 · 2026-08-29
- 「富约束胜过富实现」:一篇关于如何给 AI 加约束的长文思考 — aishashok14 · 2026-08-29
- 前端国际化工具fbtee 4.0发布,完全基于Rust重写 — cnakazawa · 2026-08-29
- Google 论文主张砍掉 agent 对话历史,显式状态让 token 省 16 倍 — rohanpaul_ai · 2026-08-29
- 求开源方案:如何从多格式银行对账单 PDF 提取表格 — OmPatel110 · 2026-08-29
- 老外用一条提示词驱动 Gemini Flash 做极限代码优化,20 分钟性能提升数千倍 — doodlestein · 2026-08-29