DeepSWE 数据显示,多模型级联兼顾覆盖率与成本

ZainHasan6 · x · 2026-07-21

## 多模型级联在覆盖率和成本上都优于单模型 这条帖子主张,AI 的未来不是简单的“开源 vs 闭源”,而是**级联式模型策略**:先用最便宜的模型,只有在失败时再逐级升级到更贵的模型。 - 示例流程是 **Kimi K3 -> GPT-5.6 Sol -> Fable 5**。 - 文中引用的 DeepSWE 方案显示:**Kimi 2x + 在验证器失败时升级到 Sol**,可在 **$7.30/任务** 的成本下解决 **85.6%** 的任务;而 **单用 Sol** 只有 **72.3%**,且成本更高,为 **$8.37/任务**。 - 若再加入 **Fable** 作为第三层兜底,覆盖率可到 **89.9%**,单任务成本 **$9.24**,已经接近“oracle ceiling”。 - 核心结论是:大多数任务会在便宜模型阶段就被解决,因此昂贵旗舰模型只会落在真正需要它的那部分任务上。

所属事件:多模型级联策略兼顾成本与覆盖率,优于单模型方案(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →