Fireworks 实测:按任务路由 18 个模型,解决率 97.6% 且成本仅 1/3
sophiamyang · x · 2026-09-22
Fireworks AI 在 DeepSWE v1.1 的 113 个真实编码任务上跑了 18 个模型,回溯分析发现:如果每个任务都路由给最适合的模型,整体解决率可达 97.6%、单任务成本 $1.88;而最佳单一模型(GPT-6 Astra)仅 74.1%、单任务 $6.52——高 23 个百分点、成本不到三分之一。
关键要点:
- 这个数字来自"神谕路由"(事后选最优),衡量的是现有模型池中被分散的能力,而非路由器的真实表现。
- 路由的难点在于事前预测:选错模型的代价远超节省的费用。
- 分析基于每任务 4 次 rollout 的实测通过率,策略为整个任务固定一个模型、不中途切换。
- Fireworks 据此推出 FireRouter,主张"下一个前沿不是模型,而是路由器"。
「编程与Agent」频道最新
- Teknium 合并修复:Hermes Agent 桌面端无法识别模型插件问题解决 — Teknium · 2026-09-22
- Grok 4.7 编码评测大涨:CursorBench 40.4%→46.3%,价格不变 — FinanceYF5 · 2026-09-22
- OpenCode 2.0 揭秘:可在运行会话中实时修改自身一切代码 — aidenybai · 2026-09-22
- 测试通过≠可以上线:Reddit 热议 AI 编码 Agent 该不该自己合并 PR — Fantastic-Sleep-3352 · 2026-09-22
- Scale AI 创始人转发:有人让 Muse 智能体接管自己的银行账户 — alexandr_wang · 2026-09-22
- 开源 Rust 边车用原子文件锁防 MCP 工具调用重放攻击 — AdmissibilityScience · 2026-09-22