多模型路由实测:同成本下 LLM 错误率直降 46%
SucceededMind · x · 2026-09-04
Martian 发布「AI Frontier」研究:在 16 个常用 benchmark(TerminalBench、LiveCodeBench 等)上,跨模型路由比单一最强模型减少 46% 错误,且成本不变。配套发布了交互式网站与学术论文。
关键发现:
- 标价 API 定价多为虚标:真实工作负载下 Kimi 实际比标价贵,GPT-5.4 反而更便宜
- 隐藏方差才是杀手:同一 prompt 跑 10 次测稳定性——Qwen3.7 Max 96.1%、Claude Opus 4.6 94.4%、GPT-5.5 93.5% 可靠
- 在 agent 工作流中,一次随机失败就会打断整条链路,不应把系统押在单一 API 上
所属事件:研究称多模型路由同成本下错误率降 46%,基准低估 AI(6 条相关)→
「编程与Agent」频道最新
- GPT-6 Astra 团队成员自曝短板:代码 slop 多、确认请求过频 — yanndubs · 2026-09-04
- 把职位 JD 变成 IDE 限时模拟面试:独立开发者复盘 AI Agent 实战 — BeetleJuiceK9 · 2026-09-04
- 1137 次 agent 写操作复盘:MCP 工具收敛的三条实战铁律 — QuanTradin · 2026-09-04
- diffusers-workflow:用 JSON 描述管线替代节点图,可直接让 agent 写配置 — dkackman11 · 2026-09-04
- Claude Code 自托管环境开启公测,云会话可跑在内网 — EricBuess · 2026-09-04
- 实测 6 款 AI 可见性工具:标价 $199 实际可能要 $974/月 — Informal-Dust4499 · 2026-09-04