Martian 模型路由:跨 16 项基准比单一最强 LLM 少 46% 错误
minchoi · x · 2026-09-04
Martian 发布研究:与其把所有任务硬编码给单一"最强"模型,不如按任务动态路由到最合适的模型。结果在 TerminalBench、LiveCodeBench 等 16 个常用基准上,错误率比单一最佳 LLM 低 46%,获 ICLR 2026 oral。
关键发现:
- 每个 benchmark 都只测到各模型能力的一小部分,单模型选择浪费了大量能力
- 报价 token 单价不能预测真实成本:有的模型单价高但思考少,有的单价低却烧 token
- 提供交互式演示站点与学术论文
所属事件:Martian 发布 AI Frontier:多模型路由同成本错误率大降(6 条相关)→
「模型」频道最新
- OpenAI 称 GPT-6 Astra 登顶 FrontierMath Tier 4、ARC-AGI 3 等多项最难基准 — dair_ai · 2026-09-04
- 48 小时内连发五款:GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash 齐至 — dr_cintas · 2026-09-04
- Astra 仍只是 PR 发布,复杂工作负载正流向 Fable 5.1 — bindureddy · 2026-09-04
- theo 盛赞 GPT-6 Astra:不只是代码模型,是一代人的能力跃迁 — gabrielchua · 2026-09-04
- Chollet:ARC-AGI-3被攻破速度比预期快一倍 — fchollet · 2026-09-04
- 多款旗舰模型实测:仅凭照片重建 Geisel 图书馆 3D,差距悬殊 — Lianhuiq · 2026-09-04