Martian 模型路由:跨 16 项基准比单一最强 LLM 少 46% 错误

minchoi · x · 2026-09-04

Martian 发布研究:与其把所有任务硬编码给单一"最强"模型,不如按任务动态路由到最合适的模型。结果在 TerminalBench、LiveCodeBench 等 16 个常用基准上,错误率比单一最佳 LLM 低 46%,获 ICLR 2026 oral。

关键发现:

所属事件:Martian 发布 AI Frontier:多模型路由同成本错误率大降(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →