Martian:跨 44 个 LLM 路由可在 16 项基准上减少 46% 错误
Arindam_1729 · x · 2026-09-04
Martian 发布 AI Frontier 项目,主张标准基准「单模型单次运行」的测法系统性低估了 AI 的真实能力。
核心做法与发现:
- 将请求在 44 个 LLM 之间智能路由,构建每个成本档位下的「能力前沿(Capability Frontier)」
- 在 TerminalBench、LiveCodeBench 等 16 个最常用基准上,错误率比单模型最优成绩降低 46%;或在同等质量下节省成本
- 关键结论:没有任何单一模型在所有任务上全面占优,每个基准都漏掉了大部分模型能力
项目附交互式网站与学术论文,观点指向「模型组合/路由」比押注单个模型更有价值。
所属事件:Martian「AI Frontier」研究:44 模型路由同成本降错率近半(7 条相关)→
「模型」频道最新
- GPT-6 Astra 登顶代码迁移基准,68% 准确率领先第二名 10 分 — sandersted · 2026-09-04
- OpenAI 发布 GPT-6 Astra:电脑上能做的事它都能替你做 — astralmatrix · 2026-09-04
- 吴恩达调侃前沿模型太弱:来跟我聊聊,问题会让它们宕机 — andrewgwils · 2026-09-04
- Epoch AI 发布 FrontierMath Erdős 基准,Astra 以 2/68 居首 — keviv9 · 2026-09-04
- OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得 99.9%,但独立评测泼冷水 — Latent Space · 2026-09-04
- Liquid 发布 Nanos 系列:350M-2.6B 专用小模型主打端侧 Agent — JosephJacks_ · 2026-09-04