Martian 用 44 模型路由降错 54%:单模型跑分低估真实能力
testingcatalog · x · 2026-09-04
Martian 发布 AI Frontier 分析:标准基准只测单模型单次运行,系统性低估 AI 真实能力。它将请求路由到 44 个 LLM,构造「Capability Frontier」——每个价格点上可达到的最佳成绩。
- 基于 21 个模型、16 个基准,覆盖编码、推理、医学、事实性、指令遵循与 agentic 任务
- 在同等成本下,相比最强单模型可降低 54% 错误率
- 计入多次重跑后可达 82%,或在匹配 SOTA 精度时省 85% 成本
所属事件:研究称多模型路由同成本下错误率降 46%,基准低估 AI(6 条相关)→
「模型」频道最新
- Meta Muse Spark 登顶单日用量榜,首超 DeepSeek — alexandr_wang · 2026-09-04
- OpenAI 发布最强模型 GPT-6 Astra,数日内推向全部付费用户 — soumitrashukla9 · 2026-09-04
- GPT-6 Astra 演示:Blender 建房模一键转为 UE5 可行走场景 — ChrisGPT · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Every 实测 GPT-6 Astra:写作最强,但仍不敌 Anthropic Fable 的产品直觉 — danshipper · 2026-09-04
- Greg Brockman 称新模型 Astra 或已达到 AGI,且公司已无相关合同约束 — shiringhaffary · 2026-09-04