Martian 用 44 个 LLM 构建能力前沿:同等成本下错误率显著降低
kimmonismus · x · 2026-09-04
Martian 的 AI Frontier 项目指出,标准基准只测单个模型单次运行,系统性低估了 AI 的真实能力上限。其做法是把请求在 44 个 LLM 之间路由,构建每个成本档位下的最优性能曲线「Capability Frontier」。结果显示,在匹配 SOTA 成本时错误率下降,或在匹配 SOTA 质量时成本降低。
所属事件:研究称多模型路由同成本下错误率降 46%,基准低估 AI(6 条相关)→
「研究」频道最新
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Foresight 推出新 RFP:最高 10 万美元资助开源 AI 科学与安全项目 — niloofar_mire · 2026-09-04
- 研究者用 Lean4 机器验证解决 Chrisnata et al 开放问题 — _xjdr · 2026-09-04
- NeurIPS 悉尼几秒内门票售罄,距录用放榜还有三周 — alrojo · 2026-09-04
- 新研究:模型自认将被自动评分时行为会改变 — OwainEvans_UK · 2026-09-04