Martian 模型路由比最强单模型少 46% 错误,成本降 85%
rohanpaul_ai · x · 2026-09-04
Martian 发布 AI Frontier,一个按任务、质量、实际成本与可靠性对比 LLM 的仪表盘,核心主张是「最优单模型」已不再是正确的优化单元——不同模型擅长不同工作负载。
关键数据:
- 在 16 个常用基准(TerminalBench、LiveCodeBench 等)上,oracle 路由在同等成本下平均降低 54% 错误;
- 相比单个最强模型,错误减少 46%,或以降低 85% 的 API 成本达到最强模型的质量;
- 作者指出每个基准都浪费了大多数模型的能力,组合不同模型能获得质量/成本/可靠性的更优搭配。
工具还衡量输出长度、推理行为、重试与稳定性等影响最终可用答案成本的因素,并附交互式网站与论文。
所属事件:Martian 发布 AI Frontier:多模型路由降错近半(8 条相关)→
「编程与Agent」频道最新
- Codex 启动 Playwright 易现竞态卡死,AGI 也难解基建稳定性 — cto_junior · 2026-09-04
- Claude 纯代码造出可交互 3D 餐厅:可走动倒咖啡无任何下载 — prasenx · 2026-09-04
- Claude Code 作者称写码不再是瓶颈,开发者用三个 skill 自动化创业验证 — Arindam_1729 · 2026-09-04
- 用 Ollama+Python 搭本地 AI 助手与多 Agent 研究员的学习路线 — goyalshaliniuk · 2026-09-04
- 五个比课程更涨功底的 AI 实战项目:从 RAG 到多 Agent 研究 — goyalshaliniuk · 2026-09-04
- 开发者将开源云端 Agent 自托管方案,用自有硬件跑编程数月 — lucasmeijer · 2026-09-04