研究称多模型路由同成本下错误率降 46%,基准低估 AI

Martian发布「AI Frontier」研究并上线配套交互式工具,核心结论是:主流基准测试只评估单一模型、单次运行,既忽略不同模型各有所长,也无法反映模型稳定解题的能力,因而系统性低估了AI的真实能力上限。研究将请求在44个LLM之间路由,为每个成本档位构造可达到的最佳成绩曲线「Capability Frontier」,结果显示同等成本下错误率最多可降低46%;@testingcatalog的转述进一步提到基于21项评测、跨44个模型路由后错误率降幅达54%。@SucceededMind补充评测覆盖TerminalBench、LiveCodeBench等16个常用benchmark,且成本不变。

已确认

为什么重要

2026-09-04 ~ 2026-09-04 · 6 条相关

一手来源