Martian 用 44 模型路由降错 54%:单模型跑分低估真实能力

testingcatalog · x · 2026-09-04

Martian 发布 AI Frontier 分析:标准基准只测单模型单次运行,系统性低估 AI 真实能力。它将请求路由到 44 个 LLM,构造「Capability Frontier」——每个价格点上可达到的最佳成绩。

所属事件:研究称多模型路由同成本下错误率降 46%,基准低估 AI(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →