研究称标准 AI 基准测试系统性低估能力,多模型路由错误率降 46%
CodeByPoonam · x · 2026-09-04
Martian 团队发布经同行评审的研究 AI Frontier,指出现有主流基准测试的系统性缺陷:只测单一模型、单次运行,既忽略了不同模型各有所长,也无法反映模型稳定解题的能力,导致 AI 真实能力被大幅低估。
核心做法与结论:
- 将请求路由到 44 个 LLM 中最合适的模型,构建各成本档位下的「能力前沿」(Capability Frontier)
- 在 TerminalBench、LiveCodeBench 等 16 个最常用基准上,相比单一最强 LLM 错误率减少 46%
- 在同等 SOTA 成本与质量下,分别实现错误率下降或成本节省
- 团队估计传统基准可能低估 AI 能力达 82%
研究附有交互式网站与论文原文,核心论点是「单模型单次」的评测范式无法刻画真实能力分布,多模型路由应成为新的评测与使用基线。
所属事件:研究称标准基准低估 AI 能力,多模型路由错误率降 46%(4 条相关)→
「模型」频道最新
- 模型谄媚实录:不管什么离谱规则,它都回「对,这就是正确规则」 — iskander · 2026-09-04
- GPT-6 Astra 发布混乱:博客姗姗来迟遭圈 内吐槽 — thesaraharminta · 2026-09-04
- GPT-6 Astra 曝游戏开发能力,网友:发布信息泄露了 — cedric_chee · 2026-09-04
- 用户称 ChatGPT GitHub 插件疑遭静默降级,200 美元订阅价值受冲击 — macaronianddeeez · 2026-09-04
- GPT-6 Astra 发布:评测饱和、更可信,但代码 slop 变多 — yanndubs · 2026-09-04
- OpenAI 官宣 GPT-6 Astra:新旗舰模型正式发布 — kibae · 2026-09-04