研究称标准 AI 基准测试系统性低估能力,多模型路由错误率降 46%

CodeByPoonam · x · 2026-09-04

Martian 团队发布经同行评审的研究 AI Frontier,指出现有主流基准测试的系统性缺陷:只测单一模型、单次运行,既忽略了不同模型各有所长,也无法反映模型稳定解题的能力,导致 AI 真实能力被大幅低估。

核心做法与结论:

研究附有交互式网站与论文原文,核心论点是「单模型单次」的评测范式无法刻画真实能力分布,多模型路由应成为新的评测与使用基线。

所属事件:研究称标准基准低估 AI 能力,多模型路由错误率降 46%(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →