基准测试失控:新模型评测被叙事牵着走,该用能力向量取代排行榜

GlenBradley · x · 2026-09-04

评论者 Glen Bradley 指出,围绕新模型 Astra 的评测已经失控:一半人报告的数字显示它是普通的旗舰水平模型,另一半则显示它远超同行——人们挑选支持自己既定叙事的基准。

他倾向于相信乐观的一半,但也承认经验主义要求直面「基准已让人各取所需」的现实,并对单一的旗舰模型排行榜日益怀疑。他提议改用「能力向量」来描述模型:如 {推理、编码、研究广度、研究完整性、长程一致性、工具使用、事实性、多模态推理、延迟、成本……},让模型对比变成曲面而非排名——因为在短选择题推理上 5% 的提升与在大型证据调查任务上 60% 的提升,经济价值完全不可同日而语。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →