基准测试失控:新模型评测被叙事牵着走,该用能力向量取代排行榜
GlenBradley · x · 2026-09-04
评论者 Glen Bradley 指出,围绕新模型 Astra 的评测已经失控:一半人报告的数字显示它是普通的旗舰水平模型,另一半则显示它远超同行——人们挑选支持自己既定叙事的基准。
他倾向于相信乐观的一半,但也承认经验主义要求直面「基准已让人各取所需」的现实,并对单一的旗舰模型排行榜日益怀疑。他提议改用「能力向量」来描述模型:如 {推理、编码、研究广度、研究完整性、长程一致性、工具使用、事实性、多模态推理、延迟、成本……},让模型对比变成曲面而非排名——因为在短选择题推理上 5% 的提升与在大型证据调查任务上 60% 的提升,经济价值完全不可同日而语。
「模型」频道最新
- Martian:跨 44 个 LLM 路由可在 16 项基准上减少 46% 错误 — Arindam_1729 · 2026-09-04
- 前 OpenAI 安全副总裁:对 AI 进展不感到担忧就是误判形势 — Miles_Brundage · 2026-09-04
- Gary Marcus 评 GPT-6 Astra:符号世界模型是进步但远非 AGI — GaryMarcus · 2026-09-04
- Guillaume Verdon 判定 OpenAI「有点回归」,但真正考验是体感而非跑分 — beffjezos · 2026-09-04
- 神秘模型 Astra 在 FrontierMath T4 上超 5.6 Sol Pro — ctjlewis · 2026-09-04
- Inkling 模型免费开放推理,作者称将继续服务免费层用户 — simonguozirui · 2026-09-04