Every 评测负责人:别信 MMLU-Pro,该建你自己的 AI 基准

danshipper · x · 2026-09-22

Every 评测负责人 Mike Taylor 撰文指出,MMLU-Pro 等热门基准测的是「直立人颅容量」这类冷知识,方向性有用但回答不了关键问题:这个模型能不能帮到你的具体工作?

他以自己在 Every 做咨询的实践为例:用模型写文案、做仪表盘、拼 slide deck,积累了「Claude Opus 5 爱抬杠、Claude Fable 5 像天才、GPT-5.6 Sol 稳妥」的直觉,但向别人推荐时却难以自证。文章主张像招聘不看 SAT 一样看待公开榜单,转而搭建「个人基准」——用自己真实工作任务和评分标准来横向选型。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →