Every 评测负责人:别信 MMLU-Pro,该建你自己的 AI 基准
danshipper · x · 2026-09-22
Every 评测负责人 Mike Taylor 撰文指出,MMLU-Pro 等热门基准测的是「直立人颅容量」这类冷知识,方向性有用但回答不了关键问题:这个模型能不能帮到你的具体工作?
他以自己在 Every 做咨询的实践为例:用模型写文案、做仪表盘、拼 slide deck,积累了「Claude Opus 5 爱抬杠、Claude Fable 5 像天才、GPT-5.6 Sol 稳妥」的直觉,但向别人推荐时却难以自证。文章主张像招聘不看 SAT 一样看待公开榜单,转而搭建「个人基准」——用自己真实工作任务和评分标准来横向选型。
「研究」频道最新
- 9 月机器人八大进展:Digit 5 扬 22.7 公斤,Helix 2.5 进 30 个家庭 — TheTuringPost · 2026-09-22
- 新论文用实证数据检验「工作与幸福感」,追问 AI 时代的意义 — scychan_brains · 2026-09-22
- 多智能体研究复盘:定期清空上下文并留摘要文档大幅提效 — DimitrisPapail · 2026-09-22
- 多智能体为何胜串行:DimitrisPapail 猜测跨调用注入熵更有效 — DimitrisPapail · 2026-09-22
- 多智能体 vs 串行对比引争论:团队胜出需 10-100 倍算力 — generatorman_ai · 2026-09-22
- Nature 综述:LLM 充当人类代理的四类角色与各自效度标准 — iyadrahwan · 2026-09-22