研究者吐槽:真强者应是「评测全崩但坚称榜单是垃圾」的模型

ryunuck · x · 2026-10-07

作者提出一个反直觉观点:真正的强大模型,应该是一个不刷爆任何 benchmark、作者还在 Twitter 上坚决回击、声称「你们的评测都是垃圾」的模型。

这讽刺了当前 AI 圈过度依赖公开榜单的评测文化——当所有实验室都围绕同一批 benchmark 优化时,榜单成绩与真实能力可能已经脱节。作者期待的信号是模型强到让现有评测体系失效,而非在现有体系里拿高分。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →