LLM 能力的锯齿状边界,只是「有人做出自动评分器」的地图

jessi_cata · x · 2026-09-14

jessicata 引用 Jon Stokes 的文章《人人都该极度怀疑 AI benchmark》,并点出核心论断:LLM 能力的锯齿状边界并非智能的固有属性,而只是一张「哪些任务有人搞出了自动评分器」的地图——即评测成绩反映的是我们能把什么自动化打分,而非模型的真实智能。

文章主张对 AI 基准测试保持极度怀疑,认为历史在计算领域并非押韵而是质变,当下围绕 benchmark 的叙事与真实能力之间存在系统性偏差。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →