同一模型同一榜单分数大不同,DeepSeek 模型卡揭示评测失真

solyarisoftware · x · 2026-09-12

DeepSeek V4.1 模型卡中一张表格引发关注:同一模型、同一 benchmark,在不同 agent harness 下得分差异巨大。

发帖人借此指出行业通病:新模型发布时拿自己的分数与以往公开数字直接对比,若 harness 和配置没有对齐,这种对比几乎毫无意义。这再次印证了 benchmark 分数高度依赖评测脚手架,跨模型榜单排名的参考价值被普遍高估。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →