吐槽AI模型定制评测刷分

JJitsev · x · 2026-07-13

作者吐槽了当前 AI 模型评测中的乱象:通过发明别人不用的评分指标来让自家模型显得最强。例如在 SOOFI 评测中,使用所谓的“能力指数”来评测基座模型,结果让 Qwen 3 32B 显得比 Teuken 等实际意义不大的模型还要弱。

所属事件:Nemotron模型复现与定制评测引争议(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →