用 nanogpt 训练前 3% 做 benchmark 还藏 y 轴标签,被批学术不端

PMinervini · x · 2026-10-06

一场关于模型评测公信力的争论:有人指责,明知自己是对照 nanogpt 训练仅前 3% 进度的 checkpoint 做基准测试,还在图表中隐藏 y 轴标签,属于学术不诚实(academic dishonesty)。

被引用的原文指出问题实质:只在 fineweb 验证损失 5.0 nats 处训练就发布对比图——这个损失值高到根本不在 nanogpt-small 训练曲线的图内。在这个阶段,大部分信号还只是把低概率 token 的 logits 推向负无穷,真正的特征学习尚未开始。也就是说,此阶段的模型能力差异 largely 是噪声,不能作为模型质量的证据。

这反映了开源模型发布热潮中的评测乱象:用极早期训练快照制造有利对比、隐藏坐标信息误导读者。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →