用 nanogpt 训练前 3% 做 benchmark 还藏 y 轴标签,被批学术不端
PMinervini · x · 2026-10-06
一场关于模型评测公信力的争论:有人指责,明知自己是对照 nanogpt 训练仅前 3% 进度的 checkpoint 做基准测试,还在图表中隐藏 y 轴标签,属于学术不诚实(academic dishonesty)。
被引用的原文指出问题实质:只在 fineweb 验证损失 5.0 nats 处训练就发布对比图——这个损失值高到根本不在 nanogpt-small 训练曲线的图内。在这个阶段,大部分信号还只是把低概率 token 的 logits 推向负无穷,真正的特征学习尚未开始。也就是说,此阶段的模型能力差异 largely 是噪声,不能作为模型质量的证据。
这反映了开源模型发布热潮中的评测乱象:用极早期训练快照制造有利对比、隐藏坐标信息误导读者。
「模型」频道最新
- 爆料:Grok 网页版将上线团队共享 Bots 功能 — nima_owji · 2026-10-06
- Liquid AI 新决策模型免专项训练,四项质检任务准确率最高 97% — JosephJacks_ · 2026-10-06
- QuantCode:领域预训练+SFT 让开源模型交易代码通过率翻倍 — Alexey Chernysh · 2026-10-06
- GLM-5.3 疑似具备上下文感知,会自称上下文余量不足 — khademinori · 2026-10-06
- Azure 目录短暂曝光 OpenAI 未发布模型 GPT-6.1-Sol,页面一小时内被撤下 — _AndrewZhao · 2026-10-06
- Opus 5.5 订阅划算但 API 昂贵,6.1 才能当主力干活的马 — haider1 · 2026-10-06