Ngram 模块实验:Loss 非完美信号,词汇量需权衡

nrehiew_ · x · 2026-08-27

关于 Ngram 模块(借鉴 DeepSeek Engram),实验消融了将其放置在不同层的效果,未发现明显胜者,最终将其置于第 2 层以便与第 1 层计算时从 CPU 预取。数据表明,Loss 并非完美的信号:随着词汇量增加,下游 Loss 会下降,但这并不总是与评估结果成正比。

所属事件:Qwen 披露训练细节:全程 Muon 优化器与残差流设计(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →