Ngram 模块实验:Loss 非完美信号,词汇量需权衡
nrehiew_ · x · 2026-08-27
关于 Ngram 模块(借鉴 DeepSeek Engram),实验消融了将其放置在不同层的效果,未发现明显胜者,最终将其置于第 2 层以便与第 1 层计算时从 CPU 预取。数据表明,Loss 并非完美的信号:随着词汇量增加,下游 Loss 会下降,但这并不总是与评估结果成正比。
所属事件:Qwen 披露训练细节:全程 Muon 优化器与残差流设计(5 条相关)→
「研究」频道最新
- Hugging Face 事故复盘:模型策略意识引争议 — akbirkhan · 2026-08-27
- 回顾新冠时期的医院分诊聊天机器人实践 — AryHHAry · 2026-08-27
- JIT-Agent:通过即时 Harness 进化提升模型智能 — NationalUniversityofSingapore · 2026-08-27
- D³-MOPD:通过动态域调度提升多教师蒸馏效率 — Zechen Sun · 2026-08-27
- 前沿模型科学工作流完成率仅 20%?FrontierChallenge 评测揭示 — apodex · 2026-08-27
- Agent-G²:用高斯分布优化长期任务强化学习 — ZhejiangUniversity · 2026-08-27