新模型技术细节引热议 Muon 优化器渐成默认
研究者 stochasticchasm 等拆解某新模型(配有超大 engram 表)的技术报告发现多个亮点:KV cache 同样经过量化感知训练(QAT),解释了其在 fp4 KV cache 精度下优于其他模型;多头预测(MTP)被移除,推测是收益不划算;engram 表大小特意选用互不相同的素数,并使用了 4-gram 和 fp8 查找表。此外,逐头切换 Muon 优化器正成为训练新模型的默认选择,该模型几乎弃用了 Adam 优化参数,仅 LM 头保留 weight decay。
2026-09-11 ~ 2026-09-11 · 7 条相关
- 技术账号拆解某模型 engram 细节:素数表长、4-gram、fp8 — stochasticchasm · 2026-09-11
- 新模型技术报告移除 MTP,fp8 查找表与质数表长引热议 — stochasticchasm · 2026-09-11
- 爆料:新模型对 KV 缓存做 QAT,fp4 下表现更好但砍掉 MTP — stochasticchasm · 2026-09-11
- KV Cache 也做 QAT?技术拆解解释某模型 fp4 精度下表现更好 — stochasticchasm · 2026-09-11
- 又一个模型转向 Muon:行业观察称其正成为训练默认优化器 — stochasticchasm · 2026-09-11
- Muon 优化器加速成为默认选择,新模型彻底弃用 Adam — stochasticchasm · 2026-09-11
- 这个模型竟无 input/output 优化参数,仅 LM 头去 weight decay — stochasticchasm · 2026-09-11