新模型技术细节引热议 Muon 优化器渐成默认

研究者 stochasticchasm 等拆解某新模型(配有超大 engram 表)的技术报告发现多个亮点:KV cache 同样经过量化感知训练(QAT),解释了其在 fp4 KV cache 精度下优于其他模型;多头预测(MTP)被移除,推测是收益不划算;engram 表大小特意选用互不相同的素数,并使用了 4-gram 和 fp8 查找表。此外,逐头切换 Muon 优化器正成为训练新模型的默认选择,该模型几乎弃用了 Adam 优化参数,仅 LM 头保留 weight decay。

2026-09-11 ~ 2026-09-11 · 7 条相关