这个模型竟无 input/output 优化参数,仅 LM 头去 weight decay

stochasticchasm · x · 2026-09-11

stochasticchasm 在讨论某个模型架构(配有超大 engram 表)时注意到:作者原以为该模型完全没有 Adam 优化器参数,更正后确认仍保留少量 Adam 优化参数,但没有任何 input/output 优化参数这一点仍然非常酷。同一讨论串中另一条补充:语言模型头上也没有做 weight decay。

所属事件:Muon 成训练默认优化器,新模型砍 MTP、KV Cache 做 QAT(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →