爆料:新模型对 KV 缓存做 QAT,fp4 下表现更好但砍掉 MTP

stochasticchasm · x · 2026-09-11

博主观察指出,该新模型对 KV cache 也做了量化感知训练(QAT),这解释了它在 fp4 KV cache 下为何比其他模型表现更好。同时作者发现模型的多 token 预测(MTP)被移除,猜测性能提升最终未能证明其价值。

所属事件:Muon 成训练默认优化器,新模型砍 MTP、KV Cache 做 QAT(7 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →