爆料:新模型对 KV 缓存做 QAT,fp4 下表现更好但砍掉 MTP
stochasticchasm · x · 2026-09-11
博主观察指出,该新模型对 KV cache 也做了量化感知训练(QAT),这解释了它在 fp4 KV cache 下为何比其他模型表现更好。同时作者发现模型的多 token 预测(MTP)被移除,猜测性能提升最终未能证明其价值。
所属事件:Muon 成训练默认优化器,新模型砍 MTP、KV Cache 做 QAT(7 条相关)→
「Infra」频道最新
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- 作者自制 KiCad 封装库,让 AI 芯片 DIY 原型板更好布线 — debreuil · 2026-09-11
- 从业者爆料:LLM 推理服务商毛利极薄,月营收1万美元仅赚200美元 — metalvendetta · 2026-09-11
- kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测 — stochasticchasm · 2026-09-11
- Peter Diamandis:AI 竞赛正变成我们这代最大的基建工程 — PeterDiamandis · 2026-09-11