Prime Intellect 用 NVFP4 压缩 MLA KV 缓存,可多缓存约 50% token

TheZachMueller · x · 2026-10-03

Prime Intellect 发布 Decode 项目的 NVFP4 KV 压缩方案:TP4 虽然跨 token 延迟最低,但每个 rank 都持有完整 KV 副本。改为将 MLA latent 以 NVFP4 存储(每行从 576 字节降到 352 字节),相比 FP8 每个解码器可多缓存约 50% 的 token。配套的原生 sparse-MLA kernel 可在片上解压,并将作为实验性操作贡献给 FlashInfer。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →