Prime Intellect 用 NVFP4 压缩 MLA KV 缓存,可多缓存约 50% token
TheZachMueller · x · 2026-10-03
Prime Intellect 发布 Decode 项目的 NVFP4 KV 压缩方案:TP4 虽然跨 token 延迟最低,但每个 rank 都持有完整 KV 副本。改为将 MLA latent 以 NVFP4 存储(每行从 576 字节降到 352 字节),相比 FP8 每个解码器可多缓存约 50% 的 token。配套的原生 sparse-MLA kernel 可在片上解压,并将作为实验性操作贡献给 FlashInfer。
「Infra」频道最新
- INT21 两工程师指挥 AI 两周造 20 个推理引擎,比 SGLang 快 2.4 倍 — bingxu_ · 2026-10-03
- Traversal 提出「自动驾驶生产」五级框架,直指编码 Agent 调试难题 — AI Engineer · 2026-10-03
- DatologyAI 生成 12 万亿合成 token,四个瓶颈的工程解法全公开 — AI Engineer · 2026-10-03
- 神秘买家豪掷数十亿求购 500MW 起步的带电算力用地 — JohnnyNi13 · 2026-10-03
- 双 RTX 3090 本地跑 256k 上下文模型,实战数月后求升级建议 — knighty1981 · 2026-10-03
- Runware 推出 Serverless GPU:空闲 $0,低至 $0.63/GPU 小时 — aziz4ai · 2026-10-03