vLLM 为 Kimi K3 加入生产级支持,覆盖缓存和 MXFP4 MoE
vLLM Blog · rss · 2026-07-22
vLLM 博客预告了对 Kimi K3 的生产级支持。
- 这次更新包括 KDA-aware prefix caching、融合 kernel、优化后的 MXFP4 MoE,以及多模态集成。
- 文中还提到对 NVIDIA 和 AMD 的早期路径支持。
- 这是一个典型的推理与部署基础设施更新,重点在于如何更高效地把模型跑起来。
「Infra」频道最新
- Oracle Q1 云基建收入三位数增长,AI 算力需求持续爆发 — DavidLinthicum · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11