vLLM 为 Kimi K3 加入生产级支持,覆盖缓存和 MXFP4 MoE
vLLM Blog · rss · 2026-07-22
vLLM 博客预告了对 Kimi K3 的生产级支持。
- 这次更新包括 KDA-aware prefix caching、融合 kernel、优化后的 MXFP4 MoE,以及多模态集成。
- 文中还提到对 NVIDIA 和 AMD 的早期路径支持。
- 这是一个典型的推理与部署基础设施更新,重点在于如何更高效地把模型跑起来。
「Infra」频道最新
- Kimi K3 登陆 Together,预留吞吐成本低 65% — togethercompute · 2026-07-27
- OpenAI 可能撞上算力上限,Codex 和 ChatGPT Work 四个月涨到 1000 万 — JoshuaJBouw · 2026-07-27
- NVIDIA 称 Vera CPU 正加速下一代 CPU 和 GPU 设计 — nordicinst · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- NVIDIA 说 Vera CPU 让部分 EDA 工作负载提速 1.5 倍 — NVIDIA Blog · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27