vLLM 同步支持 Kimi K3:2.8 万亿参数、100 万上下文
AAAzzam · x · 2026-07-27
vLLM 同步支持 Kimi K3 上线
vLLM 表示,只要权重公开,Kimi K3 就能在其栈上立即部署。
- Kimi K3 被描述为 2.8 万亿参数的 MoE 模型。
- 每个 token 激活 896 个专家中的 16 个。
- 模型支持 100 万 token 上下文,并具备原生视觉理解能力。
- vLLM 强调其 Kimi Delta Attention 设计,目标是让百万级上下文推理成本更可控。
- 这次集成还提到 Moonshot、inferact、Nvidia、AMD 和 vLLM 社区的协作。
所属事件:vLLM 为 2.8 万亿参数 Kimi K3 提供 day-0 支持(2 条相关)→
「Infra」频道最新
- Bittensor 子网扩容被视为企业 AI 基建新路径 — markjeffrey · 2026-07-28
- Project Orion 在三大洲异构算力上直播训练 16B 模型 — markjeffrey · 2026-07-28
- Modular 推理手册拆解 LLM 成本瓶颈与部署优化 — udmrzn · 2026-07-28
- Kimi K3 通过 Merge Gateway 接入美国推理与 ZDR 通道 — shensi · 2026-07-28
- 算力才是前沿 AI 真正难复制的护城河 — GavinSBaker · 2026-07-28
- 租 GPU 加开源模型,让 AI 月账单从 120 万降到 10 万 — kimmonismus · 2026-07-28