vLLM 同步支持 Kimi K3:2.8 万亿参数、100 万上下文
AAAzzam · x · 2026-07-27
vLLM 同步支持 Kimi K3 上线
vLLM 表示,只要权重公开,Kimi K3 就能在其栈上立即部署。
- Kimi K3 被描述为 2.8 万亿参数的 MoE 模型。
- 每个 token 激活 896 个专家中的 16 个。
- 模型支持 100 万 token 上下文,并具备原生视觉理解能力。
- vLLM 强调其 Kimi Delta Attention 设计,目标是让百万级上下文推理成本更可控。
- 这次集成还提到 Moonshot、inferact、Nvidia、AMD 和 vLLM 社区的协作。
所属事件:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(11 条相关)→
「Infra」频道最新
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23
- 从燃气到吉瓦:Diligence Stack 专家访谈拆解 AI 数据中心供电难题 — BenBajarin · 2026-09-23