Moonshot 发布 2.8T MoE 的 Kimi K3,带 100 万上下文
ricklamers · x · 2026-07-27
Moonshot 官方发布了 Kimi K3,并把它定位为当前最强模型:
- 2.8T MoE 架构
- 原生视觉理解
- 100 万 token 上下文窗口
- 官方称新架构实现了“每单位算力 2.5 倍智能”的提升,而不只是单纯堆参数
除了模型本体,Moonshot 还开放了更多底层栈,包括高性能 attention kernel、MoE 通信库,以及面向大规模 agent 环境的基础设施。转发中的 SGLang 实测显示,K3 在 gsm8k 上达到 423 tok/s,并已准备好 RL 支持;其服务端优化包括 fused KDA decode kernels、DP attention、DSpark、PD disagg 和 KDA-aware prefix caching。
所属事件:月之暗面开源 Kimi K3:2.8T 参数多模态大模型(17 条相关)→
「Infra」频道最新
- AI agent 发现 Bun 的 `child_process.spawn` 兼容性旧 bug — steipete · 2026-07-27
- llama.cpp 在 PR 25994 中加入 Nanbeige4.2 支持 — pmttyji · 2026-07-27
- 开源 Kimi K3 speculator 让单流吞吐升至 370 tok/s — vllm_project · 2026-07-27
- vLLM 列出 Kimi K3 的解耦、KV offload 和 MoE 方案 — vllm_project · 2026-07-27
- Inferact 的 Kimi-K3-DSpark 复用 MLA 缓存加速 vLLM — vllm_project · 2026-07-27
- Kimi K3 用固定 KDA 状态替代增长式 KV 缓存 — vllm_project · 2026-07-27