Kimi K3 公开 2.8 万亿参数、百万上下文和 B200 吞吐数据
TheZachMueller · x · 2026-08-04
Kimi K3 在 Lambda 上跑通,披露 2.8 万亿参数与百万上下文
帖子介绍了 Moonshot AI 的 Kimi K3,把它描述为开放权重旗舰模型,属于 3 万亿参数级别。文中给出的关键信息包括:模型总参数约 2.8 万亿、每个 token 激活约 1040 亿、带 原生视觉编码器,上下文窗口达到 100 万 token。
同时,帖子概述了相较 Kimi K2 的结构变化:
- Kimi Delta Attention(KDA):带循环门控记忆的线性注意力层
- Gated Multi-head Latent Attention(MLA):降低百万上下文成本
- Stable LatentMoE:896 个路由专家,每个 token 激活 16 个外加 2 个共享专家
在 Lambda 的部署测试里,帖子给出了一组推理基准结果,硬件为 2× NVIDIA HGX B200、通过 Infiniband 连接、CUDA 13.0:
- 总吞吐 1,491.65 tok/s
- 生成吞吐 298.33 tok/s
- 单用户生成 9.32 tok/s
- TTFT 9,425.53 ms
- ITL 102.61 ms
测试使用 8192 输入 / 2048 输出 token、512 个 prompts、32 并发请求,目标是模拟长上下文编程与文档分析场景。
所属事件:月之暗面发布开源旗舰模型 Kimi K3(2 条相关)→
「Infra」频道最新
- ARC 选手称其 CUDA C 栈领先至少一个数量级 — jsuarez · 2026-08-04
- 600MB 写实 3D Gaussian splat 秒级进浏览器 — willeastcott · 2026-08-04
- AI agent 测试 5 个搜索 API:Parallel 最快,Keiro 最便宜 — Water_Law2005 · 2026-08-04
- Dwarkesh Patel 认为,更强 AI 可能把算力价格推高 10 倍 — Dwarkesh Patel · 2026-08-04
- llama.cpp 补丁把 DeepSeek-V4-Flash-0731 提速到 25.91 tok/s — dyn___ · 2026-08-04
- 推理提供商显著改写 Kimi-K3 评测结果,单个 endpoint 登顶 CEO-Bench — AAAzzam · 2026-08-04