Kimi K3 案例研究展示内核优化、编译器和芯片原型
teortaxesTex · x · 2026-07-28
这页在展示 Kimi K3 的三项案例研究:
- GPU kernel 优化:在 NVIDIA Hopper 和另一家厂商的 GPGPU 上,Kimi K3 将 AttnRes 延迟从 283.6 ms 降到 114.4 ms,把 DSA 与 KDA 运行时间分别减少 55.1% 和 73.6%,并在 MLA 上达到峰值 TFLOPS 的一半以上。
- GPU 编译器开发:Moonshot 说 Kimi K3 做了一个名为 MiniTriton 的 Triton-like 编译器,包含自定义 tile 级 Python 前端、基于 MLIR 的优化层、PTX 代码生成与类 PyTorch 接口;在 NVIDIA L20 上,其基准表现优于 PyTorch eager 和 torch.compile。
- 芯片设计:在一次 48 小时的自主运行中,Kimi Code 配合 Kimi K3 用开源 EDA 工具和 Nangate45 标准单元库构建并验证了一个推理芯片原型。设计目标包括 4 mm² 面积、接近 100 MHz 的频率,以及超过 8,700 tokens/s 的 RTL 仿真解码吞吐。
页面还给出了 minitriton 和 nano-kpu 的 GitHub 链接,说明这是把编译器与芯片原型串起来的一整套技术展示。
「Infra」频道最新
- SK hynix 日内巨震,HBM 盈利能力继续上行 — basedjensen · 2026-07-29
- WeCommerce 用 Weaviate 做氛围搜索,商品不靠关键词也能找 — victorialslocum · 2026-07-29
- UltraEP 把 MoE 实时均衡带进小红书机架级推理栈 — 机器之心 · 2026-07-29
- Cloudera 称 45% 医疗机构仍拿不到 AI 所需全部数据 — DavidLinthicum · 2026-07-29
- 用 grammar 约束,本地模型终于不再把 JSON 写坏 — paulqq · 2026-07-29
- 100MW AI 数据中心在英国比美国少值近 20% — ShakeelHashim · 2026-07-29