SGLang 生态昼夜接力,Kimi K3 开源首日推理破 423 tok/s
songhan_mit · x · 2026-07-30
开源推理框架 SGLang 在 Kimi K3 发布首日即实现了高达 423 tok/s 的推理速度(基于 GSM8K 测试),并已原生支持强化学习。
这背后是开源社区与多家科技巨头的极限接力:NVIDIA 与 AMD 投入底层算子优化,KVCache 推动多硬件适配与架构分离;Modal、Baseten、DigitalOcean 等云厂商也深度参与联合开发、测试反馈与算力保障。
SGLang 团队通过深度融合 KDA 解码算子、DP 注意力机制、PD 分离以及感知 KDA 的前缀缓存等深度优化,让这个当前最大的开源模型实现了惊人的生产级推理效率。
所属事件:Moonshot发布2.8T开源模型Kimi K3(3 条相关)→
「Infra」频道最新
- TensorSharp 引擎新增多 GPU 张量并行,显著提升本地 GGUF 推理速度 — fuzhongkai · 2026-07-30
- 英伟达开源 PyCuTe:纯 Python 实现 GPU 核心布局代数 — asdf1234_0 · 2026-07-30
- UC Berkeley 提出 K-search:将 CUDA 内核优化自动迁移至苹果 MLX — berkeley_ai · 2026-07-30
- 搭载 Nvidia Thor 算力,Advantech 边缘设备跑通 GMSL 摄像头 — chrismatthieu · 2026-07-30
- OpenRouter 数据:Together 提供 Kimi K3 最低价与最高缓存命中率 — zhyncs42 · 2026-07-30
- 三星Q2营业利润飙升1800%创新高,AI芯片需求强劲 — Polymarket · 2026-07-30