SGLang首发支持Kimi K3,吞吐量飙升至423 tok/s

SGLang团队宣布对最新开源模型Kimi K3实现Day-0级别支持。通过针对K3新架构的深度融合优化,并结合推测解码技术,该2.8T参数、1M上下文模型在GSM8K基准上的batch-1 decode吞吐量从约113 tok/s飙升至423 tok/s,且强化学习(RL)支持已就绪。这证明了系统级软件优化能大幅突破超大模型的解码瓶颈。

已确认

为什么重要

K3作为超大参数的开源模型,其首发即实现极高的推理吞吐量,证明了通过系统级软件优化(如SGLang)和推测解码技术(如DSSpark)可以大幅突破庞大规模模型的解码瓶颈。同时,在AMD硬件上的顺利运行,为开发者提供了除英伟达之外的可行算力选择。

2026-07-28 ~ 2026-07-29 · 8 条相关

事件全程(共 20 集)→

一手来源

另有 2 条近重复转述:vwxyzjn · ying11231