AMD MI350X 跑通 Qwen3.6-35B:开源 Kernel 实现 8 卡 7.8 万 tok/s

SmilingGen · reddit · 2026-08-26

NetraRuntime 团队针对 AMD MI350X 显卡优化了 Qwen3.6-35B-A3B 模型的底层 Kernel,以解决 ROCm 软件栈相比 CUDA 的性能劣势。实测结果显示,单卡输出速度达 11,161 tok/s,8 卡集群峰值达 81,331 tok/s,平均 78,498 tok/s,吞吐量是 vLLM 的 2.16 倍。团队已将 Kernel 开源,并撰写博客分享了优化过程与发现,指出 Kernel 优化后瓶颈已转移至调度、图覆盖及 HTTP 序列化等环节。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →