优化 Qwen3.8-27B 在单张 MI300X 上提速 59%

cheptsov · reddit · 2026-08-21

dstack 展示了使用其开源工具包在单张 AMD MI300X 上优化 Qwen3.8-27B 推理的案例。通过链接优化会话和对 SGLang 的 AITER 注意力后端进行源码级补丁,成功将推理速度从 311 tok/s 提升至 495 tok/s(+59%)。优化后的配置支持 100 万上下文,p50 TTFT 低于 1.5 秒,并能支持四并发用户(10k in / 1.5k out)。最终输出是一个可移植的预设,可部署在任何 AMD 云、Kubernetes 集群或裸金属集群上。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →