优化 Qwen3.8-27B 在单张 MI300X 上提速 59%
cheptsov · reddit · 2026-08-21
dstack 展示了使用其开源工具包在单张 AMD MI300X 上优化 Qwen3.8-27B 推理的案例。通过链接优化会话和对 SGLang 的 AITER 注意力后端进行源码级补丁,成功将推理速度从 311 tok/s 提升至 495 tok/s(+59%)。优化后的配置支持 100 万上下文,p50 TTFT 低于 1.5 秒,并能支持四并发用户(10k in / 1.5k out)。最终输出是一个可移植的预设,可部署在任何 AMD 云、Kubernetes 集群或裸金属集群上。
「Infra」频道最新
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24
- 超算中心硬件选型:SSD与HDD的密度权衡 — generativist · 2026-08-24
- 三星展示 HBM 散热新方案,芯片性能存差异 — BenBajarin · 2026-08-24
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24