AMD MI350X 跑通 Qwen3.6-35B:开源 Kernel 实现 8 卡 7.8 万 tok/s
SmilingGen · reddit · 2026-08-26
NetraRuntime 团队针对 AMD MI350X 显卡优化了 Qwen3.6-35B-A3B 模型的底层 Kernel,以解决 ROCm 软件栈相比 CUDA 的性能劣势。实测结果显示,单卡输出速度达 11,161 tok/s,8 卡集群峰值达 81,331 tok/s,平均 78,498 tok/s,吞吐量是 vLLM 的 2.16 倍。团队已将 Kernel 开源,并撰写博客分享了优化过程与发现,指出 Kernel 优化后瓶颈已转移至调度、图覆盖及 HTTP 序列化等环节。
「Infra」频道最新
- 复现 GPT-2 仅需 48 美元,超强 AI 门槛或降至 500 元 — jennyzhangzt · 2026-08-26
- 开发者开源图表搜索层,158ms 内精准定位视觉证据 — RichardsonDx · 2026-08-26
- Akta 推出企业数据 API,为 Agent 提供结构化信息 — AppropriateAnt7344 · 2026-08-26
- 阿里RecGPT-Mobile-V2:端侧行为预测模型技术报告 — _reachsumit · 2026-08-26
- MetricFire 发布 MCP 服务器,让 AI 查询监控数据 — PKMNPinBoard · 2026-08-26
- LLM 推理一次只算一个 step:连续批处理如何榨满 GPU — arpit_bhayani · 2026-08-26