多节点 vLLM 经过拓扑调优,单用户吞吐升至 47 tok/s

TheZachMueller · x · 2026-07-21

- 作者展示了自己那套“ cursed rig ”的最终形态:在 **10 小时 47 分钟、累计 640 万个 Sol tokens** 的推理测试后,系统完成了多轮拓扑调整。 - 方案从常规的 **6 GPU 多节点 vLLM** 起步,逐步演进到 **Asymmetric TP2/TP4**、**30/48 层切分**,再到 **async + NCCL**;单用户吞吐从约 **20 tok/s** 提升到 **47.1 tok/s**。 - 配图补充了关键结果:修复了 **pipeline parallel deadlock**,同时保持输出一致,四用户总吞吐达到 **169 tok/s**。

所属事件:极限拓扑调优让大模型推理吞吐达47 tok/s(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →