多节点 vLLM 经过拓扑调优,单用户吞吐升至 47 tok/s
TheZachMueller · x · 2026-07-21
- 作者展示了自己那套“ cursed rig ”的最终形态:在 **10 小时 47 分钟、累计 640 万个 Sol tokens** 的推理测试后,系统完成了多轮拓扑调整。 - 方案从常规的 **6 GPU 多节点 vLLM** 起步,逐步演进到 **Asymmetric TP2/TP4**、**30/48 层切分**,再到 **async + NCCL**;单用户吞吐从约 **20 tok/s** 提升到 **47.1 tok/s**。 - 配图补充了关键结果:修复了 **pipeline parallel deadlock**,同时保持输出一致,四用户总吞吐达到 **169 tok/s**。
所属事件:极限拓扑调优让大模型推理吞吐达47 tok/s(2 条相关)→
「编程与Agent」频道最新
- 明日工作坊将讲解 AI 原生软件工程中的 loop 与 graph engineering — Al_Grigor · 2026-07-21
- 生产级 Agent 可能需要一层围绕审计与恢复的新 PaaS — percoAi · 2026-07-21
- wikiman 把多套开发文档做成离线搜索索引 — JafarNajafov · 2026-07-21
- 开源 LangGraph 编码 agent 只在测试通过后提交补丁 — wusuiling-if · 2026-07-21
- 一种给 Agent 用的知识图谱设计,绕开 Neo4j 且更便宜 — TheRedfather · 2026-07-21
- Factory CEO 说未来 90% 的编程 token 将异步运行 — Training Data (Sequoia) · 2026-07-21