ShardFlow:跨广域网分布式推理 TPS 破 28
katua_bkl · reddit · 2026-08-23
作者展示了分布式 LLM 推理框架 ShardFlow,在跨云广域网环境下实现了高性能推理。
- 架构设计:将 HF 模型拆分至 N 个 GPU 节点,利用神经推测解码抵消 WAN 延迟。
- 性能数据:在两个 GCP 区域(RTT 86ms)下,Qwen2.5-7B 达到 28.1 TPS 峰值(20.31 平均),相比基线提升约 5 倍。
- 核心优化:使用 CUDA Graphs 将每次约 1500 次 kernel 启动优化为单次驱动调用,将草稿延迟从 112ms 降至 25ms,解决了 GPU 空转问题。
- 技术栈:包含零拷贝 Rust TCP 中继、StaticCache、KV rewind 等技术。
开源项目,欢迎探讨技术细节。
「Infra」频道最新
- 新加坡启用活体人脑细胞服务器,能耗仅为传统 AI 服务器 1% — evilsocket · 2026-08-23
- 构建 AI 生产系统的最佳实践:从推理到部署全流程 — _ScottCondron · 2026-08-23
- Codex 限流致旧方案不可用,Token 真实成本即将显现 — StewartalsopIII · 2026-08-23
- Cursor 推出基于 S3 的大规模 Git 存储系统 — bibryam · 2026-08-23
- RTX 5090 跑通 Qwen 27B NVFP4:120 t/s 含视觉与 451K 缓存 — t4a8945 · 2026-08-23
- 发布 PromoteOps 工具:多云环境 CloudFormation 推送自动化 — iamthanoss · 2026-08-23