TensorSharp 引擎新增多 GPU 张量并行,显著提升本地 GGUF 推理速度
fuzhongkai · reddit · 2026-07-30
开源原生 .NET 推理引擎 TensorSharp 宣布支持 Megatron 风格的多 GPU 张量并行(Tensor Parallelism),适用于本地运行 GGUF 大模型。
- 核心特性:支持 CUDA、Vulkan、Metal 后端,具备连续批处理、推测解码和多模态能力,现已兼容直连 CUDA、GGML CUDA/Vulkan 及多节点部署。
- 性能实测:在无 NVLink 的 2× RTX 2000 Ada 16GB 环境下,Gemma 4 26B-A4B 的 prefill 速度从 1845 提升至 2537 tok/s;此前无法在单卡运行的 Qwen 3.5 35B-A3B 也能以 18.1 tok/s 顺畅解码。
- 后续规划:作者正持续优化多 GPU 系统上的 Qwen 性能,并即将支持 DeepSeek V4。
「Infra」频道最新
- 三星财报透露:CSP 与 HPC 客户正推进 2nm 制程项目 — zephyr_z9 · 2026-07-30
- 三星财报会:Agentic AI 引发内存短缺,算力需求外溢 — zephyr_z9 · 2026-07-30
- 英伟达开源 PyCuTe:纯 Python 实现 GPU 核心布局代数 — asdf1234_0 · 2026-07-30
- UC Berkeley 提出 K-search:将 CUDA 内核优化自动迁移至苹果 MLX — berkeley_ai · 2026-07-30
- 搭载 Nvidia Thor 算力,Advantech 边缘设备跑通 GMSL 摄像头 — chrismatthieu · 2026-07-30
- OpenRouter 数据:Together 提供 Kimi K3 最低价与最高缓存命中率 — zhyncs42 · 2026-07-30