Paddock 开源:自研 CUDA kernel 的推理引擎,13 项对比全胜 vLLM
saltexx · reddit · 2026-09-04
Truespar 团队按 8 月承诺,将内部推理引擎 Paddock 以 MIT/Apache-2.0 双协议开源(仓库即内部仓库,含全部 kernel)。
- 技术栈:Rust + C++,自研 CUDA kernel,单一二进制,提供 OpenAI/Anthropic 风格 API,支持加载 GGUF 和 safetensors;生产环境年处理约 3000 亿 token
- 实测(Qwen3.8-27B FP8,单卡 RTX PRO 6000,关闭 spec decoding):13 项全部快于 vLLM(1.02x–1.19x),10/13 项快于 SGLang,全部大幅快于 llama.cpp(1.5x–37x);32 并发 1024 入/1024 出达 1062 tok/s(vLLM 958、SGLang 844)
- 限制:仅 CUDA、仅 Windows/Linux;已在 Blackwell(5090/RTX PRO 4500–6000/B200)和 Ampere 验证,Ada kernel 未实测需强制环境变量才启动,无 Mac/ROCm/Vulkan,单卡单模型、不支持张量并行
「Infra」频道最新
- 微软命名 Project Zenith:开发者专用 Windows,配 AMD Ryzen AI Halo 芯片 — tomwarren · 2026-09-04
- 开发者重写内核:Reframe 渲染引擎比 Octane/Arnold 快约 48 倍 — D3VAUX · 2026-09-04
- RTX 6000 Pro 本地跑 Qwen3 8B Flash:预填 2000tps 但解码仅 40tps — AppealSame4367 · 2026-09-04
- Voz 深度优化 ANE,iPhone/Mac 本地语音转写提速 5-20 倍 — pcuenq · 2026-09-04
- Gemini 3.8 Flash 单价不变,推理多几步照样让单任务账单变贵 — JuggernautCritical92 · 2026-09-04
- DIT.ai 推出 AI Token 交易所,主流模型报价低至官方价四折 — SucceededMind · 2026-09-04