Rust 新引擎 Paddock 曝光:Qwen3.6 推理速度碾压 vLLM 与 llama.cpp
saltexx · reddit · 2026-08-22
开源社区出现了一款用 Rust 从零编写的推理引擎 Paddock。在 Qwen3.6-27B、32 并发客户端的基准测试中,其 TTFT(首字延迟)仅为 697ms,而 vLLM 为 2.5s,llama.cpp 为 6.9s。在完整的 13 项测试中,Paddock 赢了 vLLM 11 项,并在所有测试中击败了 llama.cpp。
主要特性与架构设计:
- 纯 Rust 编写 + 自研 CUDA 内核:设计理念为“一卡一模型”,无张量并行,最大化利用显存带宽,故障无爆炸半径。
- 开箱即用:仅需下载解压并运行 paddock,内置 Studio 可自动拉取模型并启动服务。兼容 OpenAI 和 Anthropic API,支持 embedding、reranking 和 STT。
- 投机解码性能:在开启推测解码(MTP + DFlash)后,RTX PRO 6000 上单流吞吐量从 46.8 tok/s 提升至 202 tok/s,32 并发下从 1005 提升至 1285 tok/s。
注意事项:
- 硬件优化:最快路径针对 Blackwell 架构(如 5090/RTX PRO 6000),Ampere 为最低支持版本,老卡收益较低。
- 授权模式:免费但非开源,个人和企业可无限量永久使用特定版本。
「Infra」频道最新
- 算力荒新解:美国 11 亿平尺空置办公室改数据中心? — edgarpavlovsky · 2026-08-22
- AgenticROS 支持团队共享机器人,新增组织管理功能 — chrismatthieu · 2026-08-22
- 如何为 AI 数据中心争取支持?强调降税、基建与就业 — alexvoica · 2026-08-22
- Ramp 发布 Router 网关:宣称可平均降低 40% 推理成本 — round · 2026-08-22
- MCP 并非取代 API,而是改变了 API 的设计受众 — kush_patil · 2026-08-22
- 民调:美国民众反对建数据中心比例一年内升至 75% — The Decoder · 2026-08-22