Rust 新引擎 Paddock 曝光:Qwen3.6 推理速度碾压 vLLM 与 llama.cpp

saltexx · reddit · 2026-08-22

开源社区出现了一款用 Rust 从零编写的推理引擎 Paddock。在 Qwen3.6-27B、32 并发客户端的基准测试中,其 TTFT(首字延迟)仅为 697ms,而 vLLM 为 2.5s,llama.cpp 为 6.9s。在完整的 13 项测试中,Paddock 赢了 vLLM 11 项,并在所有测试中击败了 llama.cpp。

主要特性与架构设计:

注意事项:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →