跨厂商 Vulkan 后端把端侧推理从 30ms 压到 3ms

ppchaos · reddit · 2026-07-29

这篇帖子分享了一个面向生产环境的 端侧/本地推理 方案:因为要在用户机器上跑人脸检测和 embedding 等模型,团队不能假设用户一定有某家 GPU,因此直接放弃 CUDA,改用 ncnn 的 Vulkan 后端。

文中给出了一组很直观的数据:在 RTX 4070、fp16 条件下,ArcFace R50 从 ONNX CPU 的 30 ms 降到 ncnn Vulkan 的 3 ms,SCRFD 从 25 ms 降到 2.5 ms;模型存储也从 ArcFace 的 174 MB(ONNX fp32) 降到 87 MB(ncnn fp16)。作者强调,真正关键的不只是速度,而是 Vulkan 驱动几乎在所有要交付的机器上都存在,因此不需要强迫用户安装特定运行时或厂商依赖。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →