跨厂商 Vulkan 后端把端侧推理从 30ms 压到 3ms
ppchaos · reddit · 2026-07-29
这篇帖子分享了一个面向生产环境的 端侧/本地推理 方案:因为要在用户机器上跑人脸检测和 embedding 等模型,团队不能假设用户一定有某家 GPU,因此直接放弃 CUDA,改用 ncnn 的 Vulkan 后端。
文中给出了一组很直观的数据:在 RTX 4070、fp16 条件下,ArcFace R50 从 ONNX CPU 的 30 ms 降到 ncnn Vulkan 的 3 ms,SCRFD 从 25 ms 降到 2.5 ms;模型存储也从 ArcFace 的 174 MB(ONNX fp32) 降到 87 MB(ncnn fp16)。作者强调,真正关键的不只是速度,而是 Vulkan 驱动几乎在所有要交付的机器上都存在,因此不需要强迫用户安装特定运行时或厂商依赖。
「Infra」频道最新
- RTX 5090 已卖到 4 万克朗加税,GPU 价格再冲高 — wandedob · 2026-07-29
- Helion 接入 Hugging Face Kernels,H100 上快过 PyTorch SDPA — RisingSayak · 2026-07-29
- Extropic 与美国商务部签署 7500 万美元 LOI — beffjezos · 2026-07-29
- 双 L40S 跑 Qwen3.6-35B,TP 竟比 PP 更快 — amiitk · 2026-07-29
- SK hynix 据称与约 10 家大客户签长期合同 — dejavucoder · 2026-07-29
- 上海 Aishengna 被指接手 DUV 光刻设备制造 — zephyr_z9 · 2026-07-29