Rust+ONNX 在 CPU 上跑 SigLIP 2
kuaythrone · reddit · 2026-07-18
作者在做一个机器人数据平台,数据里同时有图片、视频和文本元数据。
他们的做法是把 SigLIP 2 的多模态 embedding 拆成两条链路:
- GPU 负责批量、异步的图像/视频 embedding 和索引构建;
- 一个 Rust + ONNX Runtime 的轻量服务在 CPU 上处理实时文本查询。
因为文本和图像最终落在同一个 embedding 空间里,所以可以直接用文本去搜 GPU 构建好的图像索引。作者认为这种拆分很实用:把稀缺 GPU 留给高吞吐的多模态摄取,查询侧则用普通 CPU 机器扩容。他也想了解别人是否在类似的低延迟推理服务里使用 Rust。
「Infra」频道最新
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11
- 英伟达已成主流 Robotaxi 栈核心:训练仿真车载计算全覆盖 — pdamodaran · 2026-09-11
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11