开源 Laya 加 OpenVINO 支持:CPU 上每问仅 40ms,快 3.4 倍
simpleuserhere · reddit · 2026-09-25
开发者 rupeshs 为小型语言模型运行时 Laya 添加了 OpenVINO 后端支持,在纯 CPU 上每个问题推理仅约 40ms,比 PyTorch 快 3.4 倍。
代码已开源(laya-openvino 仓库),并附赠一个用 CPU 跑 LLM 玩 Flappy Bird 的演示项目,展示端侧低延迟推理的可行性。
「Infra」频道最新
- 内存涨价解方?博主称智能手机消耗全球 30% DRAM 与 NAND 供应 — AlpinDale · 2026-09-25
- TileRT×AMD 在 8×MI355X 上跑 GLM-5.3 达 469 tok/s,比 GB300 FP4 快 40% — vllm_project · 2026-09-25
- 转述:AI 在 TPU 设计某些方面已强过任何人,但只被当工具看 — burny_tech · 2026-09-25
- 低成本 4 卡推理再添招:x8 转接卡拆 4 个 x4,m.2 也能转 PCIe — TheZachMueller · 2026-09-25
- 网友用双 RTX 5090 以 vLLM 本地部署 27B 模型 — piddlefaffle12 · 2026-09-25
- CLion 2026.2.3 支持 NVIDIA CUDA Tile C++ 语法 — blelbach · 2026-09-25