glance-vlm 开源:MLX 8-bit 把本地摄像头 VLM 延迟降 27.6%
natesiggard · x · 2026-09-24
Yohei Nakajima 开源了 glance-vlm speedlab,一个以测量为先的本地 VLM 延迟研究项目,可将任意摄像头变成多个本地运行的实时 AI 检测器(情绪、计数、物体识别)。
关键结果(Apple M5, 32GB)
- 接受的 8-bit MLX direct scorer 方案把 fresh-frame p50 从 358.5ms 降到 259.6ms(1.381×),延迟降 27.6%,且 84/84 个决策与基线一致,概率漂移最大仅 0.039
- 原生多问题批处理带来 2.405× 加速;更小的 2B 模型虽快 2.994× 但未过质量护栏被否决
- 共 21 个预注册实验,含可复现基准、论文与失败记录,实测单问题循环在 MPS FP16 约 210ms、MLX 8-bit 约 160ms
核心方法论结论:应优化实际执行的计算,而非配置标签或 token 数等代理指标——多个看似吸引人的改动没能带来安全的端到端收益。
「Infra」频道最新
- Wasmer Swift SDK 发布:iPhone 本地跑 Python、Node.js 甚至 FFmpeg — jedisct1 · 2026-09-24
- Google 开源 AX:面向自主 AI 智能体的 Kubernetes 风格编排器 — rseroter · 2026-09-24
- 给 Proxmox 和 pfSense 写只读 MCP,告别截图粘贴运维 — Mustela__ · 2026-09-24
- 从单卡到服务百万用户:一线工程师复盘 LLM 推理系统设计 — metalvendetta · 2026-09-24
- 传 Modal Labs 洽谈新一轮融资,估值将达 150 亿美元 — nmasc_ · 2026-09-24
- Google 论文:量化 LLM 冷启动延迟 55–70% 耗在加载权重而非推理 — rohanpaul_ai · 2026-09-24