1-bit模型跑进智能眼镜:2B视觉模型仅0.43GB,速度翻倍

lmoroney · x · 2026-09-26

Laurence Moroney 解读骁龙峰会多项发布,指出低于 4-bit 的小模型正与手机和眼镜的 NPU 相互适配这一趋势。

最亮眼的是 PrismML 的演示:一个 20 亿参数视觉-语言模型完全本地运行在基于 Snapdragon AR1 Gen 1 的智能眼镜上,由 1.7B 的 1-bit 语言模型 + 0.3B 的 4-bit 视觉编码器组成。高通在 4GB 内存、6 TOPS 算力、1024 token 上下文的平台上实测:1-bit 版语言模型权重仅 0.43 GB,而 4-bit 等效版需 1.66 GB,约缩小 3.8 倍,速度约为 4-bit 的 2 倍。

文章还科普了 NPU(神经处理单元,高通的叫 Hexagon)、量化、prefill(读 prompt 阶段,决定首字延迟)与 decode(逐 token 生成)等概念,并分析了 Liquid AI 等其他相关发布,以及开发者下一步值得关注的方向。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →