笔记本 CPU 上 1 秒训练视觉质检,单帧判定仅 65 毫秒

Embarrassed_Bison527 · reddit · 2026-10-08

开发者分享了一个纯本地的视觉质检工具:网络摄像头对准零件,各展示 30 个良品与 30 个次品,按一下 Learn 即完成训练,之后在笔记本 CPU 上以约 65 毫秒/帧的速度实时分拣,全程无 GPU、无云端、数据不出本机。

核心做法是不训练大模型:直接用现成的 SigLIP2 图像编码器把每帧转成描述向量,只在其上训练一个很薄的分类器。由于大模型冻结,重新训练只需一秒,零件换了随时可重训;还能用纯文本提问(“这是什么颜色?”“有没有零件?”)直接获得零样本答案。

作者对比过调用视觉 API:成本、延迟、隐私(照片不出机器)都更适合这个场景。训练出的分类器明显优于纯相似度匹配,但在一个刻意做得极淡的缺陷上只有 81% 准确率。作者也坦承:所有数据来自同一次拍摄、测试帧已做隔离,所以这个精度只反映一致性,换光照或换相机后的表现没有数据。项目基于开源库 indecis。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →