仅花 10 美元:用 VLM 让 370 小时档案视频变可搜索

vanstriendaniel · x · 2026-07-31

作者分享了使用视觉语言模型(VLM)处理大规模视频档案的实践。他将 1864 部公共领域的旧电影切成约 60 秒的片段,并使用开源的 2B 参数视频模型进行视觉理解与索引。

整个项目处理了 370 小时的视频,构建索引的 GPU 成本仅约 10 美元。最终实现了基于屏幕实际发生画面的精准搜索,例如输入“敲击电脑键盘”,即可直接定位到相关视频帧。

所属事件:开发者用AI让370小时老电影变可搜索(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →