本地长视频多模态分析:开发者分享音频转录+帧采样+分块摘要的流水线

dash_bro · reddit · 2026-08-10

Reddit 用户 dashbro 分享了自己构建本地长视频(6-10小时)多模态分析流水线的经验。由于本地模型上下文限制,他采用音频转录(qwen3-asr)+ 动态帧采样(基于上下文长度计算帧率,并用 absdiff 去除变化小的帧)+ 分块摘要(每块包含相关帧和转录文本)的方法,最终得到全局摘要和分块摘要的组合。他还尝试用 gemma4 12B 对转录进行说话人分离和音效标注。他询问是否有更好的方案能在 128GB RAM 上运行,并提到 vllm-omni 等原生多模态方案因上下文限制尚不可用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →