视频转写纠错思路:抽音抽帧+ASR+前沿模型结合画面修正

capetorch · x · 2026-09-29

capetorch 在讨论中提出一个视频字幕转写纠错的分步方案:逐句提取音频和画面截图,用 SOTA 模型转写,再用前沿模型结合截取的画面上下文修正转写结果。他好奇这种朴素做法能否达到 99% 准确率,并向对方询问具体实现方式。

所属事件:社区探讨视频字幕纠错方案:ffmpeg 抽音加 ASR 加大模型修正(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →