社区探讨视频字幕纠错方案:ffmpeg 抽音加 ASR 加大模型修正

针对视频字幕转写纠错,开发者 capetorch 提出分步方案:逐句提取音频与画面截图,用 SOTA 模型转写后,再让前沿模型结合画面上下文修正结果。社区随后给出落地配方:用 ffmpeg 提取音频,用 Parakeet 完成 ASR 转写,再以 Opus 5.5 或 Astra 做修正环节。该流程需反复调试,并建议配合人工标注数据建立评测集来验证效果。

2026-09-29 ~ 2026-09-29 · 2 条相关