视频转写纠错思路:抽音抽帧+ASR+前沿模型结合画面修正
capetorch · x · 2026-09-29
capetorch 在讨论中提出一个视频字幕转写纠错的分步方案:逐句提取音频和画面截图,用 SOTA 模型转写,再用前沿模型结合截取的画面上下文修正转写结果。他好奇这种朴素做法能否达到 99% 准确率,并向对方询问具体实现方式。
所属事件:社区探讨视频字幕纠错方案:ffmpeg 抽音加 ASR 加大模型修正(2 条相关)→
「编程与Agent」频道最新
- 自建 AI 工程框架徒劳无功:新模型一发布就被抹平 — sebpaquet · 2026-09-29
- 网传 Anthropic 工程师全员共享 Claude 会话,任务可被同事抢单 — YouJiacheng · 2026-09-29
- 开源自动驾驶仿真项目汇集 38 个演示,并用 Claude Code 加持 PR 审查 — 4310sy · 2026-09-29
- 开源项目 Celesto:给 AI Agent 一台 500 毫秒启动的专属电脑 — aniketmaurya · 2026-09-29
- 企业用 AI 指南:关键不是提示词工程而是基础管理功 — chribonn · 2026-09-29
- 八个 AI 智能体各拿 1000 GPU 时 live 比拼递归自我改进 — my_cat_can_code · 2026-09-29