本地字幕工具 mlsubgen:45 种语言、双识别器互校、全离线
Dodgy_Past · reddit · 2026-10-03
开发者发布开源工具 mlsubgen,在本地机器上为视频生成 45 种语言的字幕(Linux + NVIDIA 专属)。
- 与普通 Whisper 封装的区别:按语音段(而非按文件)检测语言,支持混合语言内容;对每段音频跑两个语音识别器,再用本地 LLM 交叉校对;优先复用现有人工字幕,包括对蓝光 remux 的 PGS 位图字幕轨做 OCR,只有无字幕可读时才听音频。
- 每项功能在 README 都附实测准确率数据而非口头宣称。
- 硬件需求:作者用 24 GB RTX A5000,提供 16/12/8 GB 显存配置档;系统内存 16–32 GB,模型占用 30–65 GB 存储。
- 速度取向精度优先:需要「听」时约实时速度/目标语言;文件已带字幕时很快。
- 起源:作者在泰国,为朋友给《蜡笔小新》做泰语字幕,后发展成通用工具。
「编程与Agent」频道最新
- VoidZero 双雄登 TypeScript.fm:谈 oxlint 类型感知 lint 与 Vite 未来 — cnakazawa · 2026-10-03
- AI 编程技术栈全景:两大实验室之外皆为渐进式组合创新 — alexmacgregor__ · 2026-10-03
- Reddit MCP Server 上线:免 API Key 让 AI 助手检索 Reddit 数据 — modelcontextprotocol · 2026-10-03
- Frenchie MCP 连接器:为 AI Agent 提供 OCR、转录与图像生成 — modelcontextprotocol · 2026-10-03
- Stripe 代理身份 API 早期用例:让可信 agent 替用户领免费试用 — jeff_weinstein · 2026-10-03
- repligate 展示 7290 万 token 记忆系统:模型可凭模糊描述检索原始经历 — repligate · 2026-10-03