开源轻量级 SRT 配音工具 srt2speech:支持声音克隆与时长匹配
Charming-Author4877 · reddit · 2026-08-04
开发者因视频配音需求,推出了开源、轻量级的 SRT 字幕转语音工具 srt2speech。该工具专为解决语音生成与字幕时间轴不匹配的痛点而设计。
核心功能与亮点:
- 精准时长匹配:通过音高修正的变速、自动重新生成、调整词间停顿和静音位置,确保每句配音完美卡点字幕时间。
- 多语言与声音克隆:支持英、日、韩、中、法、德等语言,可通过模板 {{speakername}} 切换多角色音色,并附带声音克隆辅助脚本。
- 离线轻量运行:依赖极少(Python, NumPy, llama.cpp 及 GGUF 语音模型),支持纯 CPU 或老旧设备运行。在 RTX 4080 移动版上可达 12-13 倍速实时生成,CPU 也能达到 1.5-2.0 倍速。
该项目采用 Apache 2.0 协议开源,适合用于视频配音、翻译音轨制作或无障碍音频生成。
「编程与Agent」频道最新
- 放弃专用轮次检测器,用 LLM 语义能力直接处理语音打断 — juberti · 2026-08-04
- 代码审查是直觉技能,这款游戏化工具帮你刻意练习 — arekusandr_ · 2026-08-04
- LangChain推出LLM Gateway公测版,集中管理模型降级与成本 — LangChain · 2026-08-04
- Vibe Coding 痛点:如何追踪 AI 代理对代码的改动? — pacifio · 2026-08-04
- Karpathy实测Claude Opus:2小时写5500行代码生成3D电影 — iamrobotbear · 2026-08-04
- 让智能体自己跑测试:开发者实践 Agent 递归自动优化方案 — iamrobotbear · 2026-08-04