396 万参数 TTS 现在可微调声音和语言
b111ue · reddit · 2026-07-27
Inflect v2 的作者表示,现在可以把这个超小型 TTS 模型按自己的声音或语言进行微调。
模型规模
- Inflect-Nano-v2:3,966,721 参数,FP32 约 15.97 MB
- Inflect-Micro-v2:9,356,513 参数,FP32 约 37.53 MB
作者认为 Micro 音质更好,并给出了 Hugging Face 链接。
新工具包能做什么
- 使用单说话人录音和转写进行训练
- 对 Nano 或 Micro 做 warm-start
- 继续训练 / 恢复训练
- 检查留出集输出
- 导出为 PyTorch 或 ONNX
作者表示自己已经在 Nano 上跑通了完整软件路径,包括真实的 CUDA 训练步、保存与恢复、严格 PyTorch 加载,以及 ONNX Runtime 一致性验证。
目前未解决的问题
跨语言迁移还没有被证明足够稳定。作者说自己还没训练出能发布的非英语版本,而且每次运行目前只会生成一种固定声音、对应一种配置语言。他希望了解别人把小型 TTS 模型迁移到新语言时,最先失败的环节是什么。
「多模态」频道最新
- 视频替换 demo 保留镜头运动和构图节奏 — umesh_ai · 2026-07-27
- 视频到视频工作流可替换三名角色并保留镜头运动 — umesh_ai · 2026-07-27
- 参考图文音频可一次喂入 12 个文件做生成 — AIwithGhotai · 2026-07-27
- 字节这套 Seedance 流程把图片视频编辑放在一处 — AIwithGhotai · 2026-07-27
- Krea 2图生图实测:五套配方参数公开与角色崩坏避坑指南 — Due_Emu_8229 · 2026-07-27
- Midjourney v8.2 测试流出,主打运动模糊风格人像 — beechinour · 2026-07-27