396 万参数 TTS 现在可微调声音和语言
b111ue · reddit · 2026-07-27
Inflect v2 的作者表示,现在可以把这个超小型 TTS 模型按自己的声音或语言进行微调。
模型规模
- Inflect-Nano-v2:3,966,721 参数,FP32 约 15.97 MB
- Inflect-Micro-v2:9,356,513 参数,FP32 约 37.53 MB
作者认为 Micro 音质更好,并给出了 Hugging Face 链接。
新工具包能做什么
- 使用单说话人录音和转写进行训练
- 对 Nano 或 Micro 做 warm-start
- 继续训练 / 恢复训练
- 检查留出集输出
- 导出为 PyTorch 或 ONNX
作者表示自己已经在 Nano 上跑通了完整软件路径,包括真实的 CUDA 训练步、保存与恢复、严格 PyTorch 加载,以及 ONNX Runtime 一致性验证。
目前未解决的问题
跨语言迁移还没有被证明足够稳定。作者说自己还没训练出能发布的非英语版本,而且每次运行目前只会生成一种固定声音、对应一种配置语言。他希望了解别人把小型 TTS 模型迁移到新语言时,最先失败的环节是什么。
所属事件:Inflect-Nano-v2 仅 396 万参数支持微调(2 条相关)→
「多模态」频道最新
- 用户给 Opus 5.5 三小时预算,模型自主拍出九龙超现实恐怖短片 — rainbird · 2026-09-23
- AI 生图博主分享高速公路场景 prompt,自晒连续出图效果 — techhalla · 2026-09-23
- Opus 5.5 生成 2000 年代风格火柴人格斗动画 — JasonBotterill · 2026-09-23
- 《平常》:AI 生成九龙城寨题材恐怖短片引发关注 — rainbird · 2026-09-23
- 截图角色配一条提示词即可生成同款角色 — iamaliveix · 2026-09-23
- Google 开源 Noto 3D:2D 贴纸变立体,才发现狗狗只有三条腿 — GoogleDesign · 2026-09-23