396 万参数 TTS 现在可微调声音和语言

b111ue · reddit · 2026-07-27

Inflect v2 的作者表示,现在可以把这个超小型 TTS 模型按自己的声音或语言进行微调。

模型规模

作者认为 Micro 音质更好,并给出了 Hugging Face 链接。

新工具包能做什么

作者表示自己已经在 Nano 上跑通了完整软件路径,包括真实的 CUDA 训练步、保存与恢复、严格 PyTorch 加载,以及 ONNX Runtime 一致性验证。

目前未解决的问题

跨语言迁移还没有被证明足够稳定。作者说自己还没训练出能发布的非英语版本,而且每次运行目前只会生成一种固定声音、对应一种配置语言。他希望了解别人把小型 TTS 模型迁移到新语言时,最先失败的环节是什么。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →