开源 TTS 模型 IndexTTS 2.5 发布:推理提速 2.28 倍并支持跨语种零样本情绪迁移
Xianbao_QIAN · x · 2026-08-12
IndexTTS 2.5 现已发布,带来了更广的语言覆盖、零样本情绪迁移以及 2.28 倍的推理速度提升。
根据其技术报告,本次更新的核心改进包括:
- 语义编解码压缩:将帧率从 50 Hz 降至 25 Hz,序列长度减半,大幅降低训练与推理成本。
- 架构升级:S2M 模块采用更高效的 Zipformer 架构替代 U-DiT,减少参数量并加快梅尔频谱生成。
- 多语言扩展:提出边界感知对齐、Token 级拼接和指令引导生成三种跨语言策略,支持中、英、日、西、阿五种语言,且无需目标语言的情感训练数据即可实现稳健的情绪迁移。
- 强化学习优化:在 T2S 模块的后训练中应用 GRPO 算法,提升了发音准确度与自然度。
「多模态」频道最新
- 用叙事逻辑指导 AI 绘图:Midjourney 提示词进阶技巧 — tisch_eins · 2026-08-12
- AI音乐分析产品亮相:自动提取歌曲高光片段 — threepointone · 2026-08-12
- 实测 MiniMax 视频生成:特写镜头 3 秒后角色必崩 — ItsMilaVoss · 2026-08-12
- LTX 2.5 实测:4080 显卡 8 分钟生成 15 秒 1080P 视频 — skyrimer3d · 2026-08-12
- MiniMax H3 本地跑全身镜头脸部融化,8G 显存遇精度瓶颈? — Loud-Guitar1920 · 2026-08-12
- 东西方审美差异如何影响视频模型评价?H3 与 LTX 2.5 对比 — xbobos · 2026-08-12