WordVoice TTS:逐词控制时长、响度、音高,0.5B小模型
multimodalart · x · 2026-07-24
WordVoice TTS 发布,支持对每个单词独立控制时长、响度、音高和语调。基于 CosyVoice3,可自动或手动控制,支持声音克隆和预设音色。模型仅0.5B参数,在同尺寸中表现优秀。
「多模态」频道最新
- Opus 5 据称一把生成细节拉满的 3D 房屋,但 token 消耗惊人 — nptacek · 2026-07-24
- 开源 TRELLIS.2 工具把图生 3D 压到 6GB 显存 — intisarstorage2 · 2026-07-24
- Midjourney 探索帖晒出四张风格化猫咪插图 — hewarsaber · 2026-07-24
- Sonilo 读取视频内容后,自动为 AI 片段配上同步音效 — SarahAnnabels · 2026-07-24
- Firefly 4 的 Restyle 重绘实操教程曝光 — LudovicCreator · 2026-07-24
- HeyGen 将 HyperFrames 接入 Video Agent,提示词直接生成整支视频 — HeyGen · 2026-07-24