Gnani AI 用 1400 万小时电话音频训练语音模型,21+ 语言 TTS 延迟低于 200ms
CurieuxExplorer · x · 2026-10-05
盘点系列介绍 Gnani AI 与 Dolphin AI:
- Gnani AI(Vachana):印度语言语音转文字与声音克隆,官网称其 Prisma v2.5 语音识别在 14M+ 小时真实电话音频上训练,Kathbath Noisy 8kHz 榜单 9 个印度语言中 8 个第一;Timbre v2.5 支持 21+ 语言 TTS,P95 延迟 <200ms,面向呼叫中心、银行与印度语应用。
- Dolphin AI(Eloelo):创始人 Saurabh Pandey 在 FICCI FRAMES 2026 发布,把剧本转成多镜头视频且保持角色、声音、服装一致性,面向创作者、广告团队与微短剧工作室,解决 8-10 秒以上长片段问题。
「多模态」频道最新
- 开发者开源 NihonSub:Whisper+DeepSeek 打造动漫实时双语字幕 — Grand_Marionberry115 · 2026-10-05
- MiniMax H3 角色一致性测试:RAT KING 视频实测 — malcolmrey · 2026-10-05
- ElevenLabs 办 10 万美元广告神曲大赛,头奖 5 万美元 — lukeharries · 2026-10-05
- Runway 与 CBS《60 分钟》合作,揭秘 Jon Wertheim 新片头制作幕后 — c_valenzuelab · 2026-10-05
- 用 Gemini 的 Omni 生成甜甜圈早餐广告,prompt 公开分享 — michaelrabone · 2026-10-05
- Seedance 2.5 搭 Runway 生成 30 秒 90 年代奇幻电影质感场景 — azed_ai · 2026-10-05