Sarvam AI 发布多说话人语音识别模型 Saaras V4
itsOmSarraf_ · x · 2026-07-30
Sarvam AI 推出了其最新的语音识别模型 Saaras V4 Multi-speaker。该模型主打对复杂场景下多说话人交互及重叠对话的精准捕捉。
此外,模型在各种英语口音的识别上均达到了业界领先水平(SOTA),进一步突破了真实嘈杂环境下的语音转写瓶颈。
「多模态」频道最新
- Seedance 2.5发布:支持原生4K与30秒长视频生成 — Med1_Ai · 2026-07-30
- Seedance 2.5 预告:支持连续 30 秒原生 4K 视频生成 — Med1_Ai · 2026-07-30
- Flint Image Edit 实测:手机随拍秒变专业产品图 — Div_pradeep · 2026-07-30
- 具身模型涌现组合泛化能力,Minimax 视频生成实测 — mishig25 · 2026-07-30
- Pruna AI 与 Ideogram 联合发布 P-Image-Ideogram,速度与性价比领先 — guennemann · 2026-07-30
- 科大讯飞发布超拟人数字人,打通全链路实时生成 — 智东西 · 2026-07-30