沙特 HUMAIN 免费开放 Voice 语音模型,支持沙特方言与开发者 SDK
aziz4ai · x · 2026-09-04
HUMAIN(沙特 AI 公司)上线 HUMAIN Voice,提供语音转文字(STT)、文字转语音(TTS)与即将推出的 Voice Agent,主打沙特阿拉伯方言,音质和方言表现被评价为出色,无需注册即可试用。
开发者侧提供统一 SDK(TypeScript/Python,Go 即将支持):
- 文件转写支持词级时间戳,支持阿英混合模型 BayanArEn
- 实时流式转写与说话人分离(diarization)
- TTS 可流式返回 PCM 音频
- 支持隐私数据脱敏、数字与日期格式化等实用功能
所属事件:沙特 HUMAIN 推出 Voice 语音模型,主打方言支持(2 条相关)→
「多模态」频道最新
- Google 发布 Lyria 3.5 音乐模型,上线 AI Studio 与 Gemini API — GeminiApp · 2026-09-05
- 微软发布 MAI-Image-2.6-Flash:比 GPT-Image-2 快 2 倍且省 72% GPU — mustafasuleyman · 2026-09-05
- Google 音乐模型 Lyria 3.5 上线 Gemini,人声与编曲全面升级 — GeminiApp · 2026-09-05
- 李飞飞 World Labs 发布世界模型 Atlas:3 张照片即可重建 3D 空间 — theworldlabs · 2026-09-05
- 用 GPT Image 2 生成角色多角度图,再进 Seedance 做 1080p AI 广告 — socialwithaayan · 2026-09-05
- Topview 联合 Wan 3.0 办 AI 视频大赛,奖金 1.5 万美元 — azed_ai · 2026-09-04