Google 发布 Gemini 3.5 Transcribe:支持 85+ 语言与流式听写
osanseviero · x · 2026-08-27
Google 正式发布 Gemini 3.5 Transcribe 模型。该模型主打智能转录功能,支持 85 种以上语言,具备函数调用、自定义词汇、多说话人识别能力。它同时支持批量处理和实时流式音频输入,已集成至 Google 多款产品中,供开发者调用。
所属事件:谷歌发布 Gemini 3.5 Transcribe(17 条相关)→
「多模态」频道最新
- HeyGen 为何开源 HyperFrames:将视频编辑转为代码问题 — altryne · 2026-08-27
- Seedance 2.5 同步生成音画,原生低分输出来降成本 — LudovicCreator · 2026-08-27
- Seedance 2.5 支持 50 路参考素材,解决角色一致性难题 — LudovicCreator · 2026-08-27
- 构建多模态智能体:从 LLM 到落地 Agent 的 7 步路线图 — MaryamMiradi · 2026-08-27
- Descript 揭秘专用模型:零shot语音修复与唇形同步 — descript · 2026-08-27
- Runway 接入 Meta Muse 图像模型,多模态能力再升级 — runwayml · 2026-08-27