谷歌发布 Gemini 3.5 Transcribe,支持 85 种语言实时转录
OfficialLoganK · x · 2026-08-27
谷歌推出了 Gemini 3.5 Transcribe 语音转文本模型。该模型具备智能转录、函数调用能力,拥有更低的词错误率(WER),并支持自定义词汇、说话人识别以及超过 85 种语言。同时,该模型支持实时流式传输功能。
所属事件:谷歌发布 Gemini 3.5 Transcribe 语音转文本模型(15 条相关)→
「多模态」频道最新
- 构建多模态智能体:从 LLM 到落地 Agent 的 7 步路线图 — MaryamMiradi · 2026-08-27
- Descript 揭秘专用模型:零shot语音修复与唇形同步 — descript · 2026-08-27
- Runway 接入 Meta Muse 图像模型,多模态能力再升级 — runwayml · 2026-08-27
- Seedance 2.5 对比 2.0 实测:同提示词下氛围感明显更强 — piotrbinkowski · 2026-08-27
- 主网首个链上自编码器「remanence」即将发售 — bushibuilds · 2026-08-27
- Wan 视频去模糊技巧:低去噪 KSampler 二次采样 — o0ANARKY0o · 2026-08-27