Gemini 3.5 Transcribe 实测:WER 2.6% 居第三,速度价格均非最优

Slight_Republic_4242 · reddit · 2026-09-07

作者对比了 Google 新发布的 Gemini 3.5 Transcribe 与主要 STT 模型,指出 2.6% WER 的宣传数字虽亮眼,但按 Artificial Analysis 排行榜并非第一:ElevenLabs Scribe v2 以 2.2% 居首,Microsoft MAI-Transcribe-1.5 为 2.4%,Gemini 落后榜首 0.4 个百分点。

速度上 Gemini 约 80× 实时,低于 MAI 的 190×,但高于 Scribe v2 的 55×;价格上 Gemini 约 $5/千分钟,也高于 Scribe v2 的 $3.67。

不过作者认为工程团队仍会关注 Gemini:它支持自我纠错、填充词移除、格式化、自定义词表、85+ 语言,以及最多三位说话人分离,Google 报告其在 FLEURS 上流式 WER 5.50%、非流式 5.04%。对语音 agent 等场景而言,关键的不是单一最强转写模型,而是能为整个系统提供干净结构化文本的音频输入层。

结论:benchmark 有用但不等于生产现实,延迟预算、编排、下游工作流同样重要,应保持随时可切换供应商的自由——作者本人用本地部署、BYOK 的开源编排器 dograh 来避免厂商锁定。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →