Gemini 3.5 Transcribe 实测:WER 2.6% 居第三,速度价格均非最优
Slight_Republic_4242 · reddit · 2026-09-07
作者对比了 Google 新发布的 Gemini 3.5 Transcribe 与主要 STT 模型,指出 2.6% WER 的宣传数字虽亮眼,但按 Artificial Analysis 排行榜并非第一:ElevenLabs Scribe v2 以 2.2% 居首,Microsoft MAI-Transcribe-1.5 为 2.4%,Gemini 落后榜首 0.4 个百分点。
速度上 Gemini 约 80× 实时,低于 MAI 的 190×,但高于 Scribe v2 的 55×;价格上 Gemini 约 $5/千分钟,也高于 Scribe v2 的 $3.67。
不过作者认为工程团队仍会关注 Gemini:它支持自我纠错、填充词移除、格式化、自定义词表、85+ 语言,以及最多三位说话人分离,Google 报告其在 FLEURS 上流式 WER 5.50%、非流式 5.04%。对语音 agent 等场景而言,关键的不是单一最强转写模型,而是能为整个系统提供干净结构化文本的音频输入层。
结论:benchmark 有用但不等于生产现实,延迟预算、编排、下游工作流同样重要,应保持随时可切换供应商的自由——作者本人用本地部署、BYOK 的开源编排器 dograh 来避免厂商锁定。
「模型」频道最新
- Alexandr Wang 点评 Muse Spark 1.3:时间跨度比肩 GPT-5.6 — alexandr_wang · 2026-09-07
- 实测者泼冷水:Astra 展示强但单步推理仍够不到研究级 — xiaosun86 · 2026-09-07
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07
- 实测者泼冷水:Astra 展示力强,多步研究推理仍差一步 — xiaosun86 · 2026-09-07
- GPT-6 Astra 生成导弹规避模拟视频,能力惊人 — algo_diver · 2026-09-07
- 实测质疑 Astra 热捧:演示惊艳,多步推理仍常差一步 — xiaosun86 · 2026-09-07