开发者实测 Gemini 3.5 Transcribe:WER 低至 2.6%,后处理体验极佳
_philschmid · x · 2026-08-27
Phil Schmid 分享了对 Gemini 3.5 Transcribe 的实测体验。关键技术指标包括:非流式 WER 2.6%,流式 WER 4.0;相比 Chirp 3,最终转录时间减少 70%。
主要体验点:
- 模型能智能处理口语中的冗余(如 um, ah)和自我修正。
- 强大的字母数字混合识别能力(如区分 . 和人名 Jason)。
- 提供两个版本:gemini-3.5-transcribe-live 用于低延迟流式,gemini-3.5-transcribe 用于录音处理并支持说话人区分。
「模型」频道最新
- Pokee-Isaac 28B 演示 5 分钟内从创意到生成可玩游戏 — Kyrannio · 2026-08-27
- Goodfire 公布新研究:高效定位导致模型分叉的关键 Token — VoidAsuka · 2026-08-27
- 专家点评 Inkling:跑分高但体验差,致热度骤减 — ethayarajh · 2026-08-27
- 印度 AI Mission 选中 Sarvam:105B 参数本土大模型印地语表现出色 — abhish18 · 2026-08-27
- Sarvam AI 语音转文本与基础模型体验趋于成熟 — abhish18 · 2026-08-27
- 美最大开源模型 Inkling 沦为哑炮?实测体验引质疑 — beenwrekt · 2026-08-27