AssemblyAI 发布 Universal-3.6 Pro Realtime,两项流式语音基准登顶
AssemblyAI · x · 2026-09-30
AssemblyAI 推出实时语音识别模型 Universal-3.6 Pro Realtime,并在两个独立基准上取得领先:
- 在 @trydaily 的 Pipecat 开源 STT 基准中位于帕累托前沿;
- 在 @covaldev 的实时排行榜上,真实语音 agent 音频的词错率(WER)为所有流式模型中最低。
针对语音 agent 常被忽略的困难场景做了专门优化:
- 简短应答:"No"、"Nah"、"Nuh-uh" 等短语在嘈杂房间和电话线上识别准确率达 98.5%;
- 背景人声:电视声、同事说话等背景语音不会混入转写;
- 多语言:单端点支持 32 种语言并自动检测,可跟随说话人中途切换语言;
- 轮次检测:基于实体的断句判断,用户报电话号码时保持回合不中断。
模型用数万小时真实语音 agent 与电话对话数据训练。
所属事件:AssemblyAI 推出 Universal-3.6 Pro Realtime 双榜登顶(2 条相关)→
「多模态」频道最新
- Argil 发布 AI 故事片工作室,30 秒视频制作从 3 小时缩到 10 分钟 — kevinnbass · 2026-09-30
- NVIDIA 开源 Physis-Lang:给视频世界模型补物理课,登顶 Physics-IQ 榜 — NVIDIAAI · 2026-09-30
- 1 张图 + 1 段音频,Opus 5.5 半小时生成 20 秒视频场景 — justin_hart · 2026-09-30
- AI 视频逼真到让作者奶奶误以为真,作者直接晒出提示词 — techhalla · 2026-09-30
- ComfyUI 招募测试新 Asset 系统:文件索引化,可持久化输出历史 — Lexius2129 · 2026-09-30
- 社区微调 Qwen-Image-2.1 VAE:消除棋盘伪影+实时预览 — bdsqlsz · 2026-09-30