网易有道开源实时语音识别模型 Confucius4-R2T2
网易有道发布并开源实时语音识别模型 Confucius4-R2T2,基于 Qwen3-ASR,主打低延迟、高精度的真流式识别。模型实现「只增不改」的流式输出,已输出的文本永不改动,解决实时字幕跳字问题;解码延迟仅 200600ms,细粒度解码块可在 80ms2s 之间调整。代码仓库已上线 GitHub。
2026-09-20 ~ 2026-09-20 · 2 条相关
- 网易有道开源 Confucius4-R2T2 实时语音识别,延迟仅 200~600ms — aigclink · 2026-09-20
另有 1 条近重复转述:aigclink