网易有道开源实时语音识别模型 Confucius4-R2T2

网易有道发布并开源实时语音识别模型 Confucius4-R2T2,基于 Qwen3-ASR,主打低延迟、高精度的真流式识别。模型实现「只增不改」的流式输出,已输出的文本永不改动,解决实时字幕跳字问题;解码延迟仅 200600ms,细粒度解码块可在 80ms2s 之间调整。代码仓库已上线 GitHub。

2026-09-20 ~ 2026-09-20 · 2 条相关

另有 1 条近重复转述:aigclink