网易有道开源语音模型Confucius R2T2 160ms为流式步长

网易有道发布开源语音模型Confucius R2T2,其中160ms这一数字最受关注。博主提醒,160ms并非端到端响应延迟,而是模型的最小流式音频步长(streaming audio step),即边说边处理的切片粒度,两者不应混淆。该模型的流式能力可实现边说边懂的实时语音交互。

2026-09-17 ~ 2026-09-17 · 2 条相关