网易有道开源语音模型Confucius R2T2 160ms为流式步长
网易有道发布开源语音模型Confucius R2T2,其中160ms这一数字最受关注。博主提醒,160ms并非端到端响应延迟,而是模型的最小流式音频步长(streaming audio step),即边说边处理的切片粒度,两者不应混淆。该模型的流式能力可实现边说边懂的实时语音交互。
2026-09-17 ~ 2026-09-17 · 2 条相关
- 网易有道开源 Confucius R2T2:160ms 是最小流式音频步长,非端到端延迟 — VraserX · 2026-09-17
- 网易有道开源 Confucius R2T2:160ms 流式切片边说边懂语音 — VraserX · 2026-09-17