网易有道开源 Confucius R2T2:160ms 流式切片边说边懂语音

VraserX · x · 2026-09-17

网易有道发布开源语音模型 Confucius R2T2,其中 160ms 这个数字最引人注意——但它不是端到端响应延迟,而是最小流式音频步长(streaming audio step),这个区别很关键。

R2T2 的真正亮点在于:模型不需要攒够一大段音频才开始理解你,而是在你说话的同时以极小的切片连续处理语音。这种边听边懂的流式处理,正是让语音 AI 从「对着机器说话」变成真正对话体验的关键改进。

所属事件:网易有道开源语音模型Confucius R2T2 160ms为流式步长(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →