网易有道开源流式 ASR 模型 Confucius4-R2T2
网易有道于 9 月 17 日在 GitHub 开源流式语音识别模型 Confucius4-R2T2(Real Real-Time Transcription),基于 Qwen3-ASR 构建,主打低延迟、高准确率的真流式识别,并针对语音 agent 生产环境中的状态污染问题给出只追加不改写的解法。多位博主认为这标志着流式 ASR 从 demo 走向基础设施。
已确认
- 模型基于 Qwen3-ASR 构建,解码块粒度可配置,从 80ms 起步;160ms 是最小流式音频步长(minimum streaming audio step),并非端到端响应延迟——博主 VraserX 特别提醒两者的概念区别。
- 核心设计为只追加(append-only):已提交文本永不被重写,避免流式转写文本反复变动污染下游 agent 状态;博主 Rohan Paul 解释其思路是让 agent 增量消费语音、只对已提交文本行动,并用稳定前缀学习防止状态污染。
- 架构上采用单个 Audio Encoder + LLM 基座同时服务离线与流式识别,通过可配置 chunk 大小在延迟/质量之间调优,且离线侧不损失精度,无需维护两套会发生漂移的模型。
- 具备领域感知能力,可识别领域术语。
为什么重要
- Rohan Paul 指出,转写文本不断被改写是语音 agent 的严重生产问题,会破坏下游 agent 状态;R2T2 的稳定提交机制直接命中这一痛点。
- Rohan Paul 总结称,领域感知流式识别、单一技术栈覆盖所有延迟目标、把上下文当作一等输入而非事后补充,这三者合在一起才是「基础设施」与「demo」的分水岭,稳定、领域感知的流式识别是当前真正的悬念。
2026-09-17 ~ 2026-09-17 · 7 条相关
一手来源
- 网易有道开源 Confucius4-R2T2:流式 ASR 只追加不改写已提交文本 — rohanpaul_ai ·
- 网易有道开源 Confucius4-R2T2:80ms 起步的真流式低延迟语音识别 — rohanpaul_ai ·
- 网易有道开源 Confucius R2T2:160ms 是最小流式音频步长,非端到端延迟 — VraserX ·
- 【源头】网易有道开源 Confucius R2T2:160ms 是最小流式音频步长,非端到端延迟 — VraserX · 2026-09-17
- 网易有道开源 Confucius R2T2:160ms 流式切片边说边懂语音 — VraserX · 2026-09-17
- 语音 agent 应只消费已提交文本:R2T2 用稳定前缀学习防状态污染 — rohanpaul_ai · 2026-09-17
- 【源头】网易有道开源 Confucius4-R2T2:流式 ASR 只追加不改写已提交文本 — rohanpaul_ai · 2026-09-17
- 单一音频编码器+LLM 兼顾离线与流式识别,免维护两套漂移模型 — rohanpaul_ai · 2026-09-17
- Rohan Paul:领域感知流式识别是基础设施与 demo 的分水岭 — rohanpaul_ai · 2026-09-17
- 【源头】网易有道开源 Confucius4-R2T2:80ms 起步的真流式低延迟语音识别 — rohanpaul_ai · 2026-09-17