网易有道开源 Confucius4-R2T2 实时语音识别,延迟仅 200~600ms
aigclink · x · 2026-09-20
网易有道发布实时语音识别模型 Confucius4-R2T2(已开源),基于 Qwen3-ASR,主打「实时字幕不跳字」。
- 只增不改的流式输出:已输出的文本永久定稿、不会回改,避免实时字幕常见的文字闪烁。
- LSP 策略:模型持续监听语音,足够确定某段话不会变时才定稿输出,没把握的部分等待更多上下文,在稳定性与低延迟之间权衡,端到端延迟约 200600 毫秒。
- 解码块 80ms–2s 可调:想要低延迟用小块,想要精度用大块,可按场景配置。
适合直播字幕、会议同传、语音客服、下游 NLP/LLM Agent 管道等需要即时处理文本的场景。模型与 WebSocket 服务端/客户端示例均已放在 GitHub(netease-youdao/Confucius4-R2T2)。
所属事件:网易有道开源实时语音识别模型 Confucius4-R2T2(2 条相关)→
「模型」频道最新
- 8 个分类数据集实测:有标注数据时传统 ML 仍胜过 Jev 零样本 — Ok_Juggernaut2187 · 2026-09-20
- 3 名研究员用 Claude Opus 5 接管 OpenAI 员工账户,成本仅 3000 美元 — FinanceYF5 · 2026-09-20
- 阿里开源 DAMO RADAR 医疗模型,可检测癌症等近 150 种疾病 — emmanuelvivier · 2026-09-20
- 曝 Anthropic 正内测 Claude Money,可连银行账户分析开支与订阅 — emmanuelvivier · 2026-09-20
- Mozilla 报告:开源权重模型与闭源前沿仅差约四个月 — mark_k · 2026-09-20
- 200 美元档 GPT 模型浏览来源全是无关页面,用户质疑搜索真实性 — CompetentRaindeer · 2026-09-20