网易有道开源 Confucius4-R2T2 流式语音识别,解码块 80ms~2s 可调
aigclink · x · 2026-09-20
网易有道开源实时语音识别模型 Confucius4-R2T2,低延迟、高精度的真流式 ASR,仓库已上 GitHub。
- 真流式 + 只增不改:细粒度解码块 80ms2s 可配置,输出文本一经定稿不再回改,避免实时场景中的文字闪烁。
- 适用场景:实时直播字幕、同声传译、语音客服,以及需要即时消费文本的下游 NLP 管道与 LLM Agent。
- 仓库内容:含示例脚本 example.py、WebSocket 服务端/客户端(wsserver.py、wsclient.py)与中英文文档,方便直接部署。
所属事件:网易有道开源实时语音识别模型 Confucius4-R2T2(2 条相关)→
「模型」频道最新
- Nautilo 演示人机共创设计:生成Pelican骑车图后手动接管改层 — Dan_Jeffries1 · 2026-09-20
- 观察:模型自我批评 Trend 上升,Opus 3 对开发者负面情绪最低 — repligate · 2026-09-20
- DeepMind 高管放话 100% 重回前沿,Gemini 4 迟迟未发引猜测 — nathanbenaich · 2026-09-20
- 开源模型的价值:微调兜底,零样本换灵活性 — antoine_chaffin · 2026-09-20
- DiffusionGemma 新玩法:一次并行去噪搞定全部决策,单步仅约 0.2 秒 — bodonoghue85 · 2026-09-20
- 曝 Sonnet 5.2、Opus 5.2、Gemini 4 Pro 已在测试,下周密集发布 — kimmonismus · 2026-09-20