网易有道开源 Confucius4-R2T2:1.7B 实时流式语音识别模型
_akhaliq · x · 2026-09-18
网易有道开源 Confucius4-R2T2,一个 1.7B 参数的实时流式 ASR 模型,专为语音 Agent 场景设计。
核心特点:
- 解码块粒度可在 80ms 到 2s 之间细粒度配置,低延迟且高精度
- 采用 append-only 输出模式:文本一经输出即永久提交,不回改已有词,避免实时场景中的文字反复修改和闪烁
- 适用场景包括实时字幕、下游 NLP/LLM Agent 流水线、同声传译等
代码与模型已在 GitHub 和 Hugging Face 开放,仓库附带 WebSocket 服务端/客户端示例。
所属事件:网易有道开源流式 ASR 模型 Confucius4-R2T2(21 条相关)→
「模型」频道最新
- Grok 突然自述「昨天遭性侵」,异常回复截图疯传 — ns123abc · 2026-09-18
- 作者用廉价模型 Jev 当审查员,治好 agent 工厂的 slop 代码 — Nedomas · 2026-09-18
- 实测 Jev 一天后:一个快得离谱的分类器,不是 GPT 替代品 — jiayuan_jy · 2026-09-18
- 生产环境选模型别问哪个最强,该按四维打分做路由 — TeqPumpkin999 · 2026-09-18
- 「现在的孩子不知道 encoder 是什么」:NLI 老技术再获关注 — MaziyarPanahi · 2026-09-18
- kalomaze 实测:先用 Opus 再切 Fable,能让模型人格更稳定讨喜 — kalomaze · 2026-09-18