Moshi 早在热词走红前就做出了全双工语音模型
mattturck · x · 2026-07-25
- 这条讨论围绕 full-duplex 语音 AI 展开:如今这个词很热,但 Moshi 其实早已做出了一个端到端的对话式语音模型,只是当时团队并不知道这个技术标签。
- Neil Zegh 说,他们最初只是想做一个对话模型;由于没有对话系统背景,采用端到端路线是最自然的选择,后来才意识到这项工作对应了一个更大的技术方向。
- 引用视频把 Moshi 放进更大的语音到语音演进图景里,讨论了实时语音助手、full-duplex 语音模型、以及为什么这种架构至今仍没有大规模普及。
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11