Moshi 早在热词走红前就做出了全双工语音模型
mattturck · x · 2026-07-25
- 这条讨论围绕 full-duplex 语音 AI 展开:如今这个词很热,但 Moshi 其实早已做出了一个端到端的对话式语音模型,只是当时团队并不知道这个技术标签。
- Neil Zegh 说,他们最初只是想做一个对话模型;由于没有对话系统背景,采用端到端路线是最自然的选择,后来才意识到这项工作对应了一个更大的技术方向。
- 引用视频把 Moshi 放进更大的语音到语音演进图景里,讨论了实时语音助手、full-duplex 语音模型、以及为什么这种架构至今仍没有大规模普及。
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- ComfyUI 新增 Mage-Flow 编辑支持,3080Ti 笔记本 4 步可跑 — sci032 · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27