Lychee-FD开源全双工语音模型
机器之心 · wechat · 2026-07-16
哈工大深圳立知团队发布并开源了原生端到端全双工语音大模型 Lychee-FD,目标是让语音交互从“轮次式问答”走向“持续倾听、实时理解、自然回应”的类人全双工交流。
文章先指出了原生全双工语音模型难做好的两个根因:声学建模与语义建模在深层参数空间里会产生梯度冲突,以及高频语音信号会稀释稀疏的文本语义监督,导致模型要么更流畅但更“降智”,要么保住语义但延迟更高。为此,团队提出层次化语义-声学建模框架:浅层共享主干,深层拆分为语义、声学和对话控制通道,并通过密集语义对齐缓解稀释问题。
实验上,Lychee-FD 在 SpokenQA 上平均提升 7.4%,在 FullDuplexBench1.5 上平均提升 28.5%,并在 3 个全双工语音交互基准的 10 个指标上达到领先。工程上,团队还基于 vLLM 改造了实时并行多流推理框架,将多个通道并行化,带来 2.96 倍提速和 23% 显存降低;同时加入控制头早退策略,让打断和切换响应更快。文章还展示了该模型驱动的数字人和实体机器人 Demo,并强调其已开源,便于复现与扩展。
「多模态」频道最新
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11