Gradium CEO:全双工语音是短板,自然度与智能难兼得
AI Engineer · youtube · 2026-09-15
AI Engineer 频道发布 Gradium 联合创始人兼 CEO Neil Zeghidour 的演讲,核心论点:今天所有实时语音模型都是半双工的——要么听要么说,而真人通话中多达 20% 的时间是双方同时说话,这个鸿沟就是全双工语音模型的立项理由。
关键内容:
- 演讲回顾了从 2011 年把转写映射到应用动作的电话助手,到能对话却零行动力的开放式语音聊天,再到级联式语音 agent——后者能调用工具,但继承了经文本中转的延迟与被压平的情感
- 现场演示 back-channeling(嗯哼、“对”)会让现有模型直接卡死,暴露轮次切换的缺陷
- 技术核心:8 个词约 3 秒,24kHz 下即 72,000 个时间步,注意力开销随序列长度平方增长,原始音频根本塞不进语言模型;神经编解码器把音频压缩成可学习的 token 表示,全双工则需同时建模两条 token 流
- 坦承至今每一次自然度提升都在消耗智能:固定权重预算花在听说上就从推理中扣除,并给出两条路线——扩大 speech-to-speech 模型规模,或将接口与智能拆分
「多模态」频道最新
- RX 6800 16GB 本地跑 Z-Image Turbo:每张图 43 秒的完整配置 — AstroFieldsGlowing · 2026-09-15
- 实测:FPV 镜头 Seedance 2.0 仍碾压 2.5,速度感与动感更强 — azed_ai · 2026-09-15
- Reddit 网友展示自用 AI 制作的短视频作品 — anotheraccountaus · 2026-09-15
- 一条视频生成 4D 高斯泼溅,4DAnyone 实测体验分享 — mickmumpitz · 2026-09-15
- 《Lost Souls》:AI 生成的电影感短片章节亮相 Reddit — Choice_Mongoose7320 · 2026-09-15
- 42 秒渲染一帧的 Blender 官方图被转成 3D 高斯泼溅实时浏览 — willeastcott · 2026-09-15