HiPLEX 分层策略因子化:让全双工语音模型接话时机更自然
Qualcomm-AI-Research · hf · 2026-10-07
高通 AI Research 提出 HiPLEX,一个面向全双工语音语言模型的 RL 框架,解决现有方法只单独优化时机或语义、无法联合改进的问题。
核心设计
- 将预训练全双工文本策略因子化为两个策略:「控制策略」决定何时输出(pad/epad/con),「条件内容策略」在选 con 时决定输出什么 token,复用模型现有文本头
- 通过从生成语音回合推导的事件因果掩码,将时机优势路由到 token 组因子;将 LLM-judge 语义优势路由到条件内容因子
结果:在三个 Moshi 种子上的 Full-Duplex-Bench v1 中,HiPLEX 相比 GRPO 降低了自然停顿与附和机会时的抢话率,缩短被打断后的响应延迟,同时保持相当的应答质量;在 Moshi 和 PersonaPlex 上比 GRPO 更符合人类回合时机与附和率分布。
「研究」频道最新
- AI 攻坚数学的旧路径:现象→猜想→新工具→解答,很快将不再主流 — _onionesque · 2026-10-07
- AI 挖矿数学富矿论:已有大量中间成果等待 AI 系统性开采 — _onionesque · 2026-10-07
- 机器人仿真器 RaiSim 回归:2.8.0 主打 CPU 高速仿真+照片级渲染 — ChongZzZhang · 2026-10-07
- DAEDALUS:无任务无验证器,靠自生成练习为 Agent 积累记忆 — illuin · 2026-10-07
- 冻结模型外部存数值记忆:Qwen 到 Mistral 复现,Top-1 命中 99.2% — Nearby_Indication474 · 2026-10-07
- 发布数学论文 skill 文件:给 LLM 写的论文去水纠错 — IAmTimNguyen · 2026-10-07