蚂蚁开源 Realtime-Venus:分离音视频模型的全双工实时交互系统
antgroup · hf · 2026-09-15
蚂蚁集团在 Hugging Face 发布 Realtime-Venus,一个主动式全双工(proactive full-duplex)交互系统。
- 架构:采用异步委托设计,将视听理解与语音模型分离,支持连续感知、对话控制与原生语音生成
- 运行时:通过共享因果时间轴(shared causal timeline)与双循环运行时整合各模块
- 特点:系统可主动发起交互,而非仅被动应答,面向实时语音对话场景
「多模态」频道最新
- 5060 显卡本地跑 H3:两张参考图 12 秒视频耗时 57 分钟 — thatguyjames_uk · 2026-09-15
- 4060 Ti 实测:LTX 2.5 显存占用更优,为何大家仍选 H3 — ForesterAI · 2026-09-15
- MiniMax H3 借 SGLang+VDN 实现超 2 倍实时视频去噪 — MiniMax_AI · 2026-09-15
- 开源 LongCat-Avatar:一张照片加音频生成数分钟对口型视频 — Roger_M_Taylor · 2026-09-15
- Odyssey 预告「世界模型」系列第三部分明日发布 — soleio · 2026-09-15
- 自建生成动作模型叠加图像扩散,做出 datamosh 风格抽象动画 — pixlpa · 2026-09-15