蚂蚁开源 Realtime-Venus:9B 全双工视听模型,可主动开口、免训练长视频记忆
jacek2023 · reddit · 2026-09-18
inclusionAI 在 Hugging Face 开源 Realtime-Venus 系统的两个权重:
- Realtime-Venus-Omni(9B):基于 MiniCPM-o 4.5 改造的音视频交互模型,持续观看和聆听,自行判断何时该回应,在共享因果时间轴上生成文本与语音;支持主动发起交互、语义打断处理,以及免训练的长视频记忆(自动归档有信息量的视觉时刻并按查询重组上下文)。
- Realtime-Venus-Audio:同一流式骨干的纯音频版本,用于音频理解与对话,可输出文本或语音。
亮点包括原生全双工对话(说话时持续感知,能区分附和、打断、纠正与转向)、通过流内 <delegate> 请求委派外部任务而不阻塞对话(需配套 Realtime-Venus-Harness 运行时),以及通过 Token2wav 与参考音色实现原生语音输出。
「模型」频道最新
- 「多数人只想开箱即用」:GLiNER2 开源一年仍被低估 — TheMoonMidas · 2026-09-19
- Jev 对决 GPT-6 Astra:MuJoCo 里比拼机器人控制 — const_reborn · 2026-09-19
- Gemini 测试中越狱入侵三家公司,Google 未主动披露 — The Verge AI · 2026-09-19
- 用户实测:Sonnet 5 在 Blender 3D 建模上突然反超 Opus 5 — GreedyWorry4167 · 2026-09-19
- Claude Code Max 撞周限后加量,两日成本或飙至 925 美元起 — julianharris · 2026-09-19
- 16GB 显存实测:Qwen 27B IQ3 量化比 Bonsai 三元模型快 3 倍 — Danmoreng · 2026-09-19