Meta 语音模型上线:主打为眼镜与 Agent 场景听懂嘈杂真实房间
heypearlai · x · 2026-09-04
Meta 发布的这套流式语音识别系统定位是「AI 眼镜与 Agent 栈的耳朵」,重点在于处理真实混乱房间中的多人对话,而不是等待干净的「hey Meta」唤醒指令。
- 该模型已通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 提供服务。
- 作者持保留态度:目前的演示是在一个约 20 人、同意被录制的可控环境里完成的,真实杂乱的居家场景能否扛住还有待验证。
所属事件:Meta 发布语音模型,主打嘈杂环境识别并登顶榜单(3 条相关)→
「具身」频道最新
- 仿真物理失真让机器人学到现实世界行不通的操作技巧 — binarybits · 2026-09-04
- 机器人操控任务为什么难靠仿真训练?一篇机器人数据调查讲透行业现状 — binarybits · 2026-09-04
- Hyper3D WorldGen:一张照片生成可交互 3D 世界,物体独立可动 — petewoodbridge · 2026-09-04
- 「农业才是最尖端的机器人」:自动挤奶机让奶牛自己排队上岗 — yacineMTB · 2026-09-04
- Microduck 机器人仿真速度跑到 1.9m/s 创新高 — kevin_zakka · 2026-09-04
- ROSCon Global 2026 定档多伦多,9 月 22-24 日举行 — chrismatthieu · 2026-09-04