音视频实时决策模型 clef-omni 上线,8 个在线 demo 可直接体验
Xianbao_QIAN · x · 2026-10-11
clef-omni 是一个音视频实时决策模型,定位 Jev 风格模型在端侧的终极用例,官方推出 8 个可在线交互的 demo:
- 手势识别:画布绘制,两阶段判断,可连续补画
- 视觉检测与工单:PCB 电路板检测、产品质量检查、图片审核、工单分流
- 截图建议:理解屏幕内容并建议下一步动作
- 机器人导航:网格环境中逐步决策转向、移动、拾取目标
- Voice Agent:基于真实 VAD 与 WebSocket,实时观察轮次判断,支持可打断回应
- 包裹验收:一次判断外观、封装与处理建议
- 停车位状态:判断空闲/占用/看不清
- 语音内容审核:区分正常交流、辱骂与欺诈诱导
作者判断这类实时决策模型会带动 VoiceAgent 和具身智能场景的落地,每个 demo 均实时展示决策与概率。
「具身」频道最新
- LILYGO 两款开源硬件上手:BB 键盘机体验意外好用 — glenbeer · 2026-10-12
- Paradromics 脑机接口让失语者用「想象语音」重新开口交流 — PeterDiamandis · 2026-10-12
- 小鹏 Iron 人形机器人开始量产,2027 下半年进入欧洲 — LinusEkenstam · 2026-10-12
- 仿真训练 scaling laws 受关注:业界称真机数据采集花费百万恐不必要 — lukas_m_ziegler · 2026-10-11
- 美国心脏协会声明:可穿戴血压设备测量不准,或致误诊风险 — EricTopol · 2026-10-11
- Galbot 人形机器人进驻香港 24 小时便利店,可取货递饮料 — CyberRobooo · 2026-10-11