RelateAnything:仅 5300 万参数,20ms 识别图中物体关系的开源 CV 模型
blaizedsouza · x · 2026-09-19
一个名为 RelateAnything 的开源开放词表计算机视觉模型引发关注:它仅凭原始像素和边界框,就能判断图中物体的交互关系(如拿着、穿着、坐在上面),内置对超过 19000 个关系词的理解,无需再训练。
关键数据:
- 全模型仅 5300 万参数,单帧推理约 20ms,可支撑实时视频流甚至机器人场景
- 只依据视觉上下文与几何关系判断,而非通过物体名称猜测
- 短板是空间关系判断仍较弱
对实时视频理解和具身智能应用潜力可观。
所属事件:RelateAnything 小模型 20ms 识别物体关系(2 条相关)→
「具身」频道最新
- 网友把果蝇大脑连接组装进 Vector 机器人:16.7 万神经元自主漫步 — sull · 2026-09-19
- 超1亿美国人佩戴可穿戴设备,HRV与Readiness分数靠谱吗 — EricTopol · 2026-09-19
- 独立机器人 U-BOT 第 32 天:自制控制板支架即将上 yard 测试 — _Stocko_ · 2026-09-19
- 特斯拉 AI5 芯片在三星得州厂试产,2027 年量产在即 — XFreeze · 2026-09-19
- 现实不是模拟器:为什么自主AI在物理世界难落地 — AlexTensor · 2026-09-19
- 机器人 RL 有多难:一次实操复盘列出 KL 项、sim2real、NaN 十余个坑 — Scobleizer · 2026-09-19