RelateAnything:53M 参数模型识别图像中物体空间关系

Roger_M_Taylor · x · 2026-09-19

一个名为 RelateAnything 的项目引起关注:仅靠像素和 bounding box 就能识别图像中物体间的关系,如「holding」「behind」「sitting on」等。

关键参数:仅 53M 参数,覆盖 19K+ 种关系词,无需重训练,推理速度约 20ms/帧。作者指出空间关系仍是其弱项,但计划用自己的检测器输出和视频进一步实测。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →