RelateAnything:53M 参数模型识别图像中物体空间关系
Roger_M_Taylor · x · 2026-09-19
一个名为 RelateAnything 的项目引起关注:仅靠像素和 bounding box 就能识别图像中物体间的关系,如「holding」「behind」「sitting on」等。
关键参数:仅 53M 参数,覆盖 19K+ 种关系词,无需重训练,推理速度约 20ms/帧。作者指出空间关系仍是其弱项,但计划用自己的检测器输出和视频进一步实测。
「研究」频道最新
- MLC 推出 Blackwell GPU 执行模型教程:线程层级、内存与 TMA 一文讲透 — blaizedsouza · 2026-09-19
- 21个模型-框架组合实测:换Agent框架几乎不影响成功率,却能大幅改变成本 — iScienceLuvr · 2026-09-19
- Jev 开源仿冒项目已近 200 个,有人着手做首个官方版对比基准 — airesearch12 · 2026-09-19
- 1451 条已验证 DeepSeek 推理链开源:MIT 协议、去污染、面向小模型蒸馏 — Paramecium_caudatum_ · 2026-09-19
- 「找到某概念的 steering vector」正成水论文万金油,研究员发帖吐槽 — gleech · 2026-09-19
- 机器学习原子间势的不确定性量化为何难做?「通用MLIP」或只是神话 — rishabh16_ · 2026-09-19