PAMI:身体部位锚点投票生成人-物交互动作,接触召回提升 14.5%
Chuqiao Li · hf · 2026-10-09
论文 PAMI(Part Anchored Motion for Interaction)解决文本生成全身人-物交互(HOI)动作的难题。现有方法把人和物体表示为两条独立轨迹再隐式学习全局耦合,常出现物体漂移、漏接触和穿模。
受 Hough 变换启发,PAMI 让多个身体部位锚点为物体运动投票:将物体运动表示为相对于各身体锚点的偏移,用 PamiVAE 学习交互隐空间并逐帧加权聚合投票。
生成分两级:
- PamiGen:从文本在结构化隐空间生成粗粒度交互
- PamiRefiner:用混合表面感知表示(长程探针+近程传感器)递归细化接触几何
在 InterAct 上比前 SOTA 接触召回高 14.5%,物体相对人体的运动也更准确;消融验证了部位锚点投票与混合表面细化的贡献。
「多模态」频道最新
- Artificial Analysis:Nano Banana 2.1 成谷歌图像编辑最强模型 — ArtificialAnlys · 2026-10-09
- Nano Banana 2.1 九项能力全面进步,布局与人体的提升最大 — ArtificialAnlys · 2026-10-09
- 价格减半质量反升:Nano Banana 2.1 推开质价比前沿 — ArtificialAnlys · 2026-10-09
- Google 发布 Nano Banana 2.1:16 项能力全胜上代,价格砍半至 $0.0336/张 — ArtificialAnlys · 2026-10-09
- 斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速 — GordonWetzstein · 2026-10-09
- 开源 img2threejs:把参考图重建为纯代码 Three.js 模型,17.7k stars — tom_doerr · 2026-10-09