COSMI 用组合法构建 22.2 万条多物体交互序列训练扩散 Transformer
CSProfKGD · x · 2026-10-08
图宾根大学 Gerard Pons-Moll 团队发布 COSMI 研究,核心观察是:大多数人-物交互是局部的(手握杯子、椅子支撑骨盆),身体其余部分自由,因此无需捕获所有交互组合,而应利用组合性。
关键内容:
- 用 LLM 推理 + 几何校验,把现有单物体交互数据集组合成 222k 条多物体序列,共 275 小时,每条最多含 5 个物体
- 在此数据上训练单个扩散 Transformer,处理 1-5 个物体的交互,每个物体相对于其接触的身体部位预测,可泛化到未见过的物体与组合
- 相关团队还发布 AvaImg(ECCV 2026):高保真 SMPL-X+D 配准方法,输出 UV 纹理与位移图,支持重动画、纹理/形状编辑,并解决了数据集真值中常见的身体穿透衣物问题;配套开源了统一 15 个 HOI 数据集的 Blender 插件
所属事件:图宾根大学 COSMI 合成 22.2 万条人物交互序列(2 条相关)→
「研究」频道最新
- 图表显示 AI 解数学题能力飞速提升,一天后就已过时 — willknight · 2026-10-08
- DAIR.AI 整理 31 篇递归自我改进论文,从 Schmidhuber 到最新技术 — omarsar0 · 2026-10-08
- Zak Kohane:AI 将更早冲击外科介入等医学亚专科 — zakkohane · 2026-10-08
- Vector 团队用 3DSPA 作奖励信号,让视频模型不再违反物理规则 — VectorInst · 2026-10-08
- Vector 研究院介绍 3DSPA:用 3D 语义点自编码器度量视频物理真实性 — VectorInst · 2026-10-08
- 3DSPA 用作强化学习奖励信号:生成视频里重力恢复正常、物体不再穿透 — VectorInst · 2026-10-08