LAWM-3D 负结果:多视角视频并不让潜动作学会 3D

andrew_n_carr · x · 2026-08-21

LAWM-3D 团队发布重要负结果:仅靠多视角视频(multiview video)并不能让 latent action 在三维空间中正确运作。模型会通过泄漏未来帧的外观信息来「作弊」绕过 3D 学习。研究者发现必须引入显式的 3D 特征对齐,并配合一个非单射(non-injective)的 RGB-D 目标,才能让潜动作真正具备 3D 结构。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →