Vector 团队用 3DSPA 作奖励信号,让视频模型不再违反物理规则
VectorInst · x · 2026-10-08
Vector Institute 在 2026 AI Summit 上由研究员 Kelsey Allen 展示了认知科学如何弥补 AI 的短板。
- 当代大模型擅长知识表示,却缺乏物理推理:Virtual Tools 游戏实验显示人类靠高精度「心理模拟」几次尝试就能解决新物理问题,而现有大模型与生成模型做不到。
- 团队提出 3DSPA(3D Semantic Point Autoencoder):不依赖难以获得的标准答案对比,而是预测近似 3D 点轨迹来度量生成视频的物理真实性,像人类婴儿一样侦测物理规则违反。
- 将 3DSPA 作为强化学习的奖励信号,可显著提升视频模型的物理真实感:重力表现正确,物体不再穿过固体障碍。
- 演讲还探讨了 AI 系统进步如何反过来塑造人类认知、导致过度依赖的问题,完整演示见 Vector YouTube 频道。
所属事件:Vector研究院推3DSPA:用3D语义点度量并改善视频物理真实性(5 条相关)→
「多模态」频道最新
- ExploreNet 论文:扩散 RL 探索分布的形状比幅度更重要 — StellaLisy · 2026-10-08
- ExploreNet 消融:扰动高敏通道时人眼感知差异更大 — StellaLisy · 2026-10-08
- ExploreNet 生成的图像 86.1% 情况下偏离基线更远 — StellaLisy · 2026-10-08
- ExploreNet 超越 FlowGRPO:扩散模型探索噪声可以学习 — StellaLisy · 2026-10-08
- ExploreNet 提出可学习探索分布,改进扩散模型 GRPO 训练 — StellaLisy · 2026-10-08
- Fish Audio 推出 Drama 3:自然语言导演语音,可句中切换情绪 — omarsar0 · 2026-10-08