剑桥 S2PD 论文:串行扩散让视频模型终于物理逻辑自洽
kastnerkyle · x · 2026-10-08
剑桥大学与 Toyota Motor Europe 研究者提出 S2PD(Serial-to-Parallel Diffusion),解决双向视频扩散模型即使在海量程序化生成数据上训练,仍违反物理定律和简单符号规则的问题。
核心方法
- 高噪声阶段用自回归扩散提供串行计算,协调相互依赖的事件并产生合法状态转移
- 低噪声阶段切换为并行扩散,联合精修全视频,采样时间远低于全串行生成
- 实现了两种架构:从零训练的像素空间 diffusion transformer,以及对预训练视频模型做 LoRA 微调加因果注意力
结果:在游戏、物理模拟和真实视频上,串行方法全面优于匹配的双向扩散基线,能从单张起始图生成多种合理续写,时间稳定性与采样效率也优于其他串行方法。
所属事件:剑桥 S2PD 让视频扩散模型遵守物理规律(3 条相关)→
「多模态」频道最新
- Epoch 报告:Q1 上线 12.8 万部微短剧,95% 以上由 AI 生成 — Jsevillamol · 2026-10-08
- LiveAvatar 一次上新 30 个数字人,每人 6 种情绪支持全身直播 — alifcoder · 2026-10-08
- 首部获 MPA 认证的 AI 长片定档院线,R 级并报名奥斯卡最佳动画 — emmanuelvivier · 2026-10-08
- 免费网页工具一键提取关键帧,解决 AI 动画角色闪烁问题 — QuietPound6205 · 2026-10-08
- Synthesia 推出 Syren:一条提示词生成全品牌一致视频,5 美元 5 分钟 — HeyToha · 2026-10-08
- QuiverAI 发布 Arrow 2:复杂插画精准生成且全要素可编辑矢量 — stuffyokodraws · 2026-10-08