剑桥 S2PD 串并联混合扩散,让视频生成更守物理与逻辑规则
CambUni · hf · 2026-10-07
剑桥团队提出 Serial-to-Parallel Diffusion(S2PD),解决双向视频扩散模型即使在海量程序生成数据上训练仍违反物理定律和符号规则的问题。S2PD 在高噪声阶段做自回归扩散(提供协调相互依赖事件所需的串行计算、产出有效状态转移),低噪声阶段切换为并行扩散(联合精炼整段视频、比全串行更快)。实现了两种架构:从零训练的像素空间 DiT 和用 LoRA+因果注意力微调的预训练视频模型。在游戏、物理仿真和真实视频上,S2PD 比匹配的双向基线更守规则,时间稳定性和采样效率也优于其他串行方法。
所属事件:剑桥 S2PD 让视频扩散模型遵守物理规律(3 条相关)→
「多模态」频道最新
- LoCoSplat 去掉 3D 网络,前馈 3DGS 快 4.2 倍、显存省 6.7 倍 — zhenjun_zhao · 2026-10-08
- 同款4080生成15秒视频要90分钟,Reddit用户求解本地视频生成慢之谜 — redpandafire · 2026-10-08
- Nano Banana 2.1 图像能力引热议,实测效果惊艳 — miilesus · 2026-10-08
- 美团 LongCat-Avatar 开源:一张照片加音频生成数分钟对口型视频 — anthara_ai · 2026-10-08
- 用 Seedance 2.5 打造 AI 剧情片《BOTCHED: Christa Pike 的故事》 — AIandDesign · 2026-10-08
- 开源文生图新模型Kroma 0.3.1发布:Krea2微调Chroma数据集 — mikemend · 2026-10-08