剑桥 S2PD 论文:高噪声阶段串行计算让视频扩散遵守物理规则
elliottszwu · x · 2026-10-07
剑桥大学与 Toyota Motor Europe 的研究者提出 S2PD(Serial-to-Parallel Diffusion),解决双向视频扩散模型即使在海量分布内数据上训练仍违反物理定律和简单符号规则的问题。
- 核心思路:在高噪声阶段执行自回归(串行)扩散,提供协调相互依赖事件、生成有效状态转移所需的串行计算;低噪声阶段切换为并行扩散,联合精修整段视频,采样时间也低于完全串行方法。
- 两种实现:从零训练的像素空间 diffusion transformer;以及对预训练视频模型做 LoRA 微调并引入因果注意力。
- 结果:在游戏、物理仿真和真实视频上,S2PD 比同等规模的双向基线更可靠地遵循规则,时间稳定性与采样效率也优于其他串行方法;同一张起始图可生成多种合理续写。
「多模态」频道最新
- 用低模 previz + 参考图生成完整赛车追逐成片的 Prompt 工作流 — Ror_Fly · 2026-10-07
- 班加罗尔学生单干训练 1B 世界模型:RTX 5090 实时跑、支持文字换景 — lucidml_lover · 2026-10-07
- 本地 Qwen 27B 复刻 Opus 代码渲染视频:离线产出 2 分钟讲解片 — yzjJosh · 2026-10-07
- 多图编辑竞技场上线:gpt-image-2.5 居首,44 模型逾 900 万票 — arena · 2026-10-07
- 图像输出 token 贵 60 倍:Gemini 生图计费的隐形成本账 — Atm1n9 · 2026-10-07
- Minimax 视频输出被吐槽太假:线条变粗、纹理被磨平 — maxiedaniels · 2026-10-07