ECCV 2026 论文:视频模型推理发生在去噪步骤而非帧间
liuziwei7 · x · 2026-08-28
ECCV 2026 录用论文《Demystifying Video Reasoning》挑战了现有认知。研究发现,扩散视频模型的推理能力并非如先前假设的那样在视频帧之间展开 (Chain-of-Frames),而是主要沿着扩散去噪步骤逐步进行。
核心发现:
- Chain-of-Steps (CoS):模型在早期去噪步骤探索多个候选解,并逐步收敛至最终答案。
- 工作记忆:支持需要一致性参考的任务(如物体永久性)。
- 自我修正:能够从错误的中间解中恢复。
- 感知先于行动:早期步骤建立语义基础,后期步骤进行结构化操作。
基于这些发现,论文提出了一个无需训练的集成方法 (TFE) 来增强推理能力。
「多模态」频道最新
- SpatialCrafter:单图生成可控 3D 场景视频 — kwangmoo_yi · 2026-08-28
- 实测腾讯 Hy4 图像生成:精细绘制盆景与光影 — vincent_koc · 2026-08-28
- Midjourney 提示词技巧:用“不完美”叙事渲染奢华余韵 — tisch_eins · 2026-08-28
- 开源图像/视频/音频生成工具 PotionUI 招募早期测试者 — 0roborus_ · 2026-08-28
- 用社区 LoRA 让 MiniMax 生成 Seedance 级打斗镜头 — Beginning-District69 · 2026-08-28
- ComfyUI 集成 Gemini Omni Flash 1.1,支持 4K 视频生成 — osanseviero · 2026-08-28