ThinkV2V:先思考再编辑,5B 视频编辑模型在复杂指令上胜过 10B 基线
Donghao Zhou · hf · 2026-10-01
- 现有指令引导视频编辑方法多把 MLLM 仅当语义编码器,难以处理需要因果/语义推理的隐式编辑。ThinkV2V 提出先显式思考、再生成的框架。
- 架构基于 MLLM-to-DiT:将对源视频和指令的显式思考转化为精细的编辑条件信号;配套训练与推理配方:渐进课程训练(从基础编辑逐步到推理密集案例)+ 推理时思考扩展(迭代精炼候选 prompt 并选最可靠者)。
- 发布 ThinkV2V-150K 数据集与 ThinkV2V-Bench 评测基准;5B 规模 DiT 模型在复杂与标准编辑场景均大幅超过 10B 基线,取得 SOTA。
「多模态」频道最新
- Seedance 2.5 实测:动漫级双刀打斗搬进写实电影感 — SimplyAnnisa · 2026-10-01
- Midjourney --sref 3896456162 复刻 70 年代柯达胶片迪斯科质感 — michaelrabone · 2026-10-01
- LoRA 训练完成≠学到了风格:一套可复现的 SDXL 验证流程 — no3us · 2026-10-01
- 剪辑师开源 open-fusion-mcp:Claude 直接在达芬奇里做可编辑动效 — JohnnyLegion · 2026-10-01
- Raven Noire 边听哥特音乐边写日记的 AI 视频片段 — Street-Pound5762 · 2026-10-01
- 破解 MiniMax H3 VAE 细节上限失败,却意外产出 2X 细节增强方案 — NoMouse9610 · 2026-10-01