GRNEdit: Efficient General Video Editing from a New Binary-Evidence Perspective in Generative Refinement Networks
Feng Xie, Jiagao Hu, Fuhao Li, Zepeng Wang, Yuxuan Chen, Dahua Gao, Fei Wang, Daiguo Zhou
cs.CV
2026-08-17
把视频编辑化成二值码上的逐位保留/翻转决策,GRNEdit 用不到骨干 3% 的条件参数和 0.6M 样本训练,2B 版 OpenVE-Bench 4.03 分压过多款 14B 编辑器,8B 版 4.18 追平最强开源。
指令式视频编辑想用一句话统一各种操作:换风格、换背景、删人、改局部。现有方法的瓶颈在「怎么把源视频的信息喂给生成骨干」:ControlNet、VACE 这类设计要复制骨干的整块分支做条件,参数动辄数十亿;源 latent 拼接则把成本摊到推理上。骨干越大,这条条件通道越贵。小米 MiLM Plus 与西安电子科技大学的团队反过来问:内容合成留给骨干,轻量分支只负责判断「哪里要改、哪里别动」,行不行?
他们换掉了载体本身。GRN(Generative Refinement Network)既不走扩散也不走自回归:HBQ 分层二值量化把视频压成一叠 0/1 码,GRN 每一步全局随机精化整张码图,反复回访每个位置。关键观察是,源视频和目标视频过同一个 tokenizer 后,二值码坐标完全对齐,编辑于是变成每个坐标上「保留还是翻转」的二选一。源信息不再被回归成连续特征,只作为支持某个二值决策的证据,监督信号全部来自最终的 bit 似然,内容由骨干自己合成。
两阶段训练:
整个编辑器在骨干之外只加 37M(2B)/45M(8B)参数,不到骨干的 3%;训练只用 OpenVE-3M 里抽的任务均衡 0.6M 对样本,16 张 H200 跑 6 万步。
OpenVE-Bench(8 类编辑任务,VLM 打分,节选):
| 编辑器 | 条件参数 | 单条耗时 | 总分 |
| Runway Aleph(商用参考) | N/A | N/A | 4.49 |
| GRNEdit-8B | 45M | 84s | 4.18 |
| UniVideo 14B | >7B | 893s | 4.18 |
| Kiwi-Edit 8B | 3B | 45s | 4.17 |
| GRNEdit-2B | 37M | 39s | 4.03 |
| DITTO 14B | 3.17B | 611s | 3.44 |
| VACE 14B | 3.05B | 545s | 3.01 |
2B 版用 37M 条件参数压过两款 14B 编辑器,8B 版追平最强开源 UniVideo,单条推理 39/84 秒,明显低于 545 到 893 秒的 14B 竞品。分项上,开源阵营里背景替换(4.12)与局部删除(4.73)是 8B 版最强项,主体替换 4.86 也领先;弱项是加物体(3.86),低于 UniVideo 的 4.41。分布外用 ReCo-Bench 验证:Remove 四个分量全部第一(综合 7.99),Style 9.08 仅次于原方法 ReCo 的 9.17,但运动自然度与稳定度两个分量最佳。机制上也有支撑:保留位置的源响应强度是翻转位置的 6.2 倍;同样的证据式条件在 GRN 和 Infinity 两个二值骨干上都比 VACE 式分支收敛快、分支小约 100 倍,而在连续 latent 的 Wan 骨干上优劣反转,说明该机制确实绑定二值表示,不是换了名字的常规条件分支。
它给「条件分支要跟着骨干一起膨胀」的默认假设提供了一个反例:把控制问题降维成逐位二选一之后,约 2% 的参数就够了。对做视频编辑产品的团队,39 秒级的单条推理在交互场景里是可用档位。对研究方向,GRN、Infinity 这类二值生成骨干本来就在争夺主流量表的位置,这条路径让它们的可编辑性有了第一个像样的答案。
作者自己承认两条:加物体这类源视频里没有证据可依的编辑明显偏弱;方法依赖二值骨干,GRN 与 Infinity 之外不适用。此外 OpenVE-Bench 是 VLM 打分,作者也承认这类打分对未编辑区域的像素漂移不敏感,所以补了 PSNR 佐证;4.18 对 4.17 这种量级的差距在 VLM 打分下有没有统计意义,论文没有给显著性检验。训练与评测数据(OpenVE-3M、OpenVE-Bench、ReCo-Bench)同属一套合成指令数据生态,真实拍摄素材上的表现没有验证。「证据」这个命名偏营销,机制上就是把源条件变成对二值决策轴的偏置,可视化实验支持它有方向性,但换不换这个名字不影响实质。