MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation
Zhijian Qiao, Xinjiang Wang, Jiajie Chen, Haoming Huang, Meng Li, Chih-Chung Chou, Jing Wang, Shaojie Shen
cs.CV, cs.RO
2026-09-01
MeRoPE把度量位移编进多频旋转相位,注意力logit不再随物理基线发散。nuScenes上CamMC为2.32,低于UCPE的2.45;PanShot关闭近深归一化时平移误差12.66,低于UCPE的17.91。
相机可控视频生成要把外参和每个 token 的视线写进注意力。GTA、PRoPE、UCPE 这类齐次射影编码把旋转和平移塞进同一个非正交 4×4 块。平移以内积形式进入分数,物理基线一拉长,logit 和特征范数一起涨,远处帧抢走注意力,近处共视反而被压下去。
想同时保住完整度量相对位姿、严格按 token 分解、以及保范,三者做不到。附录给出不可能性定理:连续有限维、按 token 分解的酉编码对度量平移是盲的。必须丢掉其中一条。这篇丢掉严格按 token 分解,改成按查询相机分组。
MeRoPE 把相对位姿拆成两段正交算子,再加一段视差先验。
视线局部坐标系用最小旋转(MinRot)把光轴转到标定后的单位视线。UCPE 的叉乘坐标系在垂直视场接近 180° 时退化,MinRot 只在正后方奇异。查询光线和键光线之间的相对旋转,以重复的 3×3 正交块直接和进注意力,范数严格不变。
度量平移不再做齐次加法。查询坐标系下的三维位移,按 xyz 三个轴分别编进对数间隔的多频旋转相位,每个频率是一个 2D 旋转。旋转是正交的,基线拉长只会让相位转得更快,不会把 logit 线性放大。
静态场景对应关系用球面上的视差锚点:键光线从无穷远扫到极点,在这段大圆弧上采有界的角视差分数,再把查询光线相对这些方向的 MinRot 写进注意力。它不把注意力限制在像素极线上,也不需要数据集相关的度量深度区间。退化情形(相机中心重合、极点与无穷远方向平行)把所有锚点塌回无穷远方向。
整段算子是视差 ⊕ 旋转 ⊕ 平移 ⊕ 骨干原生时空 RoPE 的直和,整体正交。接入预训练视频 DiT 时走 UCPE 式并行注意力分支,零初始化投影残差加回主干。
骨干统一为 Wan2.2 TI2V-5B,nuScenes 真车加 World Engine 合成轨迹共 347.7k 段,64 张 H20 训 20k step。评测从生成视频用 VGGT-Ω 抽位姿。
| 方法 | rot°↓ | tr%↓ | CamMC↓ | FID↓ |
| 无相机 PE | 5.57 | 5.94 | 7.96 | 21.06 |
| URoPE | 1.66 | 2.67 | 2.53 | 19.98 |
| UCPE | 1.39 | 2.95 | 2.45 | 20.20 |
| MeRoPE | 1.37 | 2.84 | 2.32 | 19.82 |
CamMC 是主指标,同时看旋转和平移轨迹。MeRoPE 最低,FVD 134.15 也是表内最低。URoPE 在 tr% 和 AUC 上更好,丢掉度量平移后 AUC 甚至可以更高,因为 AUC 只看平移方向不看幅度。
PanShot 覆盖针孔到鱼眼。关闭近深归一化、保留原始物理位移时,MeRoPE 平移误差 12.66、CamMC 15.56,UCPE 为 17.91 / 20.13。旋转上 UCPE 仍略好(4.40 vs 4.82)。查询相机分组有代价:单块 CamSA 延迟 12.47 ms 对 UCPE 的 5.03 ms,整模训练吞吐只掉 3.3%。
自动驾驶和仿真要按真实米制轨迹开车,不能先把位移归一化再生成。MeRoPE 证明度量平移可以进注意力,只要写成旋转相位而不是齐次加法。换编码、骨干冻结配方就能比,增益来自编码本身。对已有 DiT 是适配器,不是重训。平移控制的改善大于旋转,鱼眼和大基线场景更明显。
按查询相机分组放松了 token 级分解,单块显存大约是 UCPE 的 3 倍,融合成像核还没做。MinRot 在正后方奇异,后视相机要想一想。nuScenes 上 URoPE 的平移百分比和 AUC 仍更好,说明视差锚点补几何对应,补不齐所有方向指标。评测位姿来自 VGGT-Ω,生成质量和位姿提取器绑在一起。训练混了 244.1k 段合成轨迹,真实长尾运动覆盖仍有限。