齐次相机编码随基线发散,MeRoPE用正交旋转保住度量平移

MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation

Zhijian Qiao, Xinjiang Wang, Jiajie Chen, Haoming Huang, Meng Li, Chih-Chung Chou, Jing Wang, Shaojie Shen

cs.CV, cs.RO

2026-09-01

MeRoPE把度量位移编进多频旋转相位,注意力logit不再随物理基线发散。nuScenes上CamMC为2.32,低于UCPE的2.45;PanShot关闭近深归一化时平移误差12.66,低于UCPE的17.91。

这篇在解决什么

相机可控视频生成要把外参和每个 token 的视线写进注意力。GTA、PRoPE、UCPE 这类齐次射影编码把旋转和平移塞进同一个非正交 4×4 块。平移以内积形式进入分数,物理基线一拉长,logit 和特征范数一起涨,远处帧抢走注意力,近处共视反而被压下去。

想同时保住完整度量相对位姿、严格按 token 分解、以及保范,三者做不到。附录给出不可能性定理:连续有限维、按 token 分解的酉编码对度量平移是盲的。必须丢掉其中一条。这篇丢掉严格按 token 分解,改成按查询相机分组。

方法

MeRoPE 把相对位姿拆成两段正交算子,再加一段视差先验。

视线局部坐标系用最小旋转(MinRot)把光轴转到标定后的单位视线。UCPE 的叉乘坐标系在垂直视场接近 180° 时退化,MinRot 只在正后方奇异。查询光线和键光线之间的相对旋转,以重复的 3×3 正交块直接和进注意力,范数严格不变。

度量平移不再做齐次加法。查询坐标系下的三维位移,按 xyz 三个轴分别编进对数间隔的多频旋转相位,每个频率是一个 2D 旋转。旋转是正交的,基线拉长只会让相位转得更快,不会把 logit 线性放大。

静态场景对应关系用球面上的视差锚点:键光线从无穷远扫到极点,在这段大圆弧上采有界的角视差分数,再把查询光线相对这些方向的 MinRot 写进注意力。它不把注意力限制在像素极线上,也不需要数据集相关的度量深度区间。退化情形(相机中心重合、极点与无穷远方向平行)把所有锚点塌回无穷远方向。

整段算子是视差 ⊕ 旋转 ⊕ 平移 ⊕ 骨干原生时空 RoPE 的直和,整体正交。接入预训练视频 DiT 时走 UCPE 式并行注意力分支,零初始化投影残差加回主干。

结果

骨干统一为 Wan2.2 TI2V-5B,nuScenes 真车加 World Engine 合成轨迹共 347.7k 段,64 张 H20 训 20k step。评测从生成视频用 VGGT-Ω 抽位姿。

方法rot°↓tr%↓CamMC↓FID↓
无相机 PE5.575.947.9621.06
URoPE1.662.672.5319.98
UCPE1.392.952.4520.20
MeRoPE1.372.842.3219.82

CamMC 是主指标,同时看旋转和平移轨迹。MeRoPE 最低,FVD 134.15 也是表内最低。URoPE 在 tr% 和 AUC 上更好,丢掉度量平移后 AUC 甚至可以更高,因为 AUC 只看平移方向不看幅度。

PanShot 覆盖针孔到鱼眼。关闭近深归一化、保留原始物理位移时,MeRoPE 平移误差 12.66、CamMC 15.56,UCPE 为 17.91 / 20.13。旋转上 UCPE 仍略好(4.40 vs 4.82)。查询相机分组有代价:单块 CamSA 延迟 12.47 ms 对 UCPE 的 5.03 ms,整模训练吞吐只掉 3.3%。

为什么重要

自动驾驶和仿真要按真实米制轨迹开车,不能先把位移归一化再生成。MeRoPE 证明度量平移可以进注意力,只要写成旋转相位而不是齐次加法。换编码、骨干冻结配方就能比,增益来自编码本身。对已有 DiT 是适配器,不是重训。平移控制的改善大于旋转,鱼眼和大基线场景更明显。

局限与存疑

按查询相机分组放松了 token 级分解,单块显存大约是 UCPE 的 3 倍,融合成像核还没做。MinRot 在正后方奇异,后视相机要想一想。nuScenes 上 URoPE 的平移百分比和 AUC 仍更好,说明视差锚点补几何对应,补不齐所有方向指标。评测位姿来自 VGGT-Ω,生成质量和位姿提取器绑在一起。训练混了 244.1k 段合成轨迹,真实长尾运动覆盖仍有限。

术语

原文与代码

社区讨论

相关论文

全部论文解读