RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory
Hongbo Mao, Junjun Jiang, Youyu Chen, Jiaxin Zhang, Zhemeng Dong, Xianming Liu
Harbin Institute of Technology
ECCV 2026
cs.CV
2026-09-20
哈工大给StreamVGGT做免训练token调控:首帧整段保留,中间层每帧只准入最显著的1%。RTX 3090上能跑千帧,长序列位姿和点云明显稳过固定预算基线。
VGGT 这类前馈重建模型(FFRM)一次看完全部帧,历史一长,KV 缓存就把显存撑爆。改成时序因果注意力之后可以一帧一帧推,但如果不加限制,历史 KV 仍然线性膨胀。
现有补丁分两派。隐式记忆把历史压进隐状态,容易灾难遗忘。显式记忆设一个固定 token 预算,小场景浪费、大场景不够,而且现在丢掉的 token 以后会不会突然变重要,没人能保证。ECCV 2026 这篇的观察是:一个 token 刚进场时的显著度,后面很长时间都还成立。
RegVGGT 是训练免费插件,接在 StreamVGGT 上,权重冻结。24 层按注意力形态拆开。
早期和晚期层(1–10、18–24)的注意力几乎跟 query 无关,像在对齐第一帧这个全局坐标系。这些层只永久保存第一帧的 KV,后面帧零更新。中间 7 层(11–17)是 query 相关、稀疏、带对角结构的几何层。这些层除了锚点帧,每帧每头只留显著度最高的 γ=1% token。
显著度按头独立算,避免多头平均把稀疏几何线索冲掉。为了省开销,当前帧 query 做 2×2 下采样再累加列注意力。FlashAttention 不物化完整注意力矩阵,论文用它缓存的 Log-Sum-Exp 统计量当场还原精确注意力分数,称为 LSE-Saliency。
记忆大小是 |M1|+(t-1)·⌊γN⌋,按极低斜率线性涨,不靠「场景有多大」去拍一个预算。对比时把基线的 token 预算对齐到 RegVGGT 实际保留量,比的是同样显存下谁选得更准。
全部在一块 RTX 3090(24 GB)上测。位姿看 TUM Dynamics 和 ScanNet,长度拉到 800/900/1000 帧。
| 1000 帧 | TUM ATE (m) | ScanNet ATE (m) | ScanNet RPE rot |
| Evict3R | 0.174 | 1.114 | 15.333 |
| InfiniteVGGT | 0.141 | 1.061 | 11.622 |
| XStreamVGGT | 0.174 | 1.054 | 11.182 |
| RegVGGT | 0.135 | 0.997 | 6.656 |
点云在 7-Scenes 和 NRGBD 上按 200/250/300 帧评 Accuracy。7-Scenes 300 帧,Evict3R 的 mean Acc 从 200 帧的 0.106 涨到 0.163,涨幅超过 50%;RegVGGT 从 0.036 到 0.038,几乎不动。Bonn 视频深度上,固定预算方法在短序列还能咬住,序列一长差距就拉开。
消融:去掉全局锚点,ScanNet ATE 从 0.165 升到 0.175。去掉分层策略,ATE 0.176。按头保留把额外延迟从 17.66 ms 打到 8.29 ms,主精度几乎不变。γ 低于 0.01 会把关键几何剪掉;大于 0.1 几乎不再涨点,只涨显存。跟未压缩骨干比,只能在 5–40 帧短序列上测,1% 保留的损失可以忽略。
消费级 24 GB 卡要跑「边走边重建」的长视频,这篇给出一个能落地的记忆策略:不要拍死预算,按帧准入,而且准入比例可以极端低。训练免费,改的是推理期的 KV 管理。固定预算那套(Evict3R 等)可以直接把预算模块换成这个 1% 调控,Bonn 上 Abs Rel 从 0.076 降到 0.069(500 帧)。
它不改网络、不重训,适合已经在跑 StreamVGGT 的人。大运动、低时序冗余时,论文自己也说要把 γ 放到 0.1。
层怎么切、γ=0.01,都是经验值,换骨干不一定还能 1% 过关。公平对比把基线预算抬到同一 token 数,赢的是「选哪些 token」,不是「用更少显存」。未压缩骨干只能在短序列对照,千帧上 1% 到底丢掉了哪些几何,没有直接金标。第一帧被当成永久锚点,开头如果是运动模糊或错误视角,后面会对齐到错误坐标系。大运动、1/100 抽帧时 1% 不够。记忆仍随时间线性涨,只是斜率很小,不是硬上限。