RegVGGT:每帧仅留 1% token,消费级 GPU 跑长视频 3D 重建
zhenjun_zhao · x · 2026-09-22
哈工大团队的 ECCV 2026 论文 RegVGGT 针对流式长视频 3D 重建中前馈重建模型的显存困境:整段视频的推理上下文无法在有限 GPU 内存下保留。
- 核心观察:token 的初始显著性可可靠预测其在长流中的长期重要性
- 方法:免训练的 token 调控,每帧最多仅 1% token 进入上下文记忆更新,配合兼容 FlashAttention 的显著性估计
- 效果:消费级 GPU 上可处理数千帧,重建质量损失可忽略,在多类长程基准上大幅超越先前流式重建基线
「研究」频道最新
- 重磅RL报告发布:附9B蒸馏模型,7000个RL环境将开源 — tokenbender · 2026-09-22
- 小米 MoE RL 训练解读:专家教师比大混合 RL 更有效 — tokenbender · 2026-09-22
- MoE 强化学习稳定性新论文:router 感知的重要性采样重缩放 — tokenbender · 2026-09-22
- 不换 GRPO 只做改造:小米 MoE RL 稳定性改进全拆解 — tokenbender · 2026-09-22
- RL训练稳态秘诀:GRPO改造四板斧拆解 — tokenbender · 2026-09-22
- 热流学教授:OpenAI 的 Clay 问题解法不可物理复现 — GaryMarcus · 2026-09-22