LoG-VGGT:跨窗口注意力让长序列 3D 重建内存可控
zhenjun_zhao · x · 2026-09-22
论文 LoG-VGGT 提出面向长序列 3D 重建的内存高效框架,平衡局部时序建模与全局相机一致性。核心方法:不依赖全局注意力,在少数 transformer 层引入 cross-window attention,使信息在相邻时间窗口间传播同时保持内存有界;另设计全局相机一致性精炼模块,让 camera token 与紧凑 register token 通过 cross-attention 交互,施加场景级约束。实验显示该方法在多个长序列基准上提升深度精度与相机位姿鲁棒性,并具竞争力的流式重建表现。
「具身」频道最新
- Snap Specs 卖 2195 美元撞上 1999 美元折叠 iPhone,时机堪忧 — adariostrange · 2026-09-22
- 华为 MateBook Fold 实测:13 寸笔记本展开成 18 寸 3.3K OLED — anthara_ai · 2026-09-22
- 让两大前沿模型操纵真实机器人玩夺旗,Gemini 以 70% 胜率碾压对手 — chris_j_paxton · 2026-09-22
- 网友畅想 Ray-Ban 眼镜接入 Meta Muse:或成消费级 AI 最佳应用 — ChrisUniverse · 2026-09-22
- 约翰霍普金斯将在 IROS 2026 办可扩展触觉灵巧操作工作坊 — _krishna_murthy · 2026-09-22
- KAIST 提出无结构单目 VIO 初始化法 SLIM-init,入选 IROS 2026 — zhenjun_zhao · 2026-09-22