掩码几何编码器 MGE:随机丢帧+自蒸馏提升 3D 基础模型鲁棒性
zhenjun_zhao · x · 2026-10-08
arXiv 论文提出 Masked Geometric Encoder(MGE),改进 3D 基础模型的全对全全局注意力:训练时策略性地从全局注意力中丢弃帧 token,并从预训练的全上下文教师模型蒸馏,使模型学到更丰富的逐帧几何表示。效果:
- 在遮挡和「分身视图」(视觉相似但几何距离远的视图)场景下性能显著更强
- 标准基准性能不降
- 更丰富的帧表示使推理时的 token 合并更有效,配套 Anchor-Guided Adaptive token merging 技术,保留代表性锚点帧、合并冗余 token,降低二次复杂度瓶颈
「研究」频道最新
- 实验发现:更强模型写出的自动评测确实更靠谱 — danshipper · 2026-10-08
- 腾讯发布 WorkForge:可扩展合成可验证长程工作 Agent 训练环境 — teortaxesTex · 2026-10-08
- DensiTok:用流匹配补全未见视角的几何 token,即插即用增强 3DGS — zhenjun_zhao · 2026-10-08
- 水下 3D 重建新法:将平端口相机图像扭曲为针孔透视校正折射 — zhenjun_zhao · 2026-10-08
- MoSE3:追踪分支+可微 Horn 拟合,逐像素恢复世界坐标系 SE(3) — zhenjun_zhao · 2026-10-08
- Hierarchy-GBP:粗图抽象+恢复加速因子图推断,BA 全规模 SOTA — zhenjun_zhao · 2026-10-08