SeeSE3 发现冻结视觉特征中涌现 3D 结构与位姿对齐
ducha_aiki · x · 2026-07-21
这条帖在介绍论文 SeeSE3: Emergence of 3D Space in Vision Features,核心问题是:冻结的视觉特征里,能不能直接读出 3D 空间结构和相机位姿信息。
文中给出的结论包括:
- 深度相关特征、DINO 系列特征与相机位姿存在对齐关系,head fine-tune 之后这种对齐更强。
- 在 ScanNet 上比较短/长距离空间拓扑时,DUST3R、MoGe 这类显式几何模型表现更高。
- 自监督模型里,DINO 家族编码器会涌现出空间拓扑;但 4DS、RVM 这类视频模型较难维持稳定的空间嵌入。
- 论文还测试了 Poincaré adapter:在不同帧间隔下,latent feature 的变化可以被线性映射到相机位姿变化。
作者在分析部分的判断很直接:一个静止观察者确实可以“发现空间”,但需要先把特征里的非线性扭曲解开。论文同时强调 probe 设计很重要;Lie algebra 线性化、Siamese 结构都比替代方案更有效,而全局可解码性则与特征流形的曲率有关。
「研究」频道最新
- 研究发现,结构集成比单一预测更能提升 TCR:pMHC 泛化 — quaidmorris · 2026-07-22
- 结构集合而非单一预测,支撑 TCR:pMHC 泛化 — quaidmorris · 2026-07-22
- 三维射线图把这个 Jacobian 反例画得极难读懂 — moultano · 2026-07-22
- Gary Marcus 警告:LLM 榜单正在把 harness 一起算进去 — GaryMarcus · 2026-07-22
- 新论文定义 self-state 攻击,四类 agent 记忆篡改 OS 无法区分 — Justgototheeffinmoon · 2026-07-22
- Krea 2 用户推荐双段 Clownshark 采样配置提升细节 — listopalafoto · 2026-07-22