RoMa-Ω 用 VGGT-Ω 替换 DINOv3 骨干,前馈 3D 模型暗藏匹配能力
zhenjun_zhao · x · 2026-09-11
新论文 RoMa-Ω 探讨「前馈 3D 重建模型对图像匹配到底知道多少」。
- 研究分析三种场景:patch 特征零样本匹配、3D 点预测直接匹配、以及在其表示之上训练完整匹配器
- 发现前馈重建模型(如 VGGT)零样本匹配表现差(尤其深层),但为线性探测和完整匹配管线提供了强表示;即使不训练,原始预测也能在中等视角变化与模态差异下取得有竞争力的匹配
- 据此作者用 VGGT-Ω 特征替换 RoMa v2 的 DINOv3 骨干并重训,得到 RoMa-Ω
所属事件:RoMa-Ω 用前馈 3D 模型特征刷新图像匹配纪录并开源(3 条相关)→
「研究」频道最新
- 递归去噪器研究:给扩散模型加隐状态,推理越久解越准 — burkov · 2026-09-11
- S2-Attention:用 Triton 内核让稀疏注意力真正跑出实测加速 — burkov · 2026-09-11
- 开发者提议建游戏 AI 持续锦标赛 benchmark 引labs互卷 — lucasmeijer · 2026-09-11
- DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型 — nrehiew_ · 2026-09-11
- TTS 基准改按可听见音频计时,Gradium 从 430ms 优化到 214ms — mattturck · 2026-09-11
- NVIDIA Nemotron 3 Embed 8B 登顶 Perplexity 新基准 Q2D-Web — JFPuget · 2026-09-11