Déjà View:循环Transformer多视图3D重建
rsasaki0109 · x · 2026-07-20
开源项目 DéjàView (DVLT) 发布,这是一种用于多视图 3D 重建的循环 Transformer 模型。
- 核心机制:通过循环共享的帧/全局注意力机制,结合离散深度索引,从无序图像集中生成逐像素的光线、深度、置信度和相机位姿。
- 推理优势:模型仅需训练一次,其细化步数在推理时可动态调整,能以极少的参数量媲美甚至超越更大的前馈基线模型。
- 代码库包含:DVLT 模型及四种消融配置、五个基线模型(如 VGGT、Depth-Anything-3 等)的评估封装、基于 accelerate + Hydra 的训练栈,以及 Stage-2 微调方案和可视化工具。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22