UniVR:纯视觉推理新方法
ByteDance · hf · 2026-07-17
字节跳动提出 UniVR,探索如何只靠纯视觉演示学习更广泛的世界知识,并同时覆盖三类能力:
- 复杂推理
- 细粒度物理动态建模
- 长期规划
核心方法是 VR-GRPO:一种强化学习范式,结合全局奖励与步级奖励,用来约束推理过程中的逻辑一致性和物理一致性,而不依赖任务特定启发式或图文配对数据。
他们还构建了 VR-X 基准,汇集 16 个来源,覆盖长程操作、空间谜题和物理推理,是一个纯视觉协议下的综合评测套件。实验显示,UniVR 在 VR-X 上最高提升 25%,并且其更强的视觉推理能力也能反哺多个多模态理解基准。代码、数据和模型都已开源。
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11