UniVR:纯视觉推理新方法

ByteDance · hf · 2026-07-17

字节跳动提出 UniVR,探索如何只靠纯视觉演示学习更广泛的世界知识,并同时覆盖三类能力:

核心方法是 VR-GRPO:一种强化学习范式,结合全局奖励与步级奖励,用来约束推理过程中的逻辑一致性和物理一致性,而不依赖任务特定启发式或图文配对数据。

他们还构建了 VR-X 基准,汇集 16 个来源,覆盖长程操作、空间谜题和物理推理,是一个纯视觉协议下的综合评测套件。实验显示,UniVR 在 VR-X 上最高提升 25%,并且其更强的视觉推理能力也能反哺多个多模态理解基准。代码、数据和模型都已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →