WOVEN:教会 MLLM 视觉状态转变推理,可跨任务迁移

mohitban47 · x · 2026-10-10

研究团队发布 WOVEN,探索面向多模态大模型的世界模型训练。将世界建模视为状态转移 p(s′|s,a),研究视觉转变推理:推断 (s,a,s′) 中未被观测的部分。核心发现:视觉转变推理是一种可教学的共享原语,约 2K 样本的子集即可在空间、物理、时序、具身等多种下游任务间迁移;有效迁移的关键是训练正确的推理操作,而非简单匹配场景、动作或领域。

所属事件:WOVEN 教 MLLM 视觉状态转移推理,跨任务泛化显著(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →