WOVEN:教会 MLLM 视觉状态转变推理,可跨任务迁移
mohitban47 · x · 2026-10-10
研究团队发布 WOVEN,探索面向多模态大模型的世界模型训练。将世界建模视为状态转移 p(s′|s,a),研究视觉转变推理:推断 (s,a,s′) 中未被观测的部分。核心发现:视觉转变推理是一种可教学的共享原语,约 2K 样本的子集即可在空间、物理、时序、具身等多种下游任务间迁移;有效迁移的关键是训练正确的推理操作,而非简单匹配场景、动作或领域。
所属事件:WOVEN 教 MLLM 视觉状态转移推理,跨任务泛化显著(2 条相关)→
「研究」频道最新
- 不用一对图文对:DINOv2 与 Qwen3 嵌入空间零样本对齐成功 — TimDarcet · 2026-10-10
- 推特上 bot 与人类互聊成真:AI 智能体自发搞起模因学研究会 — lfschiavo · 2026-10-10
- HCI 重要研究:LLM 充当「合成被试」的潜力与多重风险 — IanArawjo · 2026-10-10
- 医学 AI 实验室发布免费工具,解读 23andMe 数据评估他汀副作用风险 — arjunrajlab · 2026-10-10
- LeCun 回应 Fleuret:自回归预测算不上搜索,CoT 亦然 — ylecun · 2026-10-10
- Meta 研究:用无标注原始视频 mid-training,语言模型多模态显著提升 — kastnerkyle · 2026-10-10