WOVEN 论文:视觉转移推理可作共享原语,26 项基准提升 22 项
mohitban47 · x · 2026-10-10
新工作 WOVEN 研究多模态大模型(MLLM)的世界模型训练如何真正跨任务迁移。作者将世界建模视为状态转移 p(s′ | s, a),聚焦视觉转移推理:从 (s, a, s′) 中推断未观察到的部分,考察其能否作为共享的可教原语惠及多种下游任务。
核心发现:仅约 2K 规模的精选子集,就在 26 个下游基准中的 22 个上带来提升,最高涨 27.3 分;并提出以数据为中心的训练配方——按监督数据所教授的推理操作来筛选数据,以获得更好的下游收益。涵盖空间、物理、时间与具身推理等任务。
所属事件:WOVEN 教 MLLM 视觉状态转移推理,跨任务泛化显著(2 条相关)→
「研究」频道最新
- Kidger:模拟器+湿实验闭环已成蛋白质优化标准范式 — PatrickKidger · 2026-10-10
- Meta 论文挑战分词器默认:字节模型训练足够后反超 Token 模型 — alex_verem · 2026-10-10
- 研究者用 OSVerify 连续找出 OpenAI 两篇数学论文的实质错误 — WeijiaShi2 · 2026-10-10
- 双注意力定义不含因果掩码:判别式任务中双向注意力更强 — antoine_chaffin · 2026-10-10
- Lean 联合作者 Avigad 发文:数学家应主动拥抱 AI 而非抵御 — keviv9 · 2026-10-10
- Matthew Green 用 AI 量化人类密码分析投入:格问题已超椭圆曲线 1.7 倍 — matthew_d_green · 2026-10-10