Contrastive World Models:去像素重建,复杂视觉环境大幅超越 Dreamer
bonniesjli · x · 2026-09-26
作者 Bonnie Li 发布 arXiv 论文《Contrastive World Models》,提出在无像素重建的情况下学习潜在动态世界模型:
- 方法:基于 Dreamer 框架,把标准的观测重建目标替换为类似 Deep InfoMax 的下界,最大化状态-动作序列与未来观测局部 patch 特征之间的互信息,使状态表征只保留对预测未来有用的信息,无需重建视觉上无关的细节。
- 结果:在三个视觉复杂度递增的小规模实验中,默认设置下与 Dreamer 及动量预测基线持平;一旦引入干扰物或自然视频背景,则大幅超越两者。由于完全去掉像素解码器,训练也更高效。
- 意义:作者称是在角色转换之间独立完成、计算量很小的工作;对比式 infomax 目标是构建对视觉干扰因素鲁棒的世界模型的有原则方向,对把 model-based RL 智能体迁移到真实世界尤其相关。
所属事件:Contrastive World Models 不靠像素重建训练世界模型(3 条相关)→
「具身」频道最新
- 特斯拉 FSD 获准进入比利时, Belgium 数据称非高速风险低约 9.6 倍 — ElectricRaph · 2026-09-26
- 微软 Surface 高管访谈:押注 Arm 与骁龙如何重塑 Windows AI PC — BenBajarin · 2026-09-26
- 1-bit模型跑进智能眼镜:2B视觉模型仅0.43GB,速度翻倍 — lmoroney · 2026-09-26
- 马斯克预测 90% 概率的美好结局:人手机器人、全民高收入与极致丰裕 — XFreeze · 2026-09-26
- 从业者的顿悟:机器人做成 humanoid,是因为模型都在学人类干活的数据 — floguo · 2026-09-26
- Tesla 工人抵触训练 Optimus,Fremont 工厂已停产 Model S/X 转产机器人 — Ars Technica AI · 2026-09-26