UniWAM 统一世界-动作模型登顶 LIBERO 等 benchmark,人类视频呈 log-linear 扩展趋势
LexiLove · x · 2026-10-05
港科大(广州)、OLA Dimensions、CMU 等机构发布 UniWAM(Unified World-Action Model),不再把「理解世界、预测下一步、执行动作」拆开,而是在单一架构里融合 VLM 物理推理器 + 视频世界模型 + 动作策略。
- 训练数据:机器人演示、人类第一人称视频、VQA 数据,并配了严格的数据清洗与标注管线
- 成绩:LIBERO 99.2%、LIBERO-Plus 92.6%、RoboTwin Clean2Rand 68.3%,多项 SOTA;真实世界演示涵盖任意抓取、双臂协作、长时程整理桌面等
- 最值得关注的发现:人类视频与机器人数据共训呈现 log-linear 扩展趋势,进一步佐证人类视频对机器人基础模型规模化很关键
论文、代码与 checkpoint 均已公开。
「具身」频道最新
- FailBank 把运行时安全反馈变成长期监督,VLA 成功率最多提 25.4 点 — notredame · 2026-10-05
- Reka 发布 Rho-1 研究预览:19B 全模态模型统一理解文本图像视频与机器人动作 — RekaAILabs · 2026-10-05
- NVIDIA ENPIRE:编码智能体真机自进化,灵巧操作成功率冲到99% — chris_j_paxton · 2026-10-05
- Sensori 演示人形机器人 Yuri:语音对话与 VR 外骨骼遥操作 — YuXiang_IRVL · 2026-10-05
- Berkeley EyeRobot 2.0:主动注视让机器人成功率从 52% 升到 67% — stepjamUK · 2026-10-05
- 仅 3.1 万参数 transformer 预测血糖:纯合成数据训练,零样本可用 — 0xdeadf1sh · 2026-10-05