清华提出 ST-WAM,提升机器人视觉抗干扰能力
Tsinghua · hf · 2026-08-05
本文提出 Semantic-Temporal World Action Model (ST-WAM),以解决世界动作模型 (WAMs) 在视觉分布偏移下鲁棒性不足的问题。
- 解决痛点:针对模型在生成未来视觉预测时,容易产生“训练分布幻觉”(忽略当前场景而幻想出训练集内容)的现象。
- 核心架构:使用 DINOv3 作为共享语义表征,结合双空间未来专家 (DSFE) 预测未来特征,并通过当前锚定意图检索 (CAIR) 提取有效证据。
- 性能表现:在 LIBERO 和 RoboTwin 2.0 基准上分别达到 98.7% 和 92.8%。在零样本视觉偏移测试中,真实世界成功率从 25.8% 跃升至 61.5%。
「具身」频道最新
- 中国瓷砖机器人:将繁重工作变为可重复的精准操作 — TansuYegen · 2026-08-05
- 美国FCC禁止中国机器人和机器狗入境,AI竞赛转向实体 — SimplyAnnisa · 2026-08-05
- 机器人自主爬梯新突破,树立安全新基准 — TansuYegen · 2026-08-05
- 便携式 64 通道毫米波相机亮相,支持光子上转换 — jwt0625 · 2026-08-05
- 机器人能精准停手却看不懂全局进度?Gemini评测揭示隐患 — Crescitaly · 2026-08-05
- Unitree G1 机器人获统一 AI 大脑升级,感知与运动能力提升 — Scobleizer · 2026-08-05