PointWAM:3D 世界动作模型让灵巧操作超越 SOTA 达 11.7 点
Chunghyun Park · hf · 2026-10-06
Chunghyun Park 在 Hugging Face 发布 PointWAM(Point World Action Model),一种面向灵巧机械操作的 3D 世界动作模型。
- 核心思路:将世界分解为场景(环境)与手(执行者)两部分,在共享时空坐标系中以 3D 点轨迹联合预测两者演化,再把手部运动重定向为机器人动作,而非传统 RGB 帧/隐变量表示加末端位姿或关节角预测。
- 免标注预训练:显式解耦表示使其可在大规模人类示范视频上预训练,无需任务特定的物体或关键点标注。
- 关键数据:人类视频预训练平均提升 DexJoCo 成功率 56.9 个百分点;场景轨迹监督比仅预测手部再高 10.9 点;两者结合后,在十个 DexJoCo 任务上超越此前 SOTA 11.7 个百分点,并在真实机器人上优于强 VLA 基线。
「具身」频道最新
- 售价 $3500 低于零件成本,本地 AI 机被质疑商业模式不成立 — BLUECOW009 · 2026-10-06
- Waymo 第六代传感器套件原始激光雷达点云图曝光 — reed · 2026-10-06
- RT-SAFE 基准:8 个前沿 VLM 94.1% 到达目标,仅 0.7% 全程无安全事件 — Lianhuiq · 2026-10-06
- 「Vibe Robotics」基准:让前沿模型在物理仿真里造真机器人 — kaixhin · 2026-10-06
- JEPA-TTT:测试时持续训练让世界模型动力学偏移下误差降83% — JHU · 2026-10-06
- PRISM:4 段真实视频扩成 256 个反事实变体训练人形机器人策略 — berkeley_ai · 2026-10-06