DroneWAM:JEPA 世界动作模型助无人机视觉导航,预测深度自适应省一半算力
Liang Yao · hf · 2026-09-29
DroneWAM 是面向无人机视觉导航的高效世界动作模型,让 agent 通过预测候选动作对未来的影响来决策。
- 采用 JEPA 架构在表征空间直接建模未来状态,避免显式生成未来图像的开销;预训练 Resampler 将密集编码特征压缩为更少 latent token,减少每个想象步骤的重复计算
- 自适应 rollout:偏好训练的 Gate 按场景自适应分配预测深度,平均预测深度从 8 降至 4.58 的同时轨迹精度还更高
- 配套发布 DroneNav-6D 仿真数据集,含同步 RGB 观测、6-DoF 飞行轨迹、控制指令和随机风扰动
在 DroneNav-6D 上取得对比方法中最佳的轨迹精度,代码与数据将开源。
「具身」频道最新
- 上海 AI Lab 发布 InfiniHand:第一视角视频流式 3D 手部追踪 — Shanghai-AI-Laboratory · 2026-09-29
- 探访 Dexory 工厂:机器人从研发到产线组装只需三步 — lukas_m_ziegler · 2026-09-29
- EgoDemo:面向具身 AI 的第一人称视频演示数据集上架 HF — LightwheelAI · 2026-09-29
- 曝 OpenAI「dot」设备新细节:举到耳边即可对话 ChatGPT 语音 — koltregaskes · 2026-09-29
- Uniformation S10 树脂 3D 打印机器人:打印、清洗、烘干全自动 — philfung · 2026-09-29
- REALM 生成反应式听者面部动作,已部署到 Ameca 人形机器人 — MacquarieUni · 2026-09-29