自研模拟器78秒训练出可迁移强化学习运动策略
开发者展示了在自研模拟器 dingsim 上训练强化学习运动策略的成果,整个训练过程仅耗时78秒,策略表现出类似“利用机制”的快速移动行为。该策略随后成功迁移至 MuJoCo CPU 环境运行,验证了 sim-to-real 风格的跨模拟器迁移能力,也体现了 dingsim 极高的训练吞吐与仿真效率。
2026-08-30 ~ 2026-08-30 · 2 条相关
- 强化学习策略 78 秒训练并成功迁移至 Mujoco — yacineMTB · 2026-08-30
- 运动策略训练仅花 78 秒,自研模拟器速度惊人 — yacineMTB · 2026-08-30