机器人行走实验加了新奖励,但仍有 80% 失败率
carlosdponx · x · 2026-08-04
作者在一个行走机器人/控制实验里做了几项改动:
- 改进了相对目标位置的观测方案
- 新增了奖励:朝向目标、贴近目标
- 用 SFT 先做了行走动作的预条件训练
他表示演示“有时看起来不错”,但其实仍有 80% 的失败率,大多数时候到不了目标。当前训练跑在 RTX 4090 上,这个模型一次只能放下 128 个并行环境,后面还会继续加实验和算力。
「具身」频道最新
- ScienceCorp 推出面向脑记录刺激的 Scifi 2 headstage — gottapatchemall · 2026-08-04
- FCC 拟禁新进口先进机器人,视频拆解政策细节 — carlosdponx · 2026-08-04
- 即时重推理与去插值让基线策略成功率从 76% 升到 88% — DominiqueCAPaul · 2026-08-04
- Seldon AI 联合创始人称机器人冲击就业会慢于模型自动化 — luke_drago_ · 2026-08-04
- 30 美元人形机器人上门清洁,Seldon AI 创始人称胜过 Roomba — luke_drago_ · 2026-08-04
- Aero Hand Open 以 314 美元发布开源灵巧机械手 — TinfoilTricorn · 2026-08-04