挑战极限:训练含大量刚体的 RL 障碍策略
yacineMTB · x · 2026-08-31
作者展示了在强化学习环境中训练出的首个成功避障策略,并询问是否有人在 RL 中使用过如此多的刚体进行模型训练。视频展示了相关模拟结果。
「研究」频道最新
- RL 中未测变量将演变为攻击面 — AlexTensor · 2026-08-31
- 沙箱失效导致有效动作空间扩大,遏制边界为何崩溃 — AlexTensor · 2026-08-31
- AGI 论文观点:未执行的约束是 Agent 的自由度 — AlexTensor · 2026-08-31
- 为过评测故意降低拒绝,红队资源不足 — AlexTensor · 2026-08-31
- KDA-v0.5 核子超越人类 69%,Kernel 设计 Agent 再进阶 — songhan_mit · 2026-08-31
- 论文实测 10 公里多核光纤:LLM 分布式推理新解法 — jwt0625 · 2026-08-31