Skild 用自我博弈教人形机器人踢球,140 模拟年无人类示范

lukas_m_ziegler · x · 2026-09-29

Skild AI 用自我博弈(self-play)训练人形机器人踢足球,高级行为不依赖手工奖励和人类示范。

经过相当于 140 年的模拟自我对弈后,机器人自己学会了带球过人、护球和抢断,随后策略成功迁移到真实机器人上。

背后的逻辑:模仿学习把机器人的能力上限锁死在人类水平,而自我博弈正是 AlphaGo 击败人类的方法,Skild 认为这是通往物理 AGI 的路径。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →