2026-09-05
顾岩、施冠亚、Sreenath 等在 Science Robotics 回顾人形控制:从经典模型方法到大规模仿真强化学习再到生成模型,并称之为物理引导的生成智能。本篇未取到全文。
人形机器人要在类人形态里复现人的敏捷、鲁棒和表达力,运动控制一直是卡点。过去十年这条线从工程稳定走到学习,再走到生成,文献散、术语乱,从业者很难判断下一阶段该把优化、学习和预测推理怎么接在一起。
Science Robotics 2026 年 8 月 19 日这一期发了综述《Evolution of humanoid locomotion control》,作者包括顾岩、施冠亚、Fan Shi、Ames、苏昊、Sreenath 等。Science 站点有付费墙和 Cloudflare 拦截,PDF 下下来是登录页,Unpaywall 也无开放版本。下面只根据摘要写,方法细节、引用清单和具体实验数字都在未取到的原文里。
这是综述,不是新算法。摘要给出的组织方式是三代控制范式加三条贯穿原则。
三代按时间排。经典基于模型的方法:显式动力学、简化模板(倒立摆一类)、轨迹优化和约束满足,稳定可分析,难覆盖杂乱地面和接触切换。大规模仿真驱动的强化学习:用并行仿真堆交互,策略直接输出关节指令,泛化靠随机化和课程,代价是可解释性和安全边界变糊。生成模型:学运动分布,再采样或引导出适应场景的全身行为,把「跟踪示范」推成「按目标合成」。
三条原则用来把三代钉在同一套判据上,而不是写成互不往来的技术史。物理建模:无论策略从哪来,最终都要落在可执行的动力学上。带约束的决策:接触、摩擦、关节限位、平衡是不能拿数据糊弄掉的可行域。对不确定性的适应:模型误差、感知噪声、外扰是落地时的日常,不是边角。
摘要把这三者的汇合点叫物理引导的生成智能:优化提供约束,学习提供覆盖,生成模型提供预测与采样。全文如何展开案例、如何划开「生成」和「模仿学习」,摘要里没有。
综述没有新的对照表。摘要给出的结论是定性的:人形控制处在转折点,正收束到上述统一范式;开放问题集中在安全、可及性和人类水平能力。可及性多半同时指开源硬件软件栈,以及把方法从少数实验室复现出去的成本。人类水平能力则是从能走、能抗扰,推到与人协作、在开放世界里当通才。
摘要里的那句收束值得留着:方向是从「工程出来的稳定」转到「智能自主」,给能安全运行、自然协作、在开放世界里延伸人能力的人形通才打地基。没有成功率、没有哪款机器人、没有哪篇工作被点名为拐点。那些数字如果存在,也在付费墙后面。
对做人形的人,这篇的用处是站位。实验室若还停在「再训一个更稳的走路策略」,综述的判断是下一段竞争在生成式全身行为,而且生成必须被物理约束住,不能只靠视频先验。安全、可及性、人类水平被并列成开放挑战,等于提醒:论文数字好看和能进工厂、进家庭,中间还有监管与复现成本。
因为没读到正文,不能根据这篇综述给具体技术选型。能确定的只有叙事本身:优化、RL、生成三条线在摘要里被写成正在汇合,不是互相替代。
最大的局限是获取:付费墙加反爬,本篇解读深度是摘要级,页面会挂「未取到全文」。综述本身还会带选择偏倚,摘要点了安全与可及性,但不等于正文对失败案例有同等篇幅。物理引导的生成智能还是一个纲领性标签,摘要没有给出可操作定义(例如必须含模型预测控制,还是只要生成后再做投影)。把通才人形写成「打地基」,时间表和可证伪指标都没有。读这篇综述需要原文,不能拿摘要当路线图。