进化搜索优化机器人策略图,吞吐量提升 5.27 倍仅花 37 美元

matei_zaharia · x · 2026-09-28

作者 Karim 此前与 AMD 合著提出 Robotics Harness Optimization(RHO):用进化搜索优化以整个代码仓库形式存在的机器人策略,包括不含 LLM 的静态代码库和 Code-as-Policies 类含 LLM 的仓库。随后 NVIDIA 等提出 Graph-as-Policy(GaP,arXiv:2607.05369):人类编写技能节点(观察、感知、抓取、移动、释放等),LLM 只负责把节点连成有向计算图,「图即策略」。

博主尝试用 RHO 对 GaP 示例图跑 50 代进化搜索,结果:

GaP 图策略的优势:策略是可读、可 diff 的源代码;失败可定位到具名阶段;编辑便宜、局部、可搜索,进化搜索可以提议「加节点」并打分,无需采集演示。Matei Zaharia 转发点赞了这项研究。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →