进化搜索优化机器人策略图,吞吐量提升 5.27 倍仅花 37 美元
matei_zaharia · x · 2026-09-28
作者 Karim 此前与 AMD 合著提出 Robotics Harness Optimization(RHO):用进化搜索优化以整个代码仓库形式存在的机器人策略,包括不含 LLM 的静态代码库和 Code-as-Policies 类含 LLM 的仓库。随后 NVIDIA 等提出 Graph-as-Policy(GaP,arXiv:2607.05369):人类编写技能节点(观察、感知、抓取、移动、释放等),LLM 只负责把节点连成有向计算图,「图即策略」。
博主尝试用 RHO 对 GaP 示例图跑 50 代进化搜索,结果:
- 相对基线吞吐量提升 5.27 倍
- 每次尝试的抓取数从 4.17 降到 1(更高效)
- 两次实验总搜索成本仅 37 美元
GaP 图策略的优势:策略是可读、可 diff 的源代码;失败可定位到具名阶段;编辑便宜、局部、可搜索,进化搜索可以提议「加节点」并打分,无需采集演示。Matei Zaharia 转发点赞了这项研究。
「具身」频道最新
- 把 1999 年《过山车大亨》搬上空间计算:体素重建+手势交互 — stspanho · 2026-09-28
- RoboSSM 用状态空间模型做上下文模仿学习,机器人测试时无需微调即可进步 — yifengzhu_ut · 2026-09-28
- 通用人形机器人有多远?行业分歧:action 数据才是真瓶颈 — Scobleizer · 2026-09-28
- 伯克利 TRACE:机器人双向追踪搞定数据中心同色线缆 — berkeley_ai · 2026-09-28
- macOS 27 测试版现触控调试地图,触屏 MacBook 传闻再添实证 — stephancasas · 2026-09-28
- IFR 报告:全球工厂在役机器人突破 500 万台,2026 年度报告发布 — Recoil42 · 2026-09-28