Astra零微调当机械臂策略,RoboDojo成功率22.48%压过40家

An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond

Wenbo Zhang, Kaixuan Wang, Yutao Ouyang, Xiaoyu Huang, Liyang Li, Kailun Su, Weiyang Jin, Wenhao Chai, Haotian Liang, Zhiyang Dou, Yue Chen, Tianxing Chen

cs.CV

2026-09-21

把GPT-6 Astra当机械臂策略、零微调跑满RoboDojo 42任务2100次,平均成功率22.48%,超过全部40个公开策略;同接口下GPT-5.5仅0.88%,精密轴成功率只有4%。

这篇在解决什么

机器人操控默认拆两层。慢的那层用视觉语言模型想「做什么」,快的那层用预训练 VLA 或世界动作模型(WAM)在高频把关节指令打出去。SayCan、Inner Monologue、Code as Policies、VoxPoser、Hi Robot、Helix 都是这个结构。这篇问的是更硬的问题:把预训练运动策略拿掉,冻结的前沿 LLM 自己选可执行的运动目标,行不行。设定名叫 LLM as policy。

此前的证据撑不起这个判断。GPT-4 能吐末端轨迹,但靠外部检测和分割,只测了 30 个任务。Anthropic 在 LIBERO-40 上看到子目标在往前走,整任务成功率卡在 0% 到 5.5%。GPT-6 Astra 发布时有几份真机报告,任务集小、接口不统一,也没跟公开策略榜放在同一套协议下比。这篇把规则钉死成两条:控制通路里没有学过的策略;模型权重冻结,不做机器人或任务微调。评测主场是 RoboDojo 仿真:42 个任务、五条能力轴、每任务 50 条 episode,满配模型 2100 次试验,对照 2026 年 9 月 10 日快照上的 40 个公开策略。真机只当诊断材料。

方法

每回合模型必须调用 moveeef 或 giveup。moveeef 在世界坐标系里点名抓取点的位置、姿态、夹爪,可以只改一部分维度;两只胳膊一起写就是同步运动。没有 pick、place、pregrasp 这类会替模型做完半截任务的原语。后面的转换全是非学习的:合法性检查、抓取点到法兰位姿的几何换算、关节空间规划,再按 25 Hz 重采样执行。目标被拒就不动,模型对着同一帧观察重试;目标被接受才执行,下一帧带回到达误差。成功与否只由环境判定。

观察是三路 RGB(头、左右腕)、14 维抓取点状态、12 维只读关节角、剩余步数。图像只留最近两轮。Goal 消息里除官方指令外,还有从 RoboDojo wiki 抽出的任务配方:讲任务是什么、过程分怎么给,不给动作序列。系统提示里有任务无关的操作建议,包括用空闲腕部相机看工作区。每条 episode 默认 100 次模型调用,推理强度 medium。Astra 和 GPT-5.5 走满 50×42;DeepSeek-Flash 因成本每任务只跑 10 条,结果打 †。

结果

Astra 以 28.97 Score、22.48% 平均成功率排第 1(微平均 472/2100 成功,Score 28.72),高于全部 40 个公开策略。公开榜第一的 DM0.5 是 24.90 / 19.34,Astra 平均成功率高出 3.14 个百分点。同一套动作接口和后处理下,GPT-5.5 只有 1.13 / 0.88%,DeepSeek-Flash 2.99 / 1.92%。三个 LLM 之间大约 25 倍差。壳子不是决定因素。

模型Average Score / SROpen SRPrecision SR
GPT-6 Astra28.97 / 22.48%31.00%4.00%
DM0.524.90 / 19.34%2.08%16.75%
GalaxeaVLA (G0.5)20.23 / 14.88%1.58%20.42%
GPT-5.51.13 / 0.88%2.75%0.00%

领先几乎全靠 Open 和 Generalization。Open 轴 Astra 成功率 31.00%,DM0.5 只有 2.08%。Generalization 30.50% 对 10.95%。Memory、Precision、Long-Horizon 三条轴 Astra 都落后于 DM0.5:Precision 4.00% 对 16.75%,Long-Horizon 8.25% 对 19.50%,Memory 38.67% 对 47.44%。

任务级更极端。pushT、arrangelargestnumber 上 Astra 成功率 60%,公开策略最好分别只有 0.7% 和 4.7%。alignblocks、solveequation 是 50% 和 40%,公开策略是 0。反过来,makekong 上 GalaxeaVLA (G0.5) 90%、Astra 0%;buildtower 78.7% 对 2%;inserttubes 上 DM0.5 59.3%、Astra 0%。语义匹配、按语言分类它会。插管、搭塔、倒液体、双臂协调它不会。

一次演示没有帮忙。34 个任务、340 组匹配的任务-布局对上,零样本 22.9%(78/340);图像加末端位姿演示掉到 17.9%;纯文本演示 12.9%。演示几乎没在零样本全失败的任务上救回来,掉分来自原本会成功的任务。扰动实验挑了 8 个 Astra 无扰动就能过的 generalpickup 布局:上下翻转 8/8,左右镜像 6/8,去掉头相机 6/8,只留右腕相机 3/8,每次执行加约 10 cm 位姿抖动 3/8,笛卡尔轴取反 4/8。选中的轨迹里模型会换手、改方向。每格 8 个二值试验,分不出这是本来就稳、反复试,还是真在根据反馈改判断。

真机没跑完官方 RoboDojo-Real。模型反复发出物理上不合理、不安全的动作,损坏了设备,没有人员受伤,实验停了。留下来的 12 任务 33 次诊断试验,汇总 Score 6.97、成功率 3.03%,完整成功只有 stackbowls 一条。这批样本不能当真机成绩。桌面之外还有人形行走抓取录像,没有分数。另一组实验让同一个冻结模型写控制器弹钢琴:单手小星星 F1 0.907,双手 0.902(同设置下 RL 回放参考 0.886),肖邦夜曲片段 0.599。钢琴已经不是逐回合选目标,不算 LLM-as-policy。

为什么重要

对做 VLA 的人,数字很具体:在 RoboDojo 公开仿真榜上,一个冻结的通用 LLM 可以在语义、开放指令、部分泛化任务上压过现有预训练策略,而且不需要机器人数据微调。默认的「LLM 只规划、VLA 才执行」分层,这里被实证打出一个缺口。

缺口停在接触层。Precision 轴 4% 成功率、真机损坏设备、one-shot 演示还掉分,现在不能拿它替换 25 Hz 的运动策略。更接近能用的切分是:语言和图像条件任务交给这类模型;接触丰富、精密插入、动态抓取仍交给 VLA 或 WAM。接口本身也便宜,Cartesian 目标加几何 IK,没有再训一个动作头。

另一条更扎手:同样接口下 GPT-5.5 和 DeepSeek-Flash 几乎不会做。能力是模型特有的。「LLM as policy」不是任何前沿 API 接上就能继承的。

局限与存疑

论文自己把边界写清楚了。深度分析只覆盖 Astra 一个模型,主实验和 ICL 都是单 seed,三个模型撑不起「LLM 作为一类」的能力阈值。DeepSeek-Flash 每任务只有 10 条。LLM 多拿了 wiki 配方和过程分档,公开策略没有用同等文本重跑,输入信息不对齐。动作接口只有准静态末端目标,RGB 没有度量深度,Memory 轴还跟「只留两帧图像」绑在一起,分不清是模型不行还是接口天花板。

真机 33 次是安全叫停后的选择性样本,给不出可靠的真机估计。闭源模型有没有见过基准相关材料,论文标明未量化。扰动表每格 8 个二值试验,布局还是按无扰动成功挑的,无扰动那一行被构造在天花板上。one-shot 掉分可能是精度瓶颈,也可能是把示范布局的几何原样搬过来,实验没有拆开。主结论来自一个仿真器,官方真机协议没完成,排名和能力分裂有没有换仿真器、换真机还成立,这篇没有回答。

术语

原文与代码

社区讨论

相关论文

全部论文解读