RACE:让VLA机器人动作块延长4倍,停顿时间缩短约5倍
POSTECH · hf · 2026-10-06
RACE:VLA 模型的可靠动作块延长方案
VLA(视觉-语言-动作)模型作为机器人操作的统一策略,推理开销大,导致机器人在策略调用之间必须暂停,走走停停、动作不流畅、任务耗时延长。延长动作块可减少调用次数,但预测越远长块执行越不可靠。
POSTECH 团队分析长块内的动作误差,发现误差集中在操作子技能的切换处,且随块长急剧增长——关键在于切换时机。
RACE(Reliable Action-Chunk Extension)框架:用一次辅助的单步去噪 pass 预测切换时机,并以此为条件生成动作,从而降低子技能切换处的误差,可靠执行更长的动作块。
结果:
- 仿真基准上优于同块长的微调方案;2 倍块长时成功率超过近期 SOTA 高效 VLA,4 倍块长仍有竞争力;
- 真机实验用 4 倍块长,将走走停停造成的空闲时间缩短约 5 倍,成功率还高于同块长微调。
代码与真机演示:github.com/Seonghoon-Yu/RACE-VLA
「具身」频道最新
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06
- 机器人加持篮筐弹板修正,新手也能百发百中投进三分 — TinfoilTricorn · 2026-10-06
- Xitac 触觉传感器:磁敏凝胶+3D 霍尔阵列捕捉手指力数据 — seanmcdonaldxyz · 2026-10-06
- ViDiHand:视频扩散模型逆袭,从第一视角视频重建 4D 双手动作 — ccloy · 2026-10-06
- InterMimicGen:人类动捕数据自进化飞轮,训练人形机器人全身操作 — Yucheng Zhang · 2026-10-06
- 旧金山公司办公室里人形机器人随意走动引围观 — tkexpress11 · 2026-10-06