StarVLA 开源 VLAct:16 张 GPU 训出 VLA 底座,20% 数据超 NVIDIA GR00T N1.6
机器之心 · wechat · 2026-09-06
StarVLA 团队发布面向 VLA 的 VLM 底座 VLAct,continued pre-training 仅用开源数据和 16 张 GPU:RoboTwin 2.0 成功率达 92.5%,RoboDojo 榜单超过所有 World Action Model,在从未见过的 GR-1 机器人上仅用 20% 下游数据即超过 NVIDIA GR00T N1.6 全量数据基线。模型、代码与 Pipeline 全部开源。
核心发现是一个反常识现象:单种 Action Head 下策略变强,不代表 Backbone 更通用——换用其他 Head 性能反而下降,论文称之为 head-specific representation collapse。VLAct 的应对:保护 VLM 原有视觉语言先验并混入 Caption 数据;同时挂 OFT、PI、GR00T 三种连续 Action Head 联合监督,训练后全部丢弃、下游重新初始化;只统一跨本体一致的 Action 维度。基于 Qwen3-VL-4B,主张表征质量应成为 VLA Scaling 中独立于数据规模的一条轴线。
「具身」频道最新
- 小米人形机器人进厂实训:66 自由度,插螺纹件成功率 98% — Olivier__OG · 2026-09-06
- 机器人版 GPT-3 时刻:看一遍演示就能学会新任务 — 量子位 · 2026-09-06
- ETH Zurich 开源 2026 机器人学习课:12 周覆盖 VLA 与基础模型 — Syntetisaattori · 2026-09-06
- Yacine 自制眼动追踪硬件:自写驱动提速,双摄像头横竖交叉锁定光点 — yacineMTB · 2026-09-06
- Show Lab 首投 CoRL 2026 三篇全中:MetaWAM 在 RoboCasa 达 68.9% 成功率、推理延迟降 39% — MikeShou1 · 2026-09-06
- NSF 投入 3000 万美元建人机协同适应研究中心,UT Austin 牵头 — PeterStone_TX · 2026-09-06