StarVLA 提出表征中心训练:16 块 GPU 训 VLA,头部迁移提升 14 个百分点
jiqizhixin · x · 2026-09-16
机器之心介绍 StarVLA 团队的新方法 VLAct(论文《Beyond Data Scaling: Representation-Centric Continued Pre-training for VLAs》),主张 VLA 的提升来自更好的表征而非更多数据。
- 问题:机器人数据无法从互联网抓取,每条轨迹都要真机遥操作采集,「更多数据+更大模型」的语言模型 scaling law 在机器人领域撞墙。
- 方法:VLAct 用仅 16 块 GPU 和开源数据做继续预训练,核心是用 OFT(正交微调)头直接塑造主干网络的动作表征。
- 关键证据:同头性能不会自动跨头迁移——OFT 头性能从 61.7% 提升到 75.8%,但同一主干换成 PI 头后优势消失,说明改进确实发生在动作表征层面。
「具身」频道最新
- Uber 创始人 Kalanick:特斯拉是物理 AI 时代的「这个时代的谷歌」 — rohanpaul_ai · 2026-09-16
- 斯洛文尼亚副总理公开路段试乘特斯拉 FSD:不疲倦不瞌睡 — elonmusk · 2026-09-16
- DRS-VPT:单模型前馈实现图像到点云直接重定位 — kwangmoo_yi · 2026-09-16
- 仿生机器鸟 Robobirth 展示模拟自然飞行的机器人技术 — TinfoilTricorn · 2026-09-16
- 机器人灵巧操作的关键不是「全具身」,而是「对的双手」 — chris_j_paxton · 2026-09-16
- 李飞飞 World Labs 发布 Atlas:文图视频 3D 原生一体的世界模型 — YunzhuLiYZ · 2026-09-16