仅54万参数机器人策略拿95%成功率,比π0.5少7700倍参数
ChongZzZhang · x · 2026-09-09
核心发现
论文提出 MINERVA——一组刻意做小的视觉运动策略,用来测 LIBERO 操作基准真正需要多少模型容量:
- 0.54M 参数即达到 95.1% 平均成功率(2000 次 rollout),仅比 LeRobot π0.5 低 2.4 分,参数量少 7700 倍;性能在 1M 参数附近饱和,低于 0.25M 崩溃。
- 跨架构/训练/推理的广泛扫描中,只有 action-chunk 长度和视觉容量稳定影响成绩;flow matching 相比直接 L1 回归无优势,且回归在 GPU 上快 3.8 倍。
- LIBERO 主要在考记忆:仅打乱 task-ID 映射就让成功率跌到接近随机,说明指令条件主要是在选已记住了的任务。
- 同配方在 89 个 LIBERO-90 任务达 94.6%,但 LIBERO-Plus 扰动下降至 46–56%,对光照变化几乎零鲁棒性。
- 0.54M 策略在笔记本 CPU 上每 chunk 5–9ms 重规划,比 SmolVLA 快 113 倍。
发帖人点评:在 open-vocab zero-shot 真正突破前,现有 VLA 其实都在勉强对齐基础表征——LIBERO 高分未必代表泛化操控能力。
所属事件:54万参数机器人策略达95%成功率(2 条相关)→
「具身」频道最新
- OpenWAM 开源模块化世界-动作模型,仿真与真机表现俱佳 — OpenWAM · 2026-09-09
- 家电巨头竞逐家庭人形管家:LG、海尔、美的、海信齐入局 — CyberRobooo · 2026-09-09
- 华为小米苹果 72 小时内同发折叠屏,107 只 A 股「折叠概念股」年均涨 110% — alysha_lobo · 2026-09-09
- 深度解析:人形机器人替代人类工人为何远比宣传来得慢 — jjvincent · 2026-09-09
- NVIDIA 开源 Alpamayo 2 Super 自动驾驶模型,9 月 9 日直播深潜 — PyTorch · 2026-09-09
- kornia-rs:Rust 低层 3D 视觉库,性能超 OpenCV 与 NVIDIA VPI — edgarriba · 2026-09-09