Komatsuzaki 实测机器人基准 Robobench:Astra 推理仅耗 100 token,开源模型差一大截
arankomatsuzaki · x · 2026-09-28
研究员 arankomatsuzaki 表示认同「现在是把开源模型用于机器人问题的绝佳窗口期」,并分享了自己在 Robobench 及相关任务上对比开源与闭源模型的结果,衡量其「监督/执行能力」以辅助 policy model:
- 最显著的差异除分数差距外是 Astra 的 token 效率:推理仅消耗约 100 token,而其他开源闭源模型即便调低推理档位也常耗 400-1000 token。
- 开源模型中 Qwen 3.8 27B 和 GLM 5.3 Flash 表现最好,在该基准上接近 Grok 和 Muse;hy-embodied-vlm-1.0 和 embodied r1.5 则明显更差。
他认为开源模型与新能力跃迁(如 Astra)之间的差距可能在未来几个月缩小,现在正是观察「物理智能前 LLM」能力爬坡的最佳时机。
所属事件:研究者称开源模型赶上机器人能力跳变窗口期就在当下(2 条相关)→
「具身」频道最新
- M5Stack 墨水屏变身星舰界面,每天播报冷笑话与家庭日程 — dsp_ · 2026-09-28
- 斯坦福给 Unitree G1 装上 OpenAI 模型大脑,零训练搞定陌生厨房 — alex_verem · 2026-09-28
- 纳米银线材料商华科创智:从触控大屏杀入机器人电子皮肤 — 创业邦 · 2026-09-28
- ETH Zurich 训练机器手用五指当腿爬行,可适应 14 种地面 — burny_tech · 2026-09-28
- 开发者为 OpenAI Dev Day 打造实体 Codex 宠物,已带上路去 SF — paw_lean · 2026-09-28
- 研究者热议 GPT-6 Astra:或胜过专用 VLA,训练成本也是关键信号 — YouJiacheng · 2026-09-28