Astribot 发布 Lumo-2 与真机演示
Astribot(星尘智能)在 WAIC 前夕发布第二代具身基座模型 Lumo-2,并同步推出智能体 AgentPhilia,配套公开 20+ 段真机视频。多条帖子将关注点放在它的建模路线:不是完整生成未来视频,而是先预测与任务相关的未来物理状态,再决定如何行动,这被认为更贴近机器人在真实物理世界中的执行需求。
模型设计与训练
据帖文转述,Lumo-2 是一个 4B 机器人基础模型,采用 latent world-action model,在潜空间中进行隐式预测推理,只建模对任务有用的变化,例如物体移动、接触变化或倒水结束等。为缓解单帧视觉的歧义,模型加入了短动作历史缓冲,用来判断当前处于任务的哪个阶段,再决定下一步动作。训练上,Lumo-2 分三阶段推进:先把视觉变化与机器人动作对应起来;再让动作编码通过视觉和语言获得语义;最后联合训练 VLM、视频和机器人数据,对齐动作、动力学、视觉与语言。
表现与推理效率
帖子称,Lumo-2 在多项 embodied reasoning 任务上明显超过 Lumo-1,同时在主要面向视觉语言基准的模型中仍保持竞争力。一个任务推理实验显示,只看第一帧时准确率为 43%;使用 5 个观测时提升到 94%;若只用“第一帧 + 紧凑隐式动态”,也可达到 90%,被用来说明隐藏状态保留了关键时序信息。推理侧,Lumo-2 采用 block-wise decoding,一次生成若干弱相关动作 token,而不是逐个生成 32 个动作 token;据帖文,在 1 张 NVIDIA RTX 5090 上可达到 7.7 Hz。
真机展示与外界评价
公开演示覆盖 22 项复杂家务能力,包括双机器人协作、煎蛋翻面、称重、清洗咖啡粉碗、磨豆、做咖啡、调酒、接住滚动的球、打蝴蝶结、拉拉链、叠衣服等。@CyberRobooo 认为,这批内容可算当前较强的公开真机演示之一,重点不只在动作执行,还在于对物理理解、时序推理与操作泛化能力的集中呈现。
2026-07-17 ~ 2026-07-18 · 10 条相关
一手来源
- 星尘智能发布Lumo-2 — 机器之心 ·
- Astribot发布Lumo-2机器人模型 — rohanpaul_ai ·
- Lumo-2用块解码提速推理 — rohanpaul_ai ·
- Lumo-2 展示 22 项家务能力 — CyberRobooo · 2026-07-17
- Lumo-2 的技术细节曝光 — CyberRobooo · 2026-07-17
- 【源头】星尘智能发布Lumo-2 — 机器之心 · 2026-07-17
- 【源头】Astribot发布Lumo-2机器人模型 — rohanpaul_ai · 2026-07-18
- Lumo-2用动作历史消除歧义 — rohanpaul_ai · 2026-07-18
- Lumo-2隐状态接近多帧观测 — rohanpaul_ai · 2026-07-18
- Lumo-2的三阶段训练法 — rohanpaul_ai · 2026-07-18
- 【源头】Lumo-2用块解码提速推理 — rohanpaul_ai · 2026-07-18
- Lumo-2强化具身推理泛化 — rohanpaul_ai · 2026-07-18
- Lumo-2具身推理大幅提升 — rohanpaul_ai · 2026-07-18