Figure 发布 Helix 2.5:30 套陌生住宅零样本完成 56% 家务
Figure 发布迄今最强的神经网络系统 Helix 2.5,并用少见的评测方式验证实战能力:在旧金山湾区租下 30 套真实出租住宅,让机器人进入从未见过、从未采集过数据的家庭环境,不做任何额外训练(零样本)直接执行家务。结果是使用 Index 预训练的模型端到端完成 56% 的任务,而从零训练的基线模型仅 9%,且预训练路径数据用量减少 50%。官方还公开了约 4 小时的完整测试视频。
已确认
- Helix 2.5 于 9 月下旬发布,在 30 个未见过的家庭中零样本成功率达 56%(@TansuYegen、@FinanceYF5)
- 测试环境为散落玩具、乱毛巾、未整理床铺等真实杂乱住宅,机器人无额外训练即开始工作(@lukasmziegler、@FinanceYF5)
- 团队公开约 4 小时完整测试视频(@FinanceYF5)
- 从零训练的对照模型成功率仅 9%,且预训练模型数据用量减少 50%(@TansuYegen、@lukasmziegler)
- @emmanuelvivier 补充,这一成绩相比此前约 9% 的水平是大幅提升,被视为家庭场景泛化能力的实质进展;同日 Google DeepMind 宣布成立新研究所,行业在机器人通用能力上的投入明显加码
为什么重要
- 这是人形机器人从固定场景演示走向陌生真实环境实际工作的标志性验证,测试用真实出租房而非实验室,说服力更强
- 56% 对 9% 的对比、且数据用量减半,说明基于人类行为数据预训练的 scaling 路线在机器人领域同样成立
- @thealexbanks 认为人形形态是「通用工人」的最佳载体——能搬物、爬楼梯、甚至开叉车,因为世界本就是按人体尺度为人类建造的,并以「你押注哪一边」向读者发问
2026-09-21 ~ 2026-09-22 · 7 条相关
一手来源
- Figure Helix 2.5 在 30 个陌生家庭零样本成功率达 56%,从零训练仅 9% — TansuYegen ·
- Figure 发布 Helix 2.5,租 30 套住宅零样本测家务 — FinanceYF5 ·
- Figure 发布 Helix 2.5,人形机器人零样本搞定 30 套陌生住宅 — FinanceYF5 ·
- Figure Helix 2.5 进30个陌生家庭,端到端完成56%家务 — thealexbanks · 2026-09-21
- Figure 发布 Helix 2.5,机器人零样本直入真实家庭做家务 — FinanceYF5 · 2026-09-22
- 【源头】Figure 发布 Helix 2.5,人形机器人零样本搞定 30 套陌生住宅 — FinanceYF5 · 2026-09-22
- 【源头】Figure Helix 2.5 在 30 个陌生家庭零样本成功率达 56%,从零训练仅 9% — TansuYegen · 2026-09-22
- Figure Helix 2.5 进驻 30 个陌生家庭,任务成功率 56% 远超从头训练 — lukas_m_ziegler · 2026-09-22
- Figure Helix 2.5 亮相:陌生住宅整理任务成功率从 9% 升至 56% — emmanuelvivier · 2026-09-22
另有 1 条近重复转述:FinanceYF5