专题 · FULL STORY

Figure Helix 2.5:零样本进驻 30 个真实家庭

Figure 于 9 月 18 日发布人形机器人基础模型 Helix 2.5,在旧金山湾区租下 30 套真实住宅测试,机器人零样本进入陌生家庭连续工作并完成约 56% 的家务,引发行业对具身智能泛化能力的关注。

2026-09-18 ~ 2026-09-22 · 2 集 · 31 条

第 1 集 · Figure 发布 Helix 2.5:零样本进 30 个陌生家庭干活 4 小时(2026-09-18,27 条)

Figure 于 09-18 发布通用人形机器人基础模型新版本 Helix 2.5,并放出配套演示:CEO Brett Adcock 公布机器人零样本连续工作约 4 小时的实录(后有 30 分钟浓缩版),场景是团队在湾区租下的 30 个从未见过的真实住宅。机器人抵达后不做任何额外训练、也未在这些环境或物品上采集数据,即直接开始执行整理客厅、叠毛巾、铺床、捡拾玩具等家务。核心量化结论是:Index 预训练使零样本全身行为成功率从 8% 跃升至 56%。

已确认

  • Helix 2.5 为 Figure 迄今最强的神经网络,也是首个基于 Index 平台训练的模型,用于 Figure 03 机器人;Index 数据引擎在拍摄时以每秒 35 分钟的速度产出训练数据(Figure 工程师 coreylynch 介绍)。
  • 模型可零样本执行三种全身行为,覆盖 30 个真实湾区家庭;这些家庭从未采集过训练数据,机器人完全依靠泛化能力应对陌生环境与物品,任务包括洗衣、整理床铺、叠毛巾、收拾客厅、捡拾地上玩具等。
  • 部署方式为「零样本进陌生家庭」:机器人到现场直接开工,不做现场微调;Brett Adcock 称泛化到未见环境是「机器人学的圣杯」,并表示 Helix 2.5 旨在回答「人形机器人能否进入从未见过的家庭、立即用全身自主开始工作」这一更难的问题。
  • 关键消融结果(coreylynch 多次强调为最重要的结论):同一模型、同一任务数据、同一评测下,不加 Index 预训练时零样本全身行为成功率仅 8%,加上后跃升至 56%;按严格口径(须完整完成整个任务)也实现数倍提升(rohanpaulai 转述官方口径为提升超过 6 倍)。大规模人类行为数据预训练是成功率提升的直接来源。
  • Index 展现出可预测的 scaling 信号:数据翻倍后 next-action prediction 的提升足够可预测,能在开训前把最大一次 run 的 loss 预测到小数点精度。
  • coreylynch 观看实机长时程任务演示后表示,当模型在主动感知和自我纠错上足够强时,「长时程」体验发生质变——模型会主动把任务做完。
  • 实录视频如实呈现了零样本技术在真实家居中哪些环节可行、哪些仍在挣扎;mhdfaran 等作者称赞这种公开真实表现的透明度值得业界效仿。

为什么重要

  • 零样本、无家庭数据的部署验证,是从实验室走向通用家庭机器人的关键一步;8%→56% 的消融结果与可预测的 scaling 曲线,为「靠数据规模扩展泛化能力」的路线提供了少见的量化证据。
  • 业内也有冷静声音:Waymo 研究负责人 mwulfmeier 转发时既给予极高评价,也指出此类系统尚不可部署;相关讨论强调长尾场景下的可靠性才是通用任务真正落地的挑战,单次演示的成功率并不等于产品化可用。也有乐观者如 Linus Ekenstam 大胆预测十年内家庭机器人或造就十万亿美元级公司,此类判断属个人观点。

还有 7 条相关讨论 →

第 2 集 · Figure 发布 Helix 2.5,零样本完成 56% 家务(2026-09-21,4 条)

Figure 发布其迄今最强的人形机器人神经网络系统 Helix 2.5,并在旧金山湾区租下 30 套真实住宅进行测试。机器人进入从未见过的家庭环境后,不做任何额外训练(零样本)即直接执行家务任务,端到端完成了 56% 的任务。作者认为人形机器人是「通用工人」的载体,能搬物、爬楼梯甚至开叉车,展示了具身智能走向通用家务劳动的可能。