Figure 发布 Helix 2.5:人形机器人进 30 个从没去过的家,直接收拾客厅、铺床、叠毛巾

关键在 Index 人类经验数据:同样的机器人任务数据,先在 Index 上预训练的模型,在 30 个陌生家庭里完整做完 56% 的试验,不预训练的只有 8%。Figure 还测出一条“人类数据翻倍、机器人动作预测稳定变好”的缩放曲线。

Figure AI 发布了其机器人模型 Helix 2.5,这是它给人形机器人 Figure 03 用的控制模型。为了测试该模型的真实能力,Figure 在旧金山湾区租下 30 栋团队从没进过的房子,事先不在里面采集任何数据,让机器人直接进去收拾客厅、叠毛巾、铺床。

Helix 2.5 的主要能力特点

  • 进没去过的家直接干活:在 30 个没采过数据、团队也没进过的家里,用每家自己的沙发、床和台面,不针对现场做任何调整,完成收拾客厅、叠毛巾、铺床。
  • 一个基础模型,教出三种全身家务:三项任务都从同一个在 Index 上预训练的基础模型出发分别教会,要用到走动、抓取硬的玩具和软的毛巾被子、双手配合,以及边走边找东西看。
  • 全身一起动:在沙发与茶几之间、床与衣柜之间的窄处,边走边弯腰、换站位、绕着床操作,走路和动手不拆成两件事。
  • 会自己纠错:出错或够不着时,会退后一步重新站位、换个姿势,或者绕到床的另一边把被角拉好(Figure 的定性观察,没有给数字)。
  • 能力主要来自人类经验数据:模型从零开始、完全在 Figure 自己收集的人类经验数据 Index 上预训练。用同一份任务数据,有 Index 预训练的完整做完 56% 的试验,没有的只有 8%。
  • 教新任务更省数据:和一个有代表性的 Helix 02 任务相比,只用一半的任务数据就达到同样的成功率,而且是在 30 个陌生家庭里做到的。
  • 数据越多越好,而且能提前算出来:Index 数据每翻一倍,预测机器人下一步动作的误差就稳定下降一截,用前三档的结果就能算准第四档。

机器人走进陌生家庭,真正难在哪?

普通人走进一个陌生的家里,马上就能动手干活;我们对物理世界的理解可以从一个环境带到下一个环境,不需要因为床的高度不同就重新学铺床,也不用因为家具不同就重新学收拾屋子。但机器人目前做不到这一点,它们是一个地方一个地方学的。Figure 此前展示的 Helix 02 已经能协调全身完成长时间任务(例如洗碗机装卸,以及在物流任务中自主运行 200 小时),但那些数据都是在机器人实际要工作的地方采集的。

导致这一困境的关键在于数据。大语言模型之所以能取得突破,是因为结合了可扩展的预训练与海量数据和算力;但在机器人领域,并不存在互联网规模的数据可供直接学习。

Helix 2.5 想把大模型那套做法搬到人形机器人上:先用大量数据做通用预训练,再用少量数据教具体任务。它的预训练数据是 Figure 自己收集的人类经验数据 Index;三项家务再用机器人数据教会;然后不做任何调整,直接进没去过的家。

Figure 官方视频(约 6 分钟,英文讲解,中英双语字幕):CEO Brett Adcock 在一栋机器人没去过的房子里演示三项家务,AI 负责人 Corey Lynch 讲解 30 户测试、Index 和缩放定律

30 个陌生家庭的盲测现场:零样本到底测了什么

「零样本(zero-shot)」在这里有明确的范围。它不是说机器人没学过就会做一件新事。叠毛巾、铺床、捡玩具怎么做,是先用在别处采集的机器人任务数据教给模型的。零样本只指一件事:考试用的房子和物品,模型之前都没见过,到了现场也不做任何调整。具体来说:

  • Figure 租下了旧金山湾区的 30 栋房子做盲测(blind evaluation),团队此前从未进过这些房子,也没有在里面采集任何数据。
  • 评估用的玩具、毛巾与床品在所有实验开始前就单独留出,先由一个 AI 模型、再由人工复核,确认它们没有在任务数据里出现过。
  • 机器人直接使用每个家庭自带的沙发、床铺、折叠台面与光照环境;每项任务在 30 个家庭中使用的是同一个固定的模型版本(checkpoint),没有针对评估家庭或物品调整权重,也没有利用评估中的试验数据或表现来挑选模型版本。
三项任务的同步画面:左为收拾客厅,中为铺床,右为在厨房台面上叠毛巾

这三项任务合起来,要用到感知、走动、抓取操作、双手配合和全身控制,每一项即便在固定环境里都不容易。下表是原文给出的任务定义:

任务名称 目标物品 场景条件 初始状态干扰 判定合格标准
客厅收拾 (Living Room Tidy) 13 至 15 件形状、材质、刚度各异的小型手持玩具 目标住宅自带客厅,包括没见过的家具、地面铺装与光照 工作人员将物品随意抛撒在地板、沙发与茶几上 在全屋自主巡视搜寻,捡起全部物品并完整放回收纳篮
叠毛巾 (Towel Folding) 不同尺寸、颜色、厚度与触感的毛巾 住宅内任意折叠操作台面,高度与表面摩擦力不一 毛巾被随意揉团后扔在台面上 每条毛巾叠好并放进篮子(图表显示每次试验 4 条)
铺床 (Bed Making) 不同材质、重量与纹理的床罩、被子与枕头 住宅原有床铺,不同床架高度、床周边空间与照明条件 工作人员随手把两只枕头和被子弄乱 绕床走动,两只枕头归位床头三分之一区域,被面拉伸平整
工作人员在测试前随机抛撒玩具、掀乱被褥并揉乱毛巾,设定不受控的初始状态

评分只看整件事做没做完:不给部分分,一次试验必须把整项任务做完才算成功。评分细则还给每件物品设了时限:每件玩具限时 1 分钟,超时整次试验中止;每条毛巾限时 3 分钟,超时这条毛巾判失败(而整次成功要求所有毛巾都成功);每个枕头、被子每一侧限时 1 分钟,超时整次试验中止并判失败。如果出于安全需要人工介入,该次试验同样中止并判失败。


8% 到 56%:预训练带来的差距

这组成绩里,有多少来自 Index 预训练,有多少来自教任务的那份机器人数据?Figure 做了一组对照实验:构建两个结构完全相同的策略(policy,即根据机器人看到、感觉到的情况,决定它下一步怎么动的模型),用完全一样的任务数据和训练设置(超参数)。

两个模型唯一的区别是起点:一个是从随机权重直接开始训练的任务专用模型;另一个则是先在海量人类行为数据(Index)上完成预训练、再以相同流程微调得到的 Helix 2.5。Helix 2.5 自己也是从随机初始化开始、完全在 Index 上预训练的;上一代 Helix 02 则是从一个现成的、预训练好的视觉语言模型起步。所以这组对照比较的是「有没有 Index 预训练」,不是「有没有任何预训练」。

对照实验示意

两个模型只差起点:有没有先在 Index 上预训练

Helix 2.5

第 1 步 · 起点

从随机权重开始,先在 Index 人类经验数据上预训练

任何一项评估任务在 Index 里的占比都不超过 1.90%

对照组

第 1 步 · 起点

随机权重,没有 Index 预训练

第 2–4 步 · 两组完全相同
  1. 教任务:同一份机器人任务数据,在别处采集,不含评估用的家庭和物品
  2. 训练设置:模型结构、优化方法、超参数一致
  3. 考试:每项任务固定一个模型版本,进 30 个陌生家庭盲测,每项 140 次,不给部分分

完整做完237 / 42056%

完整做完35 / 4208%

次数取自原文 Figure 1 的三项合计;博文正文把对照组写成 9%,图中合计是 8%。

两组模型在同样的 30 个家庭里各做了 420 次试验(每项任务 140 次),按任务拆开是这样:

评测任务 不使用 Index 预训练(随机初始化) 使用 Index 预训练 (Helix 2.5) 倍数
折叠全部 4 条毛巾 12 / 140 次成功 (9%) 87 / 140 次成功 (62%) 约 7.3 倍
收拾全部 13-15 件玩具 7 / 140 次成功 (5%) 56 / 140 次成功 (40%) 8 倍
完整整理床铺(≥B级) 16 / 140 次成功 (11%) 94 / 140 次成功 (67%) 约 5.9 倍
三项任务合计 (Pooled) 35 / 420 次成功 (8.3%) 237 / 420 次成功 (56.4%) 约 6.8 倍

注:铺床任务的图表标签是「≥B」,附录则使用 Good / Bad / Fail 三档,两套标记没有给出对应关系。

三项合计的同分母结果是 35/420(约 8%)对 237/420(约 56%),相差约 6.8 倍。发布博文把起点写成 9%,但 9% 对应图中的叠毛巾单项(12/140);为了保持分母一致,下文使用三项合计的 8% 与 56%。

从各单项数据可以看出,收拾客厅的成功率(40%)明显低于铺床(67%)和叠毛巾(62%)。从评分规则推断,这可能和考核方式有关:收拾客厅要求把散落的 13 到 15 件物品全部找齐并放回收纳篮,每件限时 1 分钟,只要中途漏掉一件或抓取超时,整次试验就判为失败。而整体来看,用的是完全相同的任务数据,有没有经过 Index 预训练,三项任务的综合成功率相差了近 7 倍。

官方视频里所说的“30 个家庭每户都看到成功”,指的是每个家庭里至少有过成功尝试。它不是“每次都成功”:在两组共 840 次对照试验中,有 Index 预训练的 420 次试验完成率仍是 56%。

除了提升成功率,预训练还改变了教会新行为所需的数据量。Figure 报告的一组对比中,Helix 2.5 只用 Helix 02 一半的任务数据就达到相同成功率;Helix 02 在考试环境里采集数据,Helix 2.5 则直接进入 30 个陌生家庭。这组对比要表明的是:通用预训练可以减少每个新任务需要单独采集的机器人数据。


预训练用的 Index 是什么数据

大语言模型可以拿整个互联网的文字做预训练,机器人没有这样现成的数据。Figure 的思路是:人形机器人的身体在世界里移动的方式和人一样,所以它们也许能直接从人的经验里学。

Figure 为此构建了名为 Index 的数据收集网络,做法是推出一款手机 App,付费请个人创作者(Creators)录下自己在家里或工作中做事的视频。Figure 在不同时间公布的规模数据包括:

  • 规模:在官方视频中,团队提到每周有超过 9 万人贡献数据;而在 Helix 2.5 发布时,官方博文称 Index 每秒产生约 35 分钟新的人类经验。2026 年 8 月 25 日正式发布 Index 时,Figure 披露其 App 在 108 个国家累计下载超过 26.4 万次,截至当时已向创作者支付 1500 万美元。
  • 任务与场景覆盖:数据涵盖了家庭里的烹饪、清洁、洗衣、清理猫砂等日常家务,也有换机油、收拾餐厅桌子,以及在物流中心、餐厅、工厂和办公室等工作场所记录的操作。创作者在各自环境中录制,带来了不同的户型、光照、家具布局和操作习惯。

Figure 说明,预训练有意做得很广,以便后续能够微调出任意行为。按照其附录介绍的方法,团队把 Index 的每段视频做视频嵌入,再把视觉语言模型生成的活动与物体描述做文字嵌入,分别聚类成多层语义类别,统计各类别占总时长的比例。统计表明,三项评估任务中涉及的具体行为类别,在整个 Index 预训练数据集中的占比均未超过 1.90%。

这里真正被对照实验支持的是迁移效果:任务数据完全相同时,在大量人类经验上预训练的模型完成率更高。从现有方法描述还不足以复现人类视频如何转成机器人的训练信号;训练目标、人手动作与机器人动作的对应方法,以及模型的具体结构仍未展开。


人类数据翻一倍,机器人动作预测稳定变好

成功率之外,Figure 还给出了一条缩放定律(scaling law)。据 Figure 所知,这是第一次在人形机器人上测到「从人迁移到机器人」的缩放定律。

在大语言模型领域,缩放定律表明模型的预测损失(loss)会随着数据量与计算量的增加而平滑下降,从而让研究人员能够通过较小规模的训练运行,提前预测更大规模模型的表现。

Figure 提出了一个对应的问题:将人类经验迁移到人形机器人动作预测上,是否也存在类似的可预测规律?

为了验证这一点,Figure 固定模型规模和后面教任务的训练方式,只改变 Index 预训练数据的多少,分别用 1 倍、2 倍、4 倍、8 倍的 Index 数据训练了 4 个模型(小一档的数据都包含在大一档里)。这 4 个模型都用同一份任务数据微调,再在同一批留出来、不参与训练的数据上计算验证 loss(validation loss)。

这里的 loss 衡量什么? 在一批没有参与训练的机器人任务数据上,让模型预测「机器人下一步该怎么动」。模型预测的动作与数据里实际动作之间的差距,就是这里的 loss,差距越小说明动作预测越准。

结果很规整:人类数据每翻一倍,loss 就按差不多的幅度往下降一截。

根据图中的读数,预训练数据从 1 倍增加到 8 倍时,验证集 loss 从约 0.02897 逐步降至约 0.02789。只用前 3 个较小数据量(1×、2×、4×)的结果画出趋势线,团队在训练最大的 8× 模型之前,将测试 loss 预测到了小数点后第四位;预测误差仅占整个 8 倍数据变化范围的 0.54%。

换个角度看:这个 loss 本身在 0.028 左右,数据翻了 8 倍,它总共只降了约 0.0011(约 3.7%),预测误差只占这段变化的 0.54%——也就是说,规律曲线非常规整、高度可预测;但它衡量的是动作预测的误差,每一截的降幅本身并不大。

重绘原文 Figure 2

Index 数据每翻一倍,动作预测 loss 降一截

  • 四个模型的实测 loss
  • 只用 1×、2×、4× 三个点画出的延长线
人到机器人迁移缩放定律 横轴为 Index 预训练数据量 1 倍、2 倍、4 倍、8 倍,纵轴为验证 loss。四个点近似排成一条直线:约 0.02897、0.02861、0.02825、0.02789。只用前三个点画出的延长线,经过 8 倍那个点。 0.0290 0.0288 0.0286 0.0284 0.0282 0.0280 1× 2× 4× 8× Index 预训练数据量(相对最小一档)
纵轴只截取 0.0279 到 0.0290 这一小段,线看起来很陡,实际从 1× 到 8× 一共降了约 3.7%。四个点的数值是按原图读出的估算:1× 约 0.02897,2× 约 0.02861,4× 约 0.02825,8× 约 0.02789;原图每个点带误差线,这里省略。

这条曲线的用途,是在真正投入更大规模训练之前,预估“人类经验数据再翻一倍”能够降低多少动作预测误差。实验中只改变了 Index 数据量,模型规模和后续教任务的训练方式保持不变,所以曲线可用来做数据投入的规模预测。

这条曲线衡量的是“下一步动作预测得准不准”,不是“一次家务能不能完整做完”。它能帮团队估算追加预训练数据的收益,却不能单独回答机器人进入家庭后的完整任务成功率会提高多少。


为什么必须全身一起动

大多数关于机器人泛化的研究都是在为机器量身打造的环境中进行的:桌面机械臂在固定的工作空间内作业;轮式机器人则需要地面有足够的开阔空间供底座驶入和转身。普通家庭不会提供这些便利。人形机器人必须在狭小、杂乱的空间中移动身体,调整站位,才能看清、够到并操作物品。于是任务成了全身的问题:机器人可能要先走过去找到东西,再换个站姿去够它,看、走、拿这几件事没法分开解决。

传统机器人系统通常把走路和手上操作拆成两套独立的控制器,再用一套预设的切换规则(状态机)把它们串起来:走动、停下、站稳、伸手、抓取、再走动。在机器人控制领域,行业正在探索由统一神经网络直接调度全身(例如 Google DeepMind 的 Gemini Robotics 2)。Figure 自己此前发布的 Helix 02 也已经用一个神经网络控制全身;因此 Helix 2.5 的核心新突破不是「全身控制」本身,而是在从未见过的 30 个陌生家庭中,以零样本的方式做到了这一点:

四个家庭里,机器人在沙发与茶几之间、床与衣柜之间的窄处边走边操作

在这些未经改造的家庭环境中,三项任务都要求主动感知(Active Perception):机器人必须在房间内走动、调整身体位置和朝向,才能看清死角并够到物品。

主动感知:机器人在客厅与卧室中走动并俯身查看,搜寻散落物品

在长时间、多步骤的任务里,Helix 2.5 还展示了一项定性能力:全身自我纠错。遇到失误或动作受限时,机器人会退后重新调整站姿、换个角度,或者绕到床的另一边纠正被角。这些画面说明机器人出错后不会立即卡死;自我纠错的稳定性还需要通过多次任务统计。

全身纠错:原文说明这些画面里机器人退后、重新站位、在屋里走动,从失误中恢复并把长任务做完

这组实验最有价值的结论

Helix 2.5 真正推进的是机器人学习新任务的方式:先从大量人类操作视频里学会如何观察和行动,再用机器人任务数据教具体目标。三项任务使用完全相同的数据时,经过 Index 预训练的模型在陌生家庭里完成了 56% 的试验,没有预训练的模型只有约 8%。这说明预训练获得的经验确实迁移到了新的家具、物品和空间。

另一项信号是,Index 数据每翻一倍,动作预测误差都会稳定下降。这让 Figure 第一次可以估计继续增加人类经验数据会带来多少模型收益,也解释了为什么它把重点从“为每个场景重新采机器人数据”转向建设大规模人类经验数据集。

56% 仍然意味着近一半试验没有完整做完,而且测试只有三项家务,由 Figure 自己设计和评估。现有结果证明了预训练可以显著提高陌生环境中的任务成功率;距离机器人在普通家庭中长期、稳定地自主工作,还有不少能力和验证工作要补。