

大语言模型(LLM)中最令人兴奋、也可能最具争议的现象之一,就是能力涌现。随着模型和数据集变得更大,一些能力——例如上下文学习和有效的思维链推理——只有达到特定规模后才开始出现。LLM 在规模扩大后可能涌现的能力之一,是通过组合性与泛化更有效地利用数据,并使用其他数据源,例如通过强化学习(RL)生成的合成数据。随着基础模型规模扩大,它们会成为通才,能够吸收多样的数据源,而较小的模型做不到这一点。本文将讨论我们近期的一些结果:当机器人训练数据量扩大时,从人类视频向机器人任务的迁移会在机器人基础模型中涌现。基于这一发现,我们开发了一种利用人类第一视角数据改进模型的方法,在机器人数据有限的任务上带来了约 2 倍的提升。
机器人中的涌现能力是什么样的?
现代视觉-语言-动作(VLA)模型,例如 π₀.₅,可以通过大规模、多样化的数据集训练实现广泛的开放世界泛化;这些数据集包含多种机器人以及来自网络的数据。随着规模扩大,这些模型是否会获得利用新数据源的涌现能力?
我们专门关注人类第一视角视频这一数据源,它可以通过可穿戴摄像头采集。这类数据易于记录,但将其用于训练机器人存在一个称为域差距(domain gap)的挑战:人类与机器人外观不同、运动方式不同,机器人无法直接模仿人类。近期研究通常需要某种人工对齐,例如遮挡图像中的部分区域,甚至使用生成模型将人手转换为机器人手。有些方法还尝试改变机器人硬件,使其更好地匹配人类动作,例如使用人形机器人。这些方法虽然可能有效,但在迁移能力上获得的收益往往以牺牲通用性为代价。我们想验证,仅仅扩大机器人基础模型的规模,是否就能在没有任何显式迁移学习机制的情况下,实现人到机器人的迁移能力涌现。
在第一个实验中,我们用人类数据对完整的 π₀.₅ 进行微调。我们采用一种简单的人类-机器人协同微调方案:将人类视频数据视为现有机器人 embodiment(具身形态)的一种,动作由三维手部位置给出,不使用任何特殊的迁移学习方法。我们将人类数据与最相关的机器人数据结合,在混合数据上进行微调,然后在只有人类示范展示过的具体场景中评估策略。例如,在按颜色分拣鸡蛋的任务中,机器人数据覆盖的是将鸡蛋放入蛋盒,而人类数据展示了如何将不同颜色的鸡蛋分拣到多个蛋盒中——这正是评估场景。同样,在整理梳妆台的任务中,机器人数据覆盖多样的卧室场景,而人类数据展示了如何在指定场景中整理目标梳妆台,并将物品放入合适的容器(例如把首饰放进首饰盒,把发圈放进收纳盒)。
图表:人类到机器人迁移在泛化任务上的性能。任务包括整理餐桌(Bussing)、香料整理(Spice)、梳妆台整理(Dresser)、鸡蛋分拣(Eggs)和平均值;对比 π₀.₅ 与 π₀.₅ + Ego(加入第一视角人类数据)。
令我们意外的是,这个简单方案确实效果很好:仅仅在微调中加入人类视频数据,就让策略在一组只有人类数据中出现的 4 个泛化场景上的性能提升了约 2 倍。令人惊讶的是,我们没有加入任何促进迁移的特殊机制。仅使用预训练的 π₀.₅ 模型并在这些数据上进行联合训练,就实现了人到机器人的迁移能力涌现。我们发现,同一方案还可以扩展到更多任务,例如整理工具箱和分拣水果:
但这为什么会奏效?预训练的 π₀.₅ 真的是实现这种涌现迁移的关键吗?我们希望更深入地研究这一结果,理解人类数据中的知识迁移究竟如何与机器人基础模型预训练所使用的机器人数据的多样性和规模相关。换句话说,从人类数据中有效学习的能力,是否会随着机器人基础模型预训练规模扩大而涌现?
为了回答这个问题,我们测量了机器人在人类数据所展示场景中的性能,并将其与不使用人类数据的策略进行比较。我们看到,加入人类数据所带来的性能提升,会随着预训练模型规模扩大而增加。
图表:人类数据带来的绝对性能提升与预训练多样性。横轴表示预训练多样性(0%、25%、50%、75%、100%、100% + Xemb),纵轴表示绝对性能提升;分别展示 Bussing、Spice、Dresser、Eggs 和 Aggregate(汇总)结果。
图表:按颜色分拣鸡蛋。横轴为预训练规模(0%、25%、50%、75%、100%、+Xemb),比较仅机器人微调与人类加机器人微调。
一个清晰的例子就是分拣鸡蛋任务:我们观察到,在不使用人类视频进行微调的模型中,扩大预训练规模在数据集达到约 60% 后便不再带来提升;但在使用人类视频微调时,性能仍会继续提升。这意味着,在预训练中加入更多机器人数据,实际上提高了模型在微调阶段吸收人类数据的能力!
为了更好地理解这一现象,我们可以检查模型用于表示人类示例和机器人示例图像的表征。下方展示了将模型特征投影到二维图中的可视化结果。对于预训练规模较小或完全没有预训练的模型(左图和中图),机器人数据与人类数据使用了非常不同的特征,说明模型没有成功对齐人类示例与机器人示例。但当我们扩大预训练数据集时,可以看到这些特征的排列明显更一致,表明人类-机器人对齐能力正在涌现。需要注意的是,预训练只使用机器人数据;人类数据仅在微调阶段出现,且在不同模型之间保持不变。人类-机器人对齐能力的涌现,完全来自其他任务的机器人数据在数量和多样性上的增加。
预训练多样性。我们对 VLA 的潜在 embedding(嵌入)进行可视化:对视觉语言模型(VLM)骨干网络最后一层的 token 做均值池化,再进行 t-SNE 分析。在没有预训练时,人类数据与机器人数据的表征明显彼此割裂;随着预训练变得更加多样,潜在表征的重叠增加,并且与泛化任务上的性能相关。图中区分静态机器人数据和静态人类数据,并展示 0% 预训练、50% 预训练以及 100% + Xemb 预训练。
下一代 VLA 将解锁什么?
我们关于人到机器人迁移能力涌现的发现,为扩大视觉-语言-动作模型的规模描绘了一个令人鼓舞的前景。这些结果表明,与大语言模型一样,扩大 VLA 的规模可能带来的不仅是更好的性能,还有新的能力。这些能力可以帮助模型利用此前难以使用的新数据源,并实现更有效的跨域迁移;反过来,这又能进一步推动机器人基础模型的规模化。有效利用人类视频可能只是众多此类能力中的一种。随着我们继续扩大机器人基础模型的规模,想象它们还会解锁哪些新能力,是一件令人兴奋的事。
如果你有兴趣开展合作,请与我们联系。我们尤其期待与正在扩大真实世界应用中机器人数据采集规模、并希望就自主性开展合作的公司合作。
我们也在招聘!如果你有兴趣加入我们,请与我们联系。
对我们的工作、合作或其他问题感兴趣的研究人员,请写信至 research@physicalintelligence.company。