过去几年,机器人已经取得长足进步:它们能够完成令人惊叹的杂技动作、在舞台上跳舞、遵循语言指令,并且正如我们自己的部分结果所示,能够完成折叠衣物或清理桌面等复杂任务。但机器人技术面临的最大挑战,并不是完成敏捷或灵巧动作,而是泛化:在新的环境或面对新的物体时,正确完成哪怕简单任务的能力。
想象一个需要打扫你家里的机器人:每个家庭都不同,物体不同,摆放位置也不同。泛化必须发生在多个层次。在低层次,机器人必须理解如何拿起勺子(握住勺柄)或盘子(抓住边缘),即使它此前从未见过这些具体的勺子或盘子,且它们还可能堆在一堆脏餐具中。在更高层次,机器人必须理解任务的语义——衣服和鞋子应该放在哪里(最好放进洗衣篮或衣柜,而不是床上),以及用什么工具擦拭洒出的液体。这种泛化既需要稳健的物理技能,也需要对环境的常识理解,从而同时在物理、视觉和语义层面实现泛化。机器人系统可用的多样化数据有限,使这件事更加困难。
这就是为什么大多数商用机器人都在工厂或仓库等严格受控的环境中运行:在一个机器人无需走出单栋建筑、物体及其位置都已预先确定的世界里,目前只能提供较弱泛化能力的机器人方法也能非常成功。近年展示的机器人敏捷性和灵巧性演示同样通常针对特定环境设计,且测试场景或与其非常相似的场景往往参与了数据采集。但如果我们希望机器人进入日常生活,在家庭、杂货店、办公室、医院和其他“杂乱”环境中工作,就需要强泛化能力。
我们一直在开发能够泛化到这类杂乱环境的机器人基础模型,并以视觉-语言-动作(VLA)模型 π₀ 为基础。π₀ 和其他近期 VLA 通常在与训练环境高度相似的环境中评估;而我们开发了一个称为 π₀.₅ 的新模型,它能够有意义地泛化到完全陌生的环境。我们认为,这是迈向真正可泛化物理智能的重要一步。当前模型远非完美:它的目标不是习得新技能或展现高超灵巧性,而是泛化到新的场景,例如在训练数据中未出现的新家中清理厨房或卧室。在实验中,π₀.₅ 可以在完全陌生的家中执行多种任务。它并不总能一次成功,但常常会展现出人类面对新挑战时可能具有的灵活性和随机应变能力。
π₀.₅ 执行的具体任务难度各异,从重新摆放物体(例如把餐具放进水槽),到使用海绵擦拭洒出液体等更复杂的行为。下面展示这些任务中较复杂的一些阶段,文章后面还会展示长时程行为的视频。
它是如何工作的?
π₀.₅ 的主要原则,是在异构数据上进行共同训练:通过在多种数据源上训练 VLA 模型,我们不仅能教会它执行多样的物理技能,还能教会它理解每项技能的语义背景(例如,如果任务是清理厨房,哪些物体适合拾取和收纳、应该放在哪里)、推断任务的高层结构(例如整理床铺需要哪些步骤),甚至将其他机器人的物理行为迁移过来(例如只有一条机械臂或没有移动底座的简单机器人,或在较不多样环境中采集的机器人数据)。
共同训练在概念上很直接:由于 VLA 源自通用视觉-语言模型(VLM),它们可以在由动作、图像、文本以及边界框等其他多模态标注任意组合构成的样本上训练。这包括图像描述、视觉问答、目标检测等通用多模态任务,也包括机器人演示(带有动作)以及“高层级”机器人样本,即带有适当语义行为标签的观测(例如,对未整理床铺的观测标注“拿起枕头”)。我们还加入“口头指令”演示:人通过自然语言逐步指导机器人完成复杂任务。模型会对下一步要执行的语义步骤作出高层推断(类似思维链推理),同时进行低层预测,输出机器人关节的运动指令。




虽然共同训练的基本原则并不新颖,但要训练出能够广泛泛化的 VLA,需要恰当的共同训练任务组合。就像人需要合适的课程来学习一份新工作的概念和实践方面一样,VLA 也需要由共同训练任务混合构成的“课程”,以便在所有必要的抽象层次上实现泛化。在实验中,我们训练了若干 π₀.₅ 版本,分别排除完整训练混合中的不同部分:“no WD”排除多模态 Web Data(问答、图像描述和目标检测),“no ME”排除使用非移动机器人采集的 Multiple Environment 数据(例如部署在许多其他家庭中的固定机器人),“no CE”排除作为原始 π₀ 训练集一部分采集的 Cross Embodiment 数据,“no ME or CE”则同时排除这两类机器人数据,只保留使用实验中同类机器人采集的移动操作数据(约 400 小时)。
我们评估了两种实验条件:完整清理任务,例如把餐具收进水槽,或清理卧室地板上的物品;以及分布外(OOD)评估,让机器人将提示中指定的物体放入抽屉。在两种评估中,我们都测量平均到各个子任务上的成功率(例如,物体被移动到正确位置的比例),以及语言跟随率,即机器人行为正确符合用户提示的案例比例。可以看到,在所有情况下,来自其他机器人的数据(ME 和 CE)都会显著影响策略性能。在 OOD 情况下,加入网络数据(WD)也会带来明显差异,大幅提升机器人正确识别数据中未出现的新物体类别的能力。更多实验细节请参阅配套论文。
为了更准确地量化 π₀.₅ 能达到何种程度的泛化,我们开展了扩展研究,改变训练数据中所见环境的数量。我们还加入一个基线模型进行比较:它除了其他所有数据源外,还直接使用测试环境的数据训练。这个模型在图中以水平绿色线表示,体现了如果消除泛化到新环境这一挑战,VLA 在该场景中能够达到的性能。
在与其他训练数据共同训练时,性能如何随训练环境数量扩展。当使用所有可用训练环境(图中最右侧)时,我们的模型(黄色)达到了与直接在测试环境上训练的基线(绿色)相近的性能。
这些结果不仅表明,π₀.₅ 的泛化性能会随着训练集中不同环境数量增加而稳步提升;还表明,仅使用约 100 个训练环境后,它的性能就已经接近直接在测试环境上训练的基线。这说明,我们的方案可以用相对容易获得的移动操作训练数据实现有效泛化。
训练与推理
π₀.₅ 基于 π₀ VLA,但由于它在要求输出多种标签类型(包括动作和文本)的任务上共同训练,我们可以用同一个模型在高层和低层控制机器人。运行 π₀.₅ 时,我们首先让它输出一个以文本表达的“高层”动作,然后让它通过选择合适的机器人电机指令来执行这个高层动作;该指令是由 50 步(1 秒)连续低层关节动作组成的“动作块”。这种方法遵循我们近期开发的 Hi Robot 系统,但高层决策和低层运动控制由同一个模型完成,形成一种“思维链”式过程。
模型本身同时包含离散自回归 token 解码和通过 flow matching 实现的连续解码,与 π₀ 相同。离散解码路径用于推断高层动作,连续 flow matching 路径用于生成低层运动指令,如下方示意图所示。
泛化到新家庭
我们让 π₀.₅ 控制移动操作机器人,清理训练数据中从未出现过的新家庭。对于 VLA 而言,这是极其困难的测试:尽管已经有令人印象深刻的 VLA 泛化演示,例如遵循新的语义指令、以交互方式遵循人类指令,以及串联不同的基本技能,但这些演示通常发生在与训练数据相同或非常相似的环境中。我们近期的 π₀-FAST 模型借助 DROID 设置泛化到了新环境,但任务相对简单,例如移动单个物体。我们的实验将配备 π₀.₅ 的机器人放入完全陌生的家庭中,要求它收好餐具、整理床铺,或清理卧室地板。这些都是长时程任务,不仅需要使用复杂行为(例如用海绵清理洒出的液体),还需要理解任务语义并将任务拆成多个部分,让每个阶段都与正确物体交互。下面展示 π₀.₅ 的示例评估。
模型在全新厨房和卧室中完成长时程任务的示例。
这些策略具有反应性,能够处理环境变化和外部扰动。在下面的视频中,我们测试了人类干预机器人时会发生什么。
最后,π₀.₅ 模型可以接受不同细致程度的语言指令,从“把餐具放进水槽”这样的高层提示,到指示模型拿起特定物体或朝特定方向移动的详细单条指令。下面展示一些语言跟随示例。
下面收录了我们严格实证评估的详细视频,其中包含模型成功和失败 episode 的示例。重要的是,与本页面所有视频一样,下面视频中的场景都不属于训练数据。所有实验的完整结果请参阅完整文章。
我们接下来要走向何方?
我们展示了 VLA 如何为复杂且延展时间较长的机器人技能带来广泛泛化能力,例如清理厨房或卧室。π₀.₅ 模型能够让机器人清理训练数据中从未出现过的新家庭。π₀.₅ 远非完美,在高层语义推断和运动指令方面都常常犯错。然而,通过让机器人从多种知识源中学习,我们希望 π₀.₅ 的方案能让我们更接近广泛可泛化、灵活的物理智能。还有许多工作要做:机器人虽然可以从口头反馈中改进,但未来也可以利用自主经验,在更少监督下变得更好;或者在陌生情况下主动请求帮助或建议。我们还需要在知识迁移方面继续努力,包括模型结构的技术细节,以及模型能够使用的数据源多样性。
如果你有兴趣开展合作,请联系我们。我们尤其期待与那些正在扩大真实世界机器人数据采集、并希望就自主性开展合作的公司合作。
我们也在招聘!如果你有兴趣加入我们,请联系我们。
对于关注我们工作、合作事宜或其他问题的研究人员,请写信至 research@physicalintelligence.company。