我们正身处一场 AI 革命:过去十年见证了实用的 AI 助手、能够生成逼真图像和视频的 AI 系统,甚至还有可以预测蛋白质结构的模型。然而,尽管取得了这些进展,在物理世界方面,人类智能仍远远超过 AI。借用莫拉维克悖论的说法,下棋或发现一种新药对 AI 来说是“容易”的问题,而叠一件衬衫或清理一张桌子,却需要解决人类构想过的一些最困难的工程问题。要构建具有人类那种身处物理环境中的灵活能力的 AI 系统,我们需要一种新方法——让 AI 系统具身化,使它们能够获得物理智能。
在过去八个月里,我们开发了一个通用机器人基础模型,称为 π₀(pi-zero)。我们相信,这是实现长期目标——发展人工物理智能——的第一步,使用户可以像向 LLM 和聊天机器人助手提问一样,直接要求机器人完成任何想做的任务。和 LLM 一样,我们的模型在广泛而多样的数据上训练,能够遵循各种文本指令。不同之处在于,它同时处理图像、文本和动作,并通过机器人具身经验训练获得物理智能,借助一种新颖架构直接输出低层电机命令。它可以控制多种不同机器人,也可以通过 prompt 执行目标任务,或通过微调专门解决具有挑战性的应用场景。关于这项工作的扩展文章可在论文中找到。
通用机器人策略的潜力
今天的机器人都是狭窄领域的专家。工业机器人被编程为在编排好的环境中重复运动,例如在装配线上反复把同一个焊点焊在同一个位置,或把同一种物品放进同一个箱子。即使这些简单行为也需要大量人工工程设计;而在家庭等杂乱的真实环境中,更复杂的行为根本无法实现。AI 可以改变这一点,让机器人学习并遵循用户指令:编写新行为可以简单到只需告诉机器人要做什么,机器人自己就能想办法根据环境调整行为。但这需要数据。语言模型和其他基础模型从网络中挖掘数据,利用了可获得文档中的很大一部分。机器人数据却没有这样的宝藏;因此,要让机器人学习一项新技能,就必须针对特定机器人和特定应用采集大量数据。
如果我们能训练一个通用机器人策略,让它执行广泛技能并控制广泛机器人,就能克服这个挑战:模型只需从每个机器人和每个应用获得少量数据。正如人可以借助一生积累的经验快速学习新技能,这样的通用机器人策略也能只用适量数据适配新任务。通用模型击败某个专家模型、甚至在专家模型自己的任务上胜出,并不是第一次发生:语言模型正是因为拥有多样而通用的预训练,能够更好地解决下游专业任务,才取代了许多更专门的语言处理系统。同样,LLM 为语言提供基础模型,这些通用机器人策略将为物理智能提供机器人基础模型。
要实现这一目标,我们还需要解决重大的技术挑战。我们的第一步是 π₀:一个将大规模多任务、多机器人数据采集与新网络架构结合起来的原型模型,使其成为迄今能力最强、最灵巧的通用机器人策略。我们相信,这只是开发真正通用机器人模型的早期小步,但它令人振奋,也让我们得以一窥未来。
跨具身训练混合数据
π₀将互联网规模的视觉-语言预训练、开源机器人操作数据集,以及我们在 8 种不同机器人上采集的灵巧任务数据集作为输入。
输入
- Open X-Embodiment 数据集。
- 互联网规模预训练。
- π 数据集:多种灵巧机器人。
模型
模型随后可以通过直接 prompt 或微调,执行广泛的任务。
输出
- 洗衣。
- 叠衣服。
- 冲咖啡。
- 装杂货。
- 收拾桌面。
- 打开爆米花包装。
- 以及更多任务。
我们的第一个原型通用机器人策略在迄今最大的机器人交互数据集上训练。完整训练混合数据既包括开源数据,也包括我们在 8 种不同机器人上采集的大型、多样化灵巧任务数据集。
我们的数据集包含多样任务;每项任务都展现出丰富的运动原语、各种物体和不同场景。
该数据集中的任务锻炼了机器人灵巧性的不同维度,同时覆盖机器人可能被要求执行的真实任务范围,包括收拾餐具、把物品装入信封、折叠衣物、整理线缆、组装箱子、插入电源插头、把食物装进外带盒,以及捡起并扔掉垃圾。选择这些任务的目标不是解决某个特定应用,而是开始让模型获得对物理交互的通用理解,为物理智能打下初步基础。
继承互联网规模的语义理解
除了在多种机器人上训练,π₀还通过从预训练视觉-语言模型(VLM)出发,继承了互联网规模预训练中的语义知识和视觉理解能力。VLM 在网络文本和图像上训练,常见 VLM 包括 GPT-4V 和 Gemini。我们使用一个较小的、拥有 30 亿参数的 VLM 作为起点,并将其适配到实时灵巧机器人控制。
VLM 能够有效迁移来自网络的语义知识,但它们只接受输出离散语言 token 的训练。灵巧机器人操作要求 π₀以高频率输出电机命令,最高每秒 50 次。为提供这种灵巧程度,我们开发了一种新方法,通过 flow matching(扩散模型的一种变体)为预训练 VLM 增加连续动作输出。从多样机器人数据和在互联网规模数据上预训练的 VLM 出发,我们训练视觉-语言-动作 flow matching 模型,然后在高质量机器人数据上进行后训练,以解决一系列下游任务。
灵巧操作的后训练
更复杂、更灵巧的任务可能要求对模型进行微调,使其专门应对下游挑战。用高质量数据针对具有挑战性的任务(例如折叠衣物)微调模型,类似于 LLM 设计者采用的后训练过程。预训练教会模型物理世界知识,而微调则迫使它把某项特定任务做好。下面看看这些任务。
后训练后,机器人能够从烘干机中取出衣物,将衣物带到桌边,并把它们折叠成一摞。视频未经剪辑,由单个策略完全自主运行。
洗衣。我们对 π₀进行微调,让它使用移动机器人或固定的双臂来折叠衣物,目标是把衣物叠成整齐的一摞。对机器人(以及一些人类)来说,这项任务极其困难:一件平铺在桌上的 T 恤有时可以通过重复一组预先编写的动作来折叠,但一堆纠缠的衣物可能以许多不同方式皱成一团,因此不能只让手臂重复同一套动作。据我们所知,此前还没有机器人系统被展示出能够以如此复杂的程度完成这项任务。
值得注意的是,通过在多样化数据上训练,我们发现机器人能够在有人以多种方式介入时恢复任务。
收拾桌面。我们还对模型进行微调,让它收拾桌面。这要求机器人捡起桌上的餐具和垃圾,将餐具、刀叉或杯子放入收餐箱,把垃圾放入垃圾桶。这项任务要求机器人处理种类繁多的物品。在大型、多样数据上训练 π₀带来的一个令人兴奋的结果,是机器人涌现出了多种策略:模型不必依次抓取每件物品,而是可以把多个盘子叠起来,一起放入收餐箱;也可以先把盘子上的垃圾抖进垃圾桶,再将盘子放入收餐箱。
组装箱子。机器人需要拿起一个压平的纸箱,把它组装起来:折叠侧面,再把箱盖折片塞进去。这非常困难,因为每一次折叠和塞入都可能以意想不到的方式失败,机器人需要观察进展并随时调整。它还需要用双臂支撑箱子,甚至借助桌面,以免半折叠的箱子散开。
将 π₀与已有模型进行评估和比较
我们在这些任务上将 π₀与学术文献中提出的其他机器人基础模型进行了比较:OpenVLA——一个使用离散动作、拥有 70 亿参数的 VLA 模型;以及 Octo——一个使用扩散输出、拥有 9300 万参数的模型。这些任务相比学术实验中通常使用的任务困难得多。例如,OpenVLA 评估中的任务通常是单阶段行为(如“把茄子放进锅里”);而我们最简单的收拾桌面任务,也要把多个物体分拣到垃圾桶或收餐箱中,更复杂的任务还可能需要多个阶段、操作可变形物体,并根据当前环境配置在多种策略中选择一种。任务采用评分标准评估:完全成功得分 1.0,部分正确执行可获得“部分分”(例如收拾了一半物体得分 0.5)。下面给出 5 项评估任务的平均分,比较完整预训练 π₀、π₀-small(一个没有使用 VLM 预训练的 4.7 亿参数模型)、OpenVLA 和 Octo。尽管 OpenVLA 和 Octo 在最简单的任务“简单收拾桌面”上也能取得非零表现,π₀在所有任务上都明显表现最好。小模型 π₀-small 的表现排名第二,但使用带 VLM 预训练的完整架构后,性能提升超过 2 倍。
在 5 项测试任务上评估 π₀、π₀-small、OpenVLA 和 Octo 的平均分。π₀在所有任务上都持续取得良好表现,超过小模型变体和已有模型。
下面还提供了严格实证评估的详细视频,包括直接 prompt(开箱即用)实验和微调评估中的成功与失败片段。所有实验的完整结果见全文。
我们接下来要去哪里?
Physical Intelligence 的使命,是开发能够控制任意机器人执行任意任务的基础模型。到目前为止,我们的实验表明,这类模型可以控制多种机器人,完成此前没有机器人学习系统成功完成的任务,例如从洗衣篮中取出并折叠衣物,或组装纸箱。但通用机器人策略仍处于起步阶段,我们还有很长的路要走。机器人基础模型研究的前沿包括长时域推理与规划、自主自我改进、鲁棒性和安全性。我们预计,未来一年所有这些方向都会取得重大进展;而初步结果已经为机器人基础模型的未来描绘出令人鼓舞的图景:能力强大的通用策略可以继承互联网规模预训练的语义理解,吸收来自众多任务和机器人平台的数据,并带来前所未有的灵巧性和物理能力。
我们也认为,要取得成功,不仅需要新技术和更多数据,还需要整个机器人社区共同努力。我们已经与多家公司和机器人实验室展开合作,一方面改进用于遥操作和自主运行的硬件设计,另一方面将合作伙伴的数据纳入预训练模型,从而提供适配其特定平台的模型。
如果你有兴趣开展合作,请联系我们。我们尤其期待与正在扩大真实应用场景机器人数据采集、并希望在自主性方面合作的公司携手。
我们也在招聘!如果你有兴趣加入我们,请与我们联系。
如果你是对我们的工作、合作或其他问题感兴趣的研究人员,请写信至 research@physicalintelligence.company。