几个月前,我们宣布了 π₀——我们的第一个通用机器人基础模型。它可以针对各种任务进行微调,例如叠衣服、清理桌面、舀咖啡豆等;也可以控制多种不同类型的机器人,例如双臂机器人、单臂平台和移动机器人。今天,我们将 π₀的代码和权重作为实验性 openpi 仓库的一部分发布。
这次发布的目标,是让任何人都能尝试针对自己的机器人和任务微调 π₀。我们相信,这些通用机器人策略不仅有潜力实现有效的机器人学习,长远来看还可能改变我们思考人工智能的方式:正如人的认知能力植根于物理世界,未来的 AI 系统也将能够与周围世界交互,以直觉层面理解物理交互和过程,并推理因果关系。我们认为具身性是实现这一目标的关键;通过让所有人都能使用 π₀,我们希望推动通用、广泛能力的物理智能发展。
openpi 仓库提供:
- 运行基础预训练 π₀模型所需的代码和模型权重。
- 针对 ALOHA、DROID 等广泛可用平台上的少数简单任务微调的多个 checkpoint。
- 在多个真实世界和仿真机器人平台上运行推理的示例代码。
- 针对自定义任务和平台微调基础 π₀模型的代码。
我们预计 openpi 的主要用途,是使用来自你自己平台的少量到中等规模数据来微调 π₀。根据我们自己的实验,1 到 20 小时的数据就足以针对各种任务完成微调,具体讨论见我们之前的博客文章,但你的实际情况可能不同。在发布 openpi 的同时,HuggingFace 的朋友还慷慨准备了 openpi 的 PyTorch 移植版本,如果你更喜欢 PyTorch 而不是 JAX,可以使用它。我们期待看到 openpi 将如何被使用,也欢迎反馈和问题。
这是一个实验:π₀是为我们自己的机器人开发的,而我们的机器人不同于 ALOHA、DROID 等广泛使用的平台。虽然我们乐观地认为研究人员和实践者可以将 π₀适配到自己的平台上,开展富有创意的新实验,但并不期待每次尝试都能成功。也就是说,π₀可能适合你,也可能不适合;不过欢迎你亲自试试看!
支持的平台与 checkpoint
DROID:基于 Franka 的单臂系统,并配有开源数据集。下面的视频展示了 openpi 在训练数据中从未见过的环境中运行,地点遍布世界各地,包括蒙特利尔大学、华盛顿大学、KAIST 等(参见文章末尾的致谢)。
ALOHA:适合灵巧操作的低成本双臂系统。下面的视频展示了 openpi 在训练数据中未出现过的新地点中的 ALOHA 平台上运行。
我们与一些慷慨同意测试该框架的合作伙伴分享了 openpi。下面的视频包括 Moo Jin Kim 进行的一项实验示例:将 π₀微调为控制 ALOHA 舀取混合零食配料。我们还让 π₀在一些仿真环境中运行,包括 Libero 和 ALOHA 仿真器。
我们提供了可用于为自有机器人系统实现客户端的示例代码,因此可以很方便地将 π₀衍生模型接入自己的平台。
我们提供了多种预训练 checkpoint,下面列出其中一些重点。完整列表请参阅 openpi 仓库文档。
π₀ base:标准预训练 π₀模型,详见我们的论文。该模型在 OXE 和我们的 7 个机器人平台上训练,设计用途是微调;不过,对于预训练数据中已有的任务,例如右侧展示的“从烤面包机取出面包”,它也可以零样本使用。
π₀-FAST base:使用 FAST tokenizer,通过自回归离散化实现控制。它的语言遵循性能略好,但推理成本更高(根据我们的经验约高 4–5 倍)。如果你更倾向于离散化而不是 flow matching,这是一个不错的选择。关于该方法的更多细节,请参阅 FAST 论文。
我们还提供了一些微调后的演示 checkpoint。它们不是为后续微调设计的,但可以开箱即用地展示效果;在你的特定机器人上可能有效,也可能无效。由于这些 checkpoint 是在 ALOHA、DROID Franka 等更广泛可用的机器人上采集的相对较小数据集上微调的,它们可能无法泛化到你的具体设置。不过,我们发现其中一些(尤其是 DROID checkpoint)在实践中具有相当广泛的泛化能力:
π₀-FAST DROID 和 π₀ DROID:提供两个在 DROID 数据集上微调的模型。该数据集包含使用 Franka 机械臂在多样环境中执行的多样任务。这是首批能够在完全新环境中的 DROID 平台上成功遵循指令的模型,相关内容见 FAST 论文;我们建议在 DROID 或类似平台和任务上工作的用户使用这些模型。
π₀ ALOHA:折叠毛巾、舀取食物及其他任务。我们提供了一组针对 ALOHA 平台任务微调的 checkpoint。请参阅 openpi 仓库文档,了解如何设置 ALOHA 系统并正确运行这些 checkpoint。这些 checkpoint 可能对机器人整体设置相当敏感,不过我们曾在一个训练数据中未出现过的全新 ALOHA 工作站上运行它们。
π₀ Libero:针对 Libero 基准微调的 checkpoint,可以直接在 Libero 任务上评估。
对开源机器人基础模型的展望
在 Physical Intelligence,我们相信能够控制任意机器人执行任意任务的通用模型将代表机器人控制的未来。不过,无论这类模型如何构建,以及如何使用、适配和部署,都还有许多未解问题。我们相信,π₀让我们向前迈出了重要一步,但最困难的挑战仍在未来。要开发真正通用且能力强大的模型,机器人学界需要共同努力;发布 openpi 正是我们为这一共同事业作出的贡献。正如高效的开源语言模型(LLM)和视觉-语言模型(VLM)催生了 LLM、VLM 应用、研究方法和新产品的寒武纪大爆发,我们希望 openpi 也能带来机器人基础模型的新颖而富有创意的用途、更大且更令人兴奋的数据集共享,以及新的技术。
我们很想知道你打算如何使用 openpi、它是否支持你的使用场景,以及如何改进它来更好地处理你最关心的情况,并以此指导我们未来的工作。因此,我们希望每一位尝试这些模型的人都能向我们提供反馈。如需技术支持,可以通过 GitHub issue 联系我们;也欢迎通过电子邮件发送反馈和建议。我们还在与多家合作伙伴合作,为特定用途定制模型,在 π₀和 FAST 之上共同开发和评估新的实验性功能,并支持新类型的平台。如果你对此感兴趣,请联系我们!
致谢
我们非常感谢帮助在自有机器人上准备 openpi 演示视频的朋友和合作伙伴,包括:Minho Heo、Joseph Lim、Kyle Stachowicz、Pranav Atreya、Laura Smith、Arhan Jain、Abhishek Gupta、Özgür Aslan、Kirsty Ellis、Artur Kuramshin、Glen Berseth、Edward Hu、Will Liang、Hungju Wang、Sam Wang、Jie Wang、Dinesh Jayaraman、Moo Jin Kim。