Physical Intelligence (π)

物理智能层

假设你有一个需要理解语言的应用创意。你不会从训练基础模型并针对特定用例微调开始,也不会从头构建整套 AI 技术栈。相反,你只需要调用现有基础模型的 API,而应用的核心智能层已经在那里了。现有基础模型提供了一个现成的智能层,任何开发者都可以在其上构建应用。

但机器人技术还不是这样。

如果你想构建一个解决现实世界问题的机器人系统,那么软件开发者习以为常的现成模型和库并不存在。你需要实现自己的控制器,搭建数据管线,训练自己的模型,实际上是在开始开发具体机器人应用之前,先构建整套物理智能技术栈。其中许多组件不仅难以构建,甚至本身就是重大的开放研究问题。既没有广为人知的有效配方,更没有现成的 API。

为了让机器人应用像 AI 应用一样实用且无处不在,我们需要一个现成、易获取、可复用的物理智能层。π₀、π₀.₅、π₀.₆ 和 π*₀.₆ 等通用机器人基础模型提供了这样一层能力,显著降低了构建实用机器人系统所需的成本和工作量。当任何人都能使用强大的机器人基础模型时,我们将看到机器人应用在社会各个领域蓬勃发展,从家庭、医院、办公室,到仓库和工厂。

我们与专门负责部署机器人的公司合作,验证模型在真实世界环境中的表现,并在多样化任务和环境中对其通用性进行压力测试。下面请阅读 Weave 和 Ultra 两家合作伙伴的第一手经验。

Weave Robotics 标志

本节由我们的合作伙伴 Weave 撰写,介绍他们使用我们模型的经验;所有视频都来自 Weave 机器人在旧金山一家真实自助洗衣店中的现场部署。

π₀.₆ 在 Weave 客户现场连续折叠衣物。

Weave 为家庭构建机器人。较早的商用版本已经部署在旧金山湾区的企业中,执行我们关注的同一项家庭任务:折叠衣物。

折叠衣物是家庭机器人一个很有吸引力的首要任务。它普遍存在、耗时且需要集中注意力。工作量会随着家庭人口直接增加,成为家庭反复面对的时间负担。

与此同时,折叠衣物长期以来一直被认为是机器人技术中最具挑战性的操作问题之一。折叠本身就是长时任务,即便某个角落稍微错位,也可能影响最终折叠质量。衣物是可变形物体,差异很大;不同衣物在尺寸、面料、颜色和形状上都各不相同。

但由于我们既要在自助洗衣店也要在家庭中为客户折叠衣物,真正完成这项工作意味着机器人必须尽可能多地处理衣物。这不仅包括 T 恤,还包括长袖衫、短裤、裤子等,而且尺寸和面料变化极大。

与 Physical Intelligence 合作后,我们看到模型性能在多个方面得到提升,包括折叠质量、每件衣物的折叠时间,以及远程专家为获得可交付的最终折叠效果而需要进行干预的次数。我们希望借助 Physical Intelligence 的模型,在不同地点(包括一家客户现场)进一步推动自主折叠性能。

在与 Physical Intelligence 的合作中,我们取得的结果非常令人鼓舞;我们正努力打造尽可能优秀的机器人,并持续为新客户交付。

Ultra 标志

本节由我们的合作伙伴 Ultra 撰写,介绍他们使用我们模型的经验;所有视频都来自 Ultra 机器人在包装真实客户订单时的现场部署。

π₀.₆ 在 Ultra 客户现场完成一整班次订单包装,自主率达到 96.4%。

Ultra 构建能够嵌入现有工作站、在数小时内开始创造价值的工业 AI 机器人。如今,我们正在用部署于美国各地、能够产生收入的一批机器人,自动化仓库中的关键任务,并逐步扩大到数百个部署点。我们的目标很简单:打造有史以来生产效率最高、最易使用的工业机器人。

我们的首个用例是电商订单包装;过去,这项工作一直无法用机器人自动化。工作流程、物品类型、可变形包装和外部设备的巨大差异,形成了一个用传统自动化技术难以处理的“长尾”问题;传统技术往往过于僵化,无法满足实际需求。视觉-语言-动作模型(Vision-Language-Action Models,VLA)提供了一种解决方式:它的性能会随着数据规模扩大而提升,而不是随着工程投入的小时数增加,同时不会降低客户使用机器人的灵活性。

在与 Physical Intelligence 合作期间,我们在客户现场部署中观察到真实世界自主性能显著提升。随着每一代新模型(π₀、π₀.₅ 到 π₀.₆)推出,我们都看到智能水平、吞吐量和可靠性迈上一个明显台阶,而且没有放缓迹象。对于 π₀.₆,我们观察到循环时间和成功率都有明显改善;这些改善叠加起来,意味着客户获得更高吞吐量,远程干预团队也不那么疲劳。

除了 π₀.₆ 在循环时间和成功率上的定量提升,我们还注意到模型行为在多个方面出现了显著的定性改善。

这些模型运行在真实客户仓库中的机器人上,每天包装真实订单。当模型出现失误时,我们的人在回路(human-in-the-loop)干预系统会介入,确保数千个订单的正确性;与此同时,系统持续生成新数据,用于改进下一代模型。

上面的示例表明,我们开发的模型可以用于真实而有用的应用;我们的合作伙伴也能够将自己的硬件接入模型,以完成对他们最重要的任务。我们计划让模型具备广泛的实用性和适用性,使机器人研究者能够用它们驱动自己的应用,就像开发者使用基于 API 的 LLM 一样。通过提供易于使用的物理智能层,我们希望降低探索新机器人应用、形态和用例的成本。我们还在与其他一些合作伙伴合作,期待很快与大家分享更多消息。如果你有兴趣与我们合作,欢迎联系我们。

← 返回研究目录