Physical Intelligence (π)

训练快、运行快、泛化更好的 VLA

图表说明VLA 对比图:训练速度、推理速度与 VLM 知识隔离

VLA 对比:训练速度从慢到快、推理速度从慢到快,以及是否采用 VLM 知识隔离。

视觉-语言模型(VLM)之所以强大,是因为它们将百科全书级的网络知识与处理复杂问题的推理能力结合起来;但要将这种能力用于机器人领域,我们还需要加入连续动作输出。

类比来说,如果把 VLM 中的视觉编码器看作视觉皮层,把 LLM 看作前额叶皮层,那么视觉-语言-动作(VLA)模型还需要一个类似运动皮层的模块。这个虚拟运动皮层需要掌握基础 VLM 陌生的能力,例如执行精确动作,同时还要维持与 VLM 核心推理和视觉能力之间复杂、高带宽的接口。

在大脑的演化中,运动皮层先于其他部分出现;但现代 AI 的发展顺序正好相反:我们从语言开始,然后加入视觉,最后接入运动控制。这意味着,我们需要弄清楚如何将新加入的虚拟运动皮层“接线”到 VLA 中,同时不破坏其预训练的推理能力和网络规模知识。

我们如何增强 VLM,使其获得连续动作输出,并最大程度继承网络规模预训练带来的全部能力?

第一代 VLA(例如 RT-2 和 OpenVLA)采用了一种简单方法:训练 VLA 输出 token 化的数字,将机器人手臂的每个关节角度离散到固定大小的区间,并为每个区间分配一个 token,就像回答由数字组成的问题。

这种方法适用于拾取物体等基础操作,但不适合高频、精确或流畅的运动;我们在 π₀ 和 π₀-FAST 实验中观察到了这一点。这种表示形式不利于模型训练,对精细任务过于粗糙,而且运行时速度很慢。回到运动皮层的类比,这有点像通过口头说出应该收缩哪些肌肉来控制手臂。

对于折叠衣物、整理床铺等更复杂的技能,我们的 VLA 需要一个真正类似运动皮层的模块。

第二代 VLA 从 π₀ 开始,通过在 VLA 训练期间加入新的神经模块来产生连续输出,通常使用 diffusion 或 flow matching 等连续生成建模技术。这些新模块可以是 action expert(动作专家)或 action head(动作头),它们能够关注 VLM 主干中的表示,同时专门适配连续运动控制。

这些第二代 VLA 可以执行复杂得多的任务,但在 VLA 微调期间向模型加入新的运动控制权重,会产生复杂的学习动态,可能损害 VLM 的内部表示。实质上,以这种粗糙方式将“运动皮层”嫁接到 VLM 上,可能造成某种“遗忘”,显著减慢训练,并损害模型最终理解语言的能力。

在一项广泛的新研究中,我们分析了这一现象,并提出一种方案,使 action expert 能够嫁接到 VLM 上而不损失预训练的网络规模知识,从而实现快速训练、良好的语义泛化和精确的运动控制。我们将这种方法称为“知识隔离 VLA”,它形式化了近期 π₀.₅ 模型中使用的方法,并通过更精细的单阶段训练方案,将 VLM 主干与 action expert 隔离开来。

由此得到的模型称为 π₀.₅ + KnowledgeInsulation(KI)。知识隔离的关键思想是:使用 FAST-tokenized 离散动作快速学习高质量表示,同时让 action expert 适配连续动作,而不将其梯度传播回 VLM 主干。训练完成后,action expert 可以通过 flow matching 产生流畅的连续动作,而离散动作则被丢弃。

连续动作 VLA 的挑战

当前第二代 VLA 架构使用额外模块来生成连续输出,通常采用 diffusion 或 flow matching,有时也使用其他连续分布类别。

这通常通过加入回归头、使用一个接收大型 LLM/VLM 输出的独立模型,或者像 π₀ 中首次提出、并在许多近期 VLA 模型中扩展的 action expert 来实现。action expert 可以通过 diffusion 或 flow matching 解码连续动作,而不是进行自回归生成。所有这些设计有一个共同特征:它们都将虚拟“运动皮层”嫁接到 VLM 主干上,并使用连续动作生成损失训练它。

在这种 action expert 设计中将 VLM 适配为 VLA 时,VLM 主干的表示会暴露在来自 action expert 的梯度之下。我们的实验表明,这些梯度会导致不利的学习动态,不仅使学习速度大幅变慢,还会让 VLM 主干丢失一部分从网络规模预训练中获得的知识。

图表说明VLM 主干与 action expert 的连接示意图

在预训练 VLM 主干上朴素地加入 action expert 时,来自 action expert 的梯度会不利地影响主干中的表示。

这种不利学习动态的后果之一,是模型遵循语言指令的能力下降。在下面的例子中,机器人被要求把勺子放进餐具容器;然而,朴素加入 action expert 的模型抓住了垃圾。

在预训练 VLM 上朴素加入 action expert,可能导致模型不关注语言指令(左);我们提出的方案(右)显著改善了语言跟随能力。

关于这一现象为何发生,一种假设如下:预训练 VLM 的本质决定了它很擅长关注语言输入。此时来自 action expert 的梯度会严重干扰模型处理语言的能力,使模型优先学习其他相关性。

我们发现,自回归 VLA(例如 π₀-FAST)没有这个问题;但如下方视频所示,由于需要昂贵的自回归推理,它们完成任务的速度慢得多。在这个例子中,自回归 VLA 机器人刚开始执行任务时,右侧运行我们方法的机器人已经完成了指令。

推理速度对比:桌面整理(bussing)与折叠衬衫。

知识隔离

图表说明π₀.₅ + KI 架构与训练方案示意图

π₀.₅ + KI 架构与训练方案概览。模型由 VLM 主干和 action expert 组成,action expert 的梯度不会流入 VLM 主干。相反,我们使用 π₀-FAST token 作为表示学习目标,使主干快速获得运动控制表示,供 action expert 使用。此外,模型还在通用 VLM 数据和机器人规划数据上训练。

这些选择带来了一个训练快、推理运行快、泛化能力强的 VLA,因为它保留了 VLM 主干的预训练知识。

为了解决这些问题,我们开发了一种新技术,在适配运动控制的同时,将主干知识与 action expert“隔离”。第一步是停止 action expert 到 VLM 主干的梯度流,这使 VLM 主干完全不受新加入的 action expert 影响。但如下图所示,仅靠这一步还不够。

由于 VLM 主干不再从机器人数据中接收梯度,它的表示不会再适配机器人控制的需求,action expert 也就更难生成正确运动。回到我们的类比:如果视觉皮层和前额叶皮层从未与物理世界交互,它们可能无法有效地与运动皮层沟通。

图表说明衬衫折叠任务的平均成功率对比图

“衬衫折叠”任务的表现。我们提出的 π₀.₅ + KI 模型表现最佳;将主干冻结作为知识隔离方法无法用于此任务。

图表说明抽屉物品任务的平均完成率对比图

静态机器人在未见环境中完成“抽屉放物品”任务的平均完成率。

为了解决这一问题,我们使用 π₀-FAST 动作 token 训练 VLM 主干。这样,VLM 主干就能获得运动控制所需的表示,action expert 可以使用这些表示,而不必将会污染主干的训练信号反向传播回去。π₀-FAST 动作 token 让模型更快获得运动表示,而交叉熵损失对 VLM 主干预训练知识的干扰也显著更小。

图表说明训练步数与任务完成率关系图

通用模型在“桌面整理”任务上的训练步数表现。我们的方法只需要 π₀ 的 1/7.5 训练步数,同时通过 action expert 以很快的推理速度生成动作。

由于现在同时训练离散 token 和连续动作,我们还可以加入其他辅助的下一个 token 预测任务。我们在完整的 π₀.₅ 数据混合上训练模型,包括来自网络的通用视觉-语言数据和高层级机器人指令。这进一步强化了 VLM 主干中的语义知识,并如下图所示,使模型能够更有效地泛化。

图表说明物体泛化中的任务完成率与语言跟随率对比图

移动操作机器人上的物体泛化结果。机器人在未见物体(OOD,分布外)和已见物体(分布内)上执行任务,且环境未出现在训练数据中。与网络数据共同训练最能提升泛化;如果没有网络数据,通过停止 action expert 的梯度来隔离 VLM 知识也能带来显著帮助。

训练快、运行快、泛化更好

同时使用 π₀-FAST 动作 token 进行表示学习、使用通用网络数据提升泛化,以及通过 action expert 学习连续动作,使我们能够兼得各方面优势:模型训练速度显著快于 π₀(实际上与 π₀-FAST 一样快),推理速度则与 π₀ 一样快,并展现出很好的语义泛化能力。

下面是模型在完全未见过的环境中解决任务的一些例子。

我们的论文包含详细的消融实验和与其他方法的比较。下图展示了其中一部分结果,更多细节请参阅论文。

图表说明桌面整理任务中的性能、语言跟随和完成时间对比图

单一 embodiment 模型在“桌面整理”任务上的结果。π₀.₅ + KI 的性能最高、语言跟随良好,执行时间也短。自回归 VLA(π₀-FAST)完成任务需要约两倍时间。

未来走向何方?

VLA 已经从把机器人控制简单地表述为问答问题的 VLM 扩展,发展成一种融合视觉感知、语义理解、问题求解和运动控制的复杂新型模型。机器人系统使用的传感器和执行器种类繁多,这使 VLA 成为最具多模态特征的模型;而训练这些模型的科学,本质上就是多模态机器学习。

π₀、π₀.₅ 等第二代 VLA 带来了前所未有的新能力,也带来了新的挑战。

更深入地理解这些模型的学习动态,不仅能帮助我们提升性能,也能为下一代 VLA 打下基础。下一代 VLA 将更深度地整合网络规模知识与机器人运动控制,具备更复杂的序列推理和规划能力,并能够以审慎、目标导向的方式执行复杂任务。

VLA 的发展仍处于早期阶段。我们正在看到,基于 VLA 的机器人控制正从简单的一次性实验,成熟为一门复杂的研究学科,并对实际应用产生深远影响。如果你有兴趣与我们共同探索这一方向,请联系 collaborate@physicalintelligence.company。

我们尤其期待与那些正在扩大真实世界机器人数据采集、并希望就自主性开展合作的公司合作。

我们也在招聘!如果你有兴趣加入我们,请联系我们。

对于关注我们工作、合作事宜或其他问题的研究人员,请写信至 research@physicalintelligence.company。

← 返回研究目录