Physical Intelligence (π)

借助高效在线RL实现精确操作

我们的模型能够遵循多样化指令并执行广泛的任务,从折叠衣物、制作咖啡到烹饪烤奶酪三明治。但对于许多应用而言,广泛的能力还不够:物理任务中最困难的部分需要精度、灵巧性和速度。拿起一把螺丝刀可能很容易,但快速而精确地将它对准一颗微小螺钉则困难得多。

强化学习(RL)是改进这类任务的自然方法:机器人通过尝试、观察结果并进行调整,可以完善仅靠演示难以学会的行为。包括我们近期Recap算法在内的既有机器人RL方法,重点是通过大规模数据采集,对长时程任务进行整体改进。本文介绍一种我们开发的新方法,称为RL tokens(RLT),它专门针对需要细粒度操作的精确、精细任务,并且只需几分钟或几小时的真实世界经验即可学习。

RLT增加了一个特殊的输出token,在VLA与轻量级RL策略之间提供紧凑接口,使机器人无需对完整模型进行微调,便能在短短几小时内调整自身行为。在四项具有挑战性的操作任务中,RLT将每项任务最精确阶段的速度提升了最多3倍,并且可以超过人类遥操作的速度。

每项任务在RLT训练前后的表现。经过RL训练的模型明显比基础模型更快、性能更好。

通过RL token让VLA适应快速在线RL

我们此前已经证明,VLA可以通过RL从经验中学习,使用的方法称为Recap。Recap关注利用大规模RL和长时程任务进行训练;但在许多情况下,我们希望机器人能够用几小时甚至几分钟的数据,快速改进某项技能中单独的、尤其具有挑战性的阶段。

例如,需要在装配任务中精确使用螺丝刀的机器人,可以只微调“将螺丝刀对准螺钉”这一技能,这可能比微调整个VLA快得多。这种精确针对性的适应甚至可以直接在部署期间运行。

理想情况下,这种改进应直接在机器人端完成,并从每次尝试中提取尽可能多的学习信号。仅用几小时训练完整VLA、端到端地改进任务,会带来重大的计算和实践挑战。我们的核心洞见是:可以先让VLA适合使用一个小得多、能够实时更新的模型进行RL微调。

我们训练VLA生成一个“RL token”,它可以对VLA的内部表征进行简洁概括。随后,这个RL token被作为输入提供给一个小得多的模型,并由该模型实时进行RL训练。

RL token由actor和critic使用;二者通过样本高效的离策略RL方法进行训练。由于actor和critic只处理这种紧凑表征,它们可以采用小型网络,直接在机器人上以每秒数百次更新的速度训练。这使RL训练具有足够的响应性,能够在每次尝试后改进行为。

我们训练VLA提供一个RL token,对VLA的内部表征进行概括,并在训练后将该token冻结。随后,RL token被提供给actor和critic网络;二者通过高效RL算法训练,以改进任务中最具挑战性、最需要精度的阶段。

RLT首先通过添加一个encoder-decoder transformer来适配VLA;该transformer经过训练,通过瓶颈预测模型的内部embedding,从而形成一种压缩表征,我们称之为RL token。RL token概括了RL actor和critic针对当前观测所需的信息,使得即使非常小的actor和critic,也能基于VLA自身丰富的内部表征学习改进模型。

图表说明通过encoder transformer生成RL token,再由decoder transformer从RL token重建图像embedding的信息瓶颈示意图

我们通过添加encoder-decoder transformer训练VLA生成RL token。encoder的最终输出——RL token——必须保留足够的信息,使decoder能够重建原始VLA embedding,从而迫使它成为信息瓶颈。训练完成后,RL token为在线RL actor和critic提供紧凑的状态表征。

借助RL token,我们只需几小时甚至几分钟的机器人数据,就可以用在线RL训练小型actor和critic网络。要让这一过程尽可能高效,需要做出几项细致的设计。在线RL actor必须使用与VLA相同的动作空间,保持在VLA既有行为的基础上,并且能够从有限的真实世界数据中高效学习。我们通过以下方式实现这一点:

首先,RL策略预测action chunk,与VLA使用的动作结构保持一致,而不是在单个底层控制步上行动。这样,在线策略就能适应任务中真正重要的、具有时间延展性的动作。其次,RL策略并非从零开始行动:actor接收VLA预测的动作作为输入,因此它学习的是编辑VLA动作,而不是完全取代VLA。

我们将策略更新正则化,使其趋向这一参考动作:当VLA的行为已经合理时,探索会保持在VLA附近;只有当critic发现更好的替代方案时,策略才会偏离。为了防止策略在训练早期简单复制VLA,我们还采用参考动作dropout,迫使actor保留独立的动作生成路径。

最后,我们还可以选择将人类干预直接纳入RL更新:当机器人卡住或犯错时,把人的纠正反馈回训练过程。这些选择形成了一套可复用的在线RL方案,可以附加到预训练VLA上,适用于不同任务,而无需针对任务进行工程开发。

攻克高难度操作任务的关键最后一毫米

RL训练改善了每项任务中最精确、最关键的部分。

我们在四项需要关键时刻高度精确操作的挑战性任务上评估了RLT:使用电动螺丝刀将微小的M3螺钉拧入机械臂、系紧扎带、插入以太网线,以及插入电源线。在每项任务中,通用模型通常能够完成大部分流程,但最终的成功与速度取决于一个接触丰富的关键阶段;在这一阶段,位置、方向或时序上的微小误差都可能导致失败。

在每项任务最需要精确操作的阶段,即使很小的错误也可能导致任务失败。RL训练教会策略避开这些错误。

这些任务需要相当高的精度。以螺丝刀任务为例,机器人必须在位置和旋转方向上都达到亚毫米级精度,才能将螺钉与螺丝刀尖端对齐。由于尖端距离抓取点约10厘米,机器人抓取或腕部运动中的微小误差都会在接触点被放大。从机器人自身的腕部相机视角看,这些交互甚至很难被清晰感知。

从机器人视角观察螺丝刀任务,展示基座相机和两台腕部相机的画面。

在四项任务中,基础VLA模型都能很好地完成行为的初始阶段,例如拿起螺丝刀或扎带,但在最需要精度的阶段会遇到困难。RLT正是为这种情形设计的:我们不重新学习整个任务,而是使用在线RL改进这些关键阶段。在实践中,机器人只需最少15分钟的真实世界数据,就能改善每项行为中最困难的部分。

我们将RLT应用于四项任务的关键阶段,并在两种设置下评估其影响:短而关键的插入阶段(电源线和以太网线),以及时程更长、变化更多的任务。在全部四项任务中,与基础模型相比,RLT都能快速提升速度和成功率。下面的图表以吞吐量(每10分钟成功完成的任务数)衡量基础模型和RL训练后模型的表现。

四项任务的吞吐量对比:螺丝刀、系扎带、插入以太网线和插入充电器;每项任务比较基础策略与RLT策略。

下面的进度图展示了RLT在以太网线插入任务上的吞吐量提升。训练总共耗时两小时,但机器人数据总量只有15分钟,其余时间用于重置和其他开销。

以太网线插入任务的吞吐量随机器人数据分钟数增加而提升。

RLT不仅能相对于基础模型提升性能,还能让任务执行速度超过人类遥操作。如下面的直方图所示,最终RL策略的一半试验速度快于数据集中所有遥操作演示。

以太网线插入任务的episode长度分布:RLT的中位数为66个时间步,遥操作为146个,基础模型为228个。

下一步

借助RLT,我们可以通过实时在线RL快速高效地适应长任务中的单个阶段,使模型更接近直接在工作过程中学习,即使面对精细而高度精确的任务也是如此。通过经验不断改进,将是现实世界机器人基础模型必须具备的关键能力。未来模型需要在多种时间尺度和抽象层级上进行适应:从本文讨论的单个行为的细粒度改进,到我们在Recap工作中探索的整个模型的大规模训练,再到基于RL的高层推理能力适应,而后者可能会受到人类反馈的影响。

当模型能够直接从经验中学习所有这些抽象层级时,即使在执行实际的现实世界任务过程中,它们也会不断变得更好。我们很期待建设这一未来;如果你有兴趣参与开发这项能力以及其他物理智能能力,欢迎联系我们:research@physicalintelligence.company。

← 返回研究目录