Physical Intelligence (π)

FAST:高效的机器人动作 token 化

大多数基础模型使用 Transformer 架构,这是一种处理离散“token”的序列模型;token 通常对应字母组、短词、图像块或声音片段。Transformer 将输入 token(例如一个问题)映射为输出 token(例如一个答案),任何能够被 token 化为离散单元的数据,都可以由这类序列模型处理。然而,token 化方式会对下游学习的有效性产生重大影响,使用好的 tokenizer 对高效的大规模训练至关重要。

如果我们想训练 Transformer 来控制机器人,应该怎么做?在这种情况下,输出是一个“action chunk”(动作块),即一小段机器人动作序列,例如手臂关节角度。粗糙系统的动作块可能只有 3–5 个动作,而高频灵巧机器人可能包含 20–50 个动作。和语言一样,以正确方式表示这些动作对有效学习至关重要。现有视觉-语言-动作(VLA)模型通常使用简单的离散分箱:每个动作步骤的每个维度都用一个离散箱表示。这对简单行为尚可,但对于需要精确和高频控制的复杂灵巧技能,很快就会失效。正如本文将要讨论的,这种分箱技术无法解决 Physical Intelligence 所关注的复杂灵巧任务。扩散或 flow matching 的表现通常好得多,例如我们的 π₀模型;但扩散训练耗时更长。那么,如何表示动作,才能快速训练用于机器人控制的 Transformer,同时保留灵巧性和精度?

折叠衬衫
折叠衬衫
折叠衬衫

灵巧机器人数据经过 π₀-FAST 视觉-语言-动作模型和 FAST 动作 tokenizer 处理,形成动作 token,再由自回归 Transformer VLA 进行灵巧机器人控制;示例包括收拾桌面、折叠衣物、装杂货、取出面包,以及在 Berkeley Kitchen、Berkeley Counter、Stanford 和 UW 等新环境中的泛化。

我们的新动作 tokenizer FAST,使我们能够通过简单的下一个 token 预测,在高度灵巧的任务上训练通用策略。

为此,我们开发了一个专门针对动作设计的新 tokenizer,称为 FAST。FAST 受到 JPEG 图像所采用的连续压缩方法启发,能够处理标准分箱离散化无法完成的高频灵巧任务;它达到与 flow matching 或扩散相近的灵巧程度,同时训练速度快 5 倍。像语言一样用离散 token 表示动作,还能改善互联网规模预训练的迁移和语言指令遵循。FAST 首次让我们能够在 DROID 数据集上训练策略,使其仅通过自然语言命令提示,就能在完全新环境中零样本执行一系列操作任务。

为促进更强大机器人基础模型的研究,我们正在发布一个通用 FAST tokenizer 版本,它在 100 万条真实机器人动作序列上训练。

FAST 机器人动作 tokenizer

FAST 的动作压缩流程:1. 归一化动作块(展示前两个维度);离散余弦变换(DCT);2. 频率分量(展示前两个维度);量化;3. 稀疏频率矩阵(每个维度一行);展平;低频分量优先;字节对编码(BPE);4. 压缩后的动作 token。

我们的 FAST tokenizer 使用离散余弦变换(DCT)压缩动作序列,得到密集的压缩动作 token 序列。

新的动作 token 化方法 FAST 通过在训练前压缩原始动作块,改进了简单分箱方法。它可以大幅提升灵巧机器人数据上的策略训练和推理效率。具体来说,我们的 token 化方法依赖离散余弦变换(DCT),这是一种常用于信号压缩的技术,例如 JPEG 或 MP3 编解码器中的技术。我们将 DCT 与字节对编码(BPE)结合;BPE 是一种常用于训练大型语言模型的压缩算法。二者结合后,可以将原始动作块压缩成少量密集动作 token,通常每个动作块 30–60 个,相比之前的动作 token 化方法压缩约 10 倍。

我们将 FAST 与 π₀模型结合,对动作 tokenizer 进行了测试。与被限制在简单操作任务上的早期离散化 VLA 模型相比,FAST 使我们能够在折叠衣物、收拾桌面和装杂货袋等高度灵巧的任务上训练自回归 Transformer 策略。同时,FAST 的训练速度比之前的模型最高快 5 倍。下面展示一些 FAST 策略能够解决的任务。

FAST 让我们得以在最近发布的 DROID 数据集上训练第一个真正能够泛化到新环境中多种指令的通用策略。DROID 是一个开放源代码数据集,包含多样的机器人操作任务,由来自世界各地的大型机器人研究者联盟历时两年采集。它涵盖从大学建筑到真实家庭的各种场景和任务,但此前还没有方法能够在完整数据集上训练通用策略,使其在新环境中零样本遵循语言命令。借助 FAST,我们做到了这一点——下面可以看到我们的策略实际运行的情况!我们将它交给三所美国大学的合作者,策略能够在所有测试环境中开箱即用地执行简单操作任务。

即使策略在某项任务上失败,它往往也会以直观的方式尝试解决。虽然距离完美还很远,但这让我们得以一窥这样的未来:我们可以像使用语言模型一样,下载并直接使用通用机器人策略。

规模化

π₀ + FAST(我们的模型)训练速度比 π₀快 5 倍,同时达到相近的性能。

使用 FAST 训练非常高效。我们的通用策略 π₀-FAST 的训练速度是原始 π₀模型的 5 倍,同时达到相近的性能。

我们还使用 FAST tokenizer 训练了 π₀-FAST,这是我们的第一个自回归通用策略。它建立在之前的 π₀模型之上,使用相同的模型主干和训练数据集。π₀-FAST 能够解决与标准基于扩散的 π₀模型相同的复杂灵巧任务;但由于使用简单的自回归离散化,训练速度快 5 倍。在我们的比较中,标准离散化方法无法解决实验任务库中的任何灵巧任务。

我们对自回归 VLA 训练的前景感到非常兴奋。当前模型的一个显著缺点是推理速度:π₀-FAST 的自回归解码明显慢于 π₀使用的 flow matching 解码。加速自回归 VLA 的推理仍是一个开放问题,但语言建模等其他领域已经积累了大量自回归 Transformer 快速推理的研究,可为 VLA 提供启发。

使用 FAST tokenizer

我们正在发布一个在 100 万条真实机器人动作序列上训练的 FAST tokenizer 版本。你可以使用 FAST 训练自己的策略,只需三行代码即可将动作 token 化:from transformers import AutoProcessor;tokenizer = AutoProcessor.from_pretrained("physical-intelligence/fast", trust_remote_code=True);tokens = tokenizer(action_chunk)。

有关 tokenizer,以及如何在自己的数据上训练 FAST tokenizer 的更多信息,请参阅 HuggingFace 仓库。

展望未来

借助 FAST,我们开发了一种高效的机器人动作 token 化方法,可以将机器人技术无缝连接到现代自回归 Transformer 训练流程。实验表明,我们在这项工作中训练的自回归策略能够用简单方案解决迄今最困难的一些机器人任务,同时训练速度显著快于现有模型。与此同时,FAST 展示了对现代通用策略训练流程做出微小改变,也可能对训练效率和性能产生重大影响,这说明还有许多改变可以进一步改善策略训练。

在 Physical Intelligence,我们致力于实现普遍存在的通用物理智能。在这一过程中,我们正在构建世界上最大的机器人数据集,并开发新的方法,训练更好、更强大、更高效的通用策略。如果这项使命令你感到兴奋,欢迎联系我们!

← 返回研究目录