Physical Intelligence (π)

教机器人倾听并更深入地思考

你上一次做一道新菜是什么时候?你会先查看食谱、摆好食材,然后开始动手。脑海中会有一个小声音提醒你:“哦,我忘了,还需要加番茄。”你会认真地想好每一步,并不时核对食谱。也许朋友还会提醒你:“小心,别把它烧糊了。”Daniel Kahneman 描述过人们解决问题的两种方式,并将其称为“系统 1”和“系统 2”。系统 1 感觉本能而自动;系统 2 则是审慎且有意识的。做这道新菜时,你用的是系统 2:那就是你听见的脑海中的小声音。而当你第 100 次做同一道菜时,用的就是系统 1:一切变得自动化,你几乎不用思考。

我们能否让机器人也用同样的方式“思考”,在面对复杂任务时拥有一个告诉它该做什么的“小声音”?我们开发了一个称为分层交互机器人(Hierarchical Interactive Robot,Hi Robot)的系统,使视觉-语言-动作(VLA)模型(例如 π₀)能够参与双层推理过程。π₀充当本能、反应式的“系统 1”,执行已经熟练掌握的任务;高层语义视觉-语言模型(VLM)则扮演“系统 2”,通过“自言自语”来推理复杂任务和语言交互。这个系统 2 高层策略确实模拟了那个小声音,告诉机器人如何把复杂任务拆分成中间步骤,示例如下。

这个高层策略本身就是一个 VLM(事实上,它使用的正是 π₀所用的 VLM 主干),经过训练后能够处理复杂 prompt、观察场景,并把任务拆成易于执行的小块,将单个步骤(“拿起一片全麦面包”)低声传达给 π₀ VLA 模型。这个高层策略还可以融入实时上下文反馈。如果机器人正在清理桌面,而用户说“那不是垃圾”,模型就能理解这句话的含义:把对象“那”对应到机器人正在图像中操作的物体,正确解释其中隐含的指令(也就是说,“那”不应放进垃圾桶,因此应放到别处),然后再次向 π₀“低声传达”正确的中间步骤。

Hi Robot 1
Hi Robot 2
Hi Robot 3

系统流程图:关节状态;用户提示/插话;高层策略(VLM);机器人语音响应;低层语言命令;低层策略(VLA);动作。

高层策略处理开放式指令,以及来自基座相机和腕部相机的图像,生成低层语言命令。低层策略使用这些命令、图像和机器人状态来产生动作,并可选择生成语音响应。

Hi Robot 响应实时语言指令,推断用户意图并将其置于当前场景中理解。

为什么这是个好主意?

如果 Hi Robot 高层策略和低层 π₀模型都基于同一个 VLM,为什么这种分层推理过程仍然有优势?研究表明,如果允许语言模型生成额外文本来“思考”,它们就能更擅长解决复杂问题;同样,如果先把复杂 prompt 拆成 π₀模型已经知道如何执行的简单步骤,Hi Robot 就能更好地处理复杂 prompt 和反馈。这个推理过程还有一个更技术性的优势:我们用来初始化 VLM 的互联网规模预训练,会训练模型针对引用图像和文本上下文的 prompt 与问题生成文本答案。这意味着,这类模型开箱即用地就很擅长回答这样的问题:“在这张图中,机器人接下来应该抓取哪个物体来清理桌面?”因此,Hi Robot 能更好地继承 VLM 在互联网规模预训练中积累的知识。这和人的思考并没有太大不同:做那道新菜时,你可能会想到从食谱、朋友的提醒,甚至烹饪节目中学到的东西——这些知识并不都来自你自己的具身经验。

会自言自语的机器人

观察 Hi Robot 在面对复杂 prompt 时的内部“思考”,我们可以看到系统如何针对用户 prompt 定义的复杂任务进行推理。

Hi Robot 遵循一个复杂 prompt,该 prompt 要求改变基础 π₀模型的行为;基础模型原本经过训练,会把所有垃圾放入垃圾桶、把所有餐具放入收纳箱。

在这个例子中,π₀接受的训练只是简单地清理桌面,把所有垃圾放进垃圾桶、把所有餐具放进收纳箱。如果任由 π₀自行行动,它就会直接执行这个任务——你可能也有过“自动驾驶”的经历:一边忘了自己原本想做什么,一边仍在执行一项已经熟练的任务。但在 Hi Robot 的控制下,π₀可以适应并遵循这个更复杂的 prompt:Hi Robot 推理出应向 π₀提供哪些修改后的命令,并跟随用户的指令。由于这些命令是用自然语言生成的,我们可以检查它们,看到机器人如何通过“自言自语”来完成任务。

理解用户的上下文评论,与理解复杂 prompt 是类似的问题。正如 Hi Robot 能解析复杂 prompt 一样,它也能在执行任务的同时融入实时反馈。

Hi Robot 融入用户的纠正与反馈。

使用合成数据训练高层策略

训练机器人遵循复杂、开放式 prompt,不能只依赖带有原子命令标注的演示。这类数据本身不太可能提供足够丰富的多步交互示例。为弥补这一空缺,我们提出对数据集进行合成标注:将机器人观测和人工标注的技能,与假设性的 prompt 和人工插话配对。这种方法模拟了真实交互,帮助模型学习如何理解并响应复杂指令。更多技术细节请参阅我们的论文。

我们在桌面收拾、制作三明治和买杂货等真实世界任务上评估 Hi Robot,并与已有方法进行比较。结果显示,Hi Robot 的表现优于 GPT-4o 和扁平 VLA 策略。如下面的定量评估所示,Hi Robot 的指令遵循准确率比 GPT-4o 高 40%,说明它与用户 prompt 和实时观测的对齐程度更强。此外,它还能有效处理多阶段指令、适应实时纠正并遵守约束,从而超过扁平 VLA 策略。论文还包含关于合成数据和分层架构的更多消融研究。

桌面收拾

  • 指令准确率:扁平 VLA 36,GPT-4o 高层策略 35,Hi Robot 74,专家人类 100。
  • 任务进展:扁平 VLA 61,GPT-4o 高层策略 63,Hi Robot 77,专家人类 82。

制作三明治

  • 指令准确率:扁平 VLA 34,GPT-4o 高层策略 13,Hi Robot 83,专家人类 100。
  • 任务进展:扁平 VLA 42,GPT-4o 高层策略 56,Hi Robot 80,专家人类 92。

买杂货

  • 指令准确率:扁平 VLA 39,GPT-4o 高层策略 41,Hi Robot 72,专家人类 100。
  • 任务进展:扁平 VLA 28,GPT-4o 高层策略 72,Hi Robot 85,专家人类 93。

平均值

  • 指令准确率:扁平 VLA 36,GPT-4o 高层策略 30,Hi Robot 76,专家人类 100。
  • 任务进展:扁平 VLA 44,GPT-4o 高层策略 64,Hi Robot 81,专家人类 89。

未来将走向何方?

智能而灵活的机器人系统不仅需要执行灵巧任务,还需要理解环境并推理复杂的多阶段问题。表面上看,Hi Robot 专注于通过 prompt 和反馈与用户交互;但这个系统的最终目标,是让机器人拥有一种类似人类在解决“做一道新菜”这类难题时听见的“内在声音”。与人的交互最直观地体现了这一能力的重要性,但其影响远不止于此:能够思考复杂问题、调动互联网规模预训练所学知识的机器人会更加灵活,展现显著更强的常识推理能力,并最终在开放世界环境中提供更自然的帮助。它们将能理解白板上写着“不要擦除”意味着什么,判断熟睡的人不应被打扰,并意识到易碎物品需要小心处理。我们每天都会做出这些推断,它们不仅基于身体经验,也基于从他人那里学到的知识。LLM 和 VLM 为我们提供了从互联网学习这类知识的强大工具,但要以无缝方式将知识连接到机器人等物理系统,仍面临重大的技术挑战。我们希望 Hi Robot 能成为朝这一方向迈出的重要一步。

如果你对我们的工作、合作或其他问题感兴趣,请写信至 research@physicalintelligence.company。

← 返回研究目录