作者:Sehun Jung(韩国高丽大学博士生)、HyunJee Song(韩国高丽大学博士生)、Dong-Hee Kim(韩国高丽大学博士生)、Reuben Tan(研究员)、Jianfeng Gao(技术院士兼公司副总裁)、Yong Jae Lee(威斯康星大学麦迪逊分校教授)、Donghyun Kim(韩国高丽大学教授)。
概览
视觉-语言模型(VLM)利用图像和文本来规划机器人动作,但在决定做什么动作以及在何处执行这些动作时,仍然面临困难。大多数系统将这两个决策拆分为两步:先由 VLM 用自然语言生成计划,再由单独的模型将其转换为可执行动作。对于长而复杂的任务,这种方法往往会失效,因为自然语言计划在指明动作和位置时可能含糊不清,甚至出现幻觉(图1)。由于规划和空间推理是分开处理的,一个阶段的错误可能会传递到下一个阶段。这引出了一个关键问题:VLM 能否同时判断做什么以及在哪里做?
通过空间锚定进行规划
为了解决这一问题,我们开发了 GroundedPlanBench。在论文《Spatially Grounded Long-Horizon Task Planning in the Wild》中,我们介绍了这一新基准如何评估 VLM 是否能够在多样化的真实世界环境中规划动作,并判断这些动作应在何处执行。我们还构建了 Video-to-Spatially Grounded Planning(V2GP)框架,它将机器人示范视频转换为训练数据,帮助 VLM 学会这种能力。
在开源和闭源 VLM 上进行评估后,我们发现,面向长而复杂任务的空间锚定规划具有挑战性。与此同时,V2GP 同时提升了规划和锚定能力,这些增益在我们的基准测试以及使用机器人的真实世界实验中都得到了验证。
GroundedPlanBench 的运作方式
为了构建更真实的机器人场景,我们基于 Distributed Robot Interaction Dataset(DROID)中的 308 个机器人操作场景建立了这一基准。DROID 是一个大型数据集,收录了机器人执行任务的录制内容。我们与专家合作审查了每个场景,并定义了机器人可以执行的任务。每个任务都以两种方式编写:一种是明确描述动作的显式指令(例如“把勺子放到白盘子上”),另一种是更概括地描述目标的隐式指令(例如“把桌子整理好”)。
对于每个任务,计划都被拆分为四种基本动作:抓取、放置、打开和关闭,每个动作都对应图像中的一个具体位置。抓取、打开和关闭动作对应的是围绕目标物体绘制的框,而放置动作对应的是显示物体应被放置位置的框。
图2展示了中等时长和长时长任务,以及与之对应的显式和隐式指令。总体来看,GroundedPlanBench 包含 1,009 个任务,动作数量范围从 1-4 个(345 个任务)到 5-8 个(381 个),以及 9-26 个(283 个)。
V2GP 的运作方式
V2GP 框架首先利用记录到的夹爪信号,检测机器人与物体发生交互的时刻。随后,它使用多模态语言模型为被操作的物体生成文本描述。在这一描述的引导下,系统使用 Meta 的先进开放词汇图像与视频分割模型 SAM3,在整个视频中跟踪该物体。接着,系统根据跟踪结果构建带空间锚定的计划,识别物体被抓取时的位置以及被放置的位置。
这一过程如图3所示。最终得到 43K 条带空间锚定的计划,长度不一:其中 34,646 条包含 1-4 个动作,4,368 条包含 5-8 个动作,4,448 条包含 9-26 个动作。
评估解耦式规划与空间锚定规划
为了在真实世界机器人场景中评估 GroundedPlanBench,我们使用 Qwen3-VL 作为基础模型。Qwen3-VL 是一种视觉-语言模型,能够处理文本、图像和视频,以支持多模态推理。在不进行额外训练的情况下,它在标准多模态推理基准上表现良好。我们首先在不进行任何任务特定训练的前提下,将它与其他专有模型一起在 GroundedPlanBench 上进行了评估(表1)。随后,我们在 V2GP 训练数据上对其进行了微调,并将其与一种解耦式方法进行比较,在这种方法中,规划和锚定被分别处理。



