跳到正文

AsgardBench:一个用于视觉扎根交互式规划的基准

微软研究团队介绍了 AsgardBench。这一基于 AI2-THOR 的基准用于评估 AI 智能体在仅有图像和最少反馈时,能否根据环境感知持续调整家庭任务计划。

功思 AI 编辑部

约 3 分钟读完

AsgardBench:一个用于视觉扎根交互式规划的基准

作者:研究软件工程师 Andrea Tupini、首席研究软件工程经理 Lars Liden、研究员 Reuben Tan、首席 RSDE Yu Wang、技术院士兼公司副总裁 Jianfeng Gao

概览

设想一台被分配去清洁厨房的机器人。它需要观察环境,决定该做什么,并在事情没有按预期发展时作出调整,例如,它被要求清洗的马克杯其实已经干净了,或者水槽里已经堆满了其他物品。这就是具身 AI 的领域:能够感知环境并在其中行动的系统。

这一领域进展迅速,但对这类系统进行评估并不像看上去那么简单。许多基准同时测试感知、导航和物理控制,因此很难分辨一个 AI 智能体究竟是在利用它所感知到的信息做出更好的决策,还是只是因为环境足够可预测,因而可以用脚本化方式应对。

为了解决这个问题,我们创建了 AsgardBench。在论文《AsgardBench — Evaluating Visually Grounded Interactive Planning Under Minimal Feedback》中,我们介绍了这项基准如何提出一个简单但要求很高的挑战:给 AI 智能体一个家庭任务,让它通过图像观察环境,并在感知到的情况与预期不一致时,看它能否调整自己的计划。它能否注意到自己需要清洗的马克杯已经在水槽里,或者并不在,并据此采取相应行动?这正是 AsgardBench 试图回答的核心问题。

AsgardBench 构建在 AI2-THOR 之上。AI2-THOR 是一个交互式 3D 仿真环境,用于在家庭任务上训练和评估 AI 智能体。在 AsgardBench 中,智能体会被放置在靠近物体的位置,并获得一组小而固定的动作,例如 find、pickup、put、clean 和 toggle_on/off。每一轮中,智能体都会提出完成任务的完整步骤序列,但实际只执行第一步。整个设计的重点明确放在计划调整上,不是看智能体能否在房间中导航或操控物体,而是看它能否利用所感知到的信息来修正下一步。

例如,智能体可能会发现一个马克杯是干净的、脏的,或者装着咖啡;它也可能观察到水槽里还有很多其他物品,因此同一条指令会随着任务展开而需要不同的动作序列。图 1 展示了这一过程。

工作方式

智能体一开始就处在可以直接交互的位置,因此导航和视角选择都不是影响因素。find 动作会让物体进入视野,环境则会处理容器尺寸和摆放位置等细节,因此智能体不需要推理该使用哪个橱柜或台面。它唯一的输入是彩色图像、带有简单成功或失败信号的历史尝试动作,以及它自己对下一步计划的记录。

每一轮中,智能体都会提出完成任务的完整步骤序列,但只有第一步会被执行。随后,它会接收到新的图像,以及一个简单信号:该动作成功了还是失败了?这会阻止智能体一开始就把所有内容脚本化,并迫使它在每一步重新评估并修订自己的计划。对总步数和重复动作设置的内置限制,也避免了无休止的循环。由于环境只提供简单反馈,智能体必须能够注意到自己感知到的情况,例如马克杯是否脏、水龙头是否在出水,并在一步步推进任务时持续追踪自己所处的状态。

评估 AsgardBench

我们在 AsgardBench 上测试了多款领先的视觉能力模型,并观察到,高表现模型要想稳定成功,需要视觉扎根。在这些模型中,视觉输入都显著提升了表现:与仅提供场景文本描述相比,大多数模型在获得图像时的成功率提升了两倍以上。这与一些以往的基准不同,在那些基准中,智能体即使没有视觉,也可以依靠关于哪里出错的文本反馈而取得还不错的表现。

在 AsgardBench 中,提供这类详细的失败信息同样会提升所有模型的表现,但这可能会掩盖真正的问题。即使给仅文本智能体提供详细反馈,最强的视觉能力模型仍然优于它们,这表明该基准确实要求视觉扎根,而这不是单靠文本就能复制的。图 2 展示了 AsgardBench 的表现。

参与讨论

正在确认登录状态…