跳到正文

AsgardBench:用于视觉感知交互式规划的基准测试

本文介绍 AsgardBench,这是一项建立在 AI2-THOR 上的基准测试,用于评估 AI 智能体在仅获得图像和简单成败反馈时,能否依据视觉感知持续调整家庭任务执行计划。

功思 AI 编辑部

约 3 分钟读完

AsgardBench:用于视觉感知交互式规划的基准测试

作者:Andrea Tupini,研究软件工程师;Lars Liden,首席研究软件工程经理;Reuben Tan,研究员;Yu Wang,首席 RSDE;Jianfeng Gao,技术院士兼公司副总裁。

概览

设想一台被指派去清理厨房的机器人。它需要观察周围环境、决定该做什么,并在事情没有按预期发展时作出调整,例如,它被要求清洗的马克杯其实已经是干净的,或者水槽里已经放满了其他物品。这正是具身 AI 的领域:能够感知环境并在其中行动的系统。

这一领域进展很快,但评估这些系统并不像看上去那么简单。许多基准会同时测试感知、导航和物理控制,这使人们难以分辨:一个 AI 智能体究竟是真的在利用它感知到的信息做出更好的决策,还是仅仅因为环境足够可预测,可以通过脚本化方式应对。

为了解决这一问题,我们创建了 AsgardBench。在论文《AsgardBench — Evaluating Visually Grounded Interactive Planning Under Minimal Feedback》中,我们介绍了这一基准如何提出一个简单但要求很高的挑战:给 AI 智能体一个家庭任务,让它通过图像观察环境,再看它是否能在感知结果与预期不一致时调整计划。它能否注意到需要清洗的马克杯已经在水槽里,或者并不在水槽里,并据此采取相应行动?这正是 AsgardBench 旨在回答的核心问题。

AsgardBench 建立在 AI2-THOR 之上。AI2-THOR 是一个交互式 3D 仿真环境,用于训练和评估 AI 智能体执行家庭任务。在 AsgardBench 中,智能体会被放置在物体附近,并被赋予一组小而固定的动作,例如 find、pickup、put、clean 和 toggle_on/off。每一轮中,智能体都会提出一整套完成任务的步骤序列,但实际只执行第一步。整个过程中,关注点明确放在计划调整上,不是看智能体能否在房间中导航或操纵物体,而是看它能否利用感知到的信息修正下一步。

例如,智能体可能发现一个马克杯是干净的、脏的,或装着咖啡;它也可能观察到水槽里还有许多其他物品,因此同一条指令在任务推进过程中可能需要不同的动作序列。图 1 展示了这一过程。

工作方式

智能体一开始就处于可以直接交互的位置,因此导航和视角选择不构成影响因素。find 动作会把物体带入视野,环境则负责处理容器尺寸和摆放等细节,因此智能体不需要去推理该使用哪个橱柜或台面。它唯一的输入是彩色图像、带有简单成功或失败信号的历史尝试动作,以及它自己对下一步计划的记录。

在每一轮中,智能体都会提出一整套完成任务的步骤,但只有第一步会真正执行。随后,它会收到新的图像,以及一个简单信号:该动作成功了还是失败了?这防止智能体一开始就把全部流程脚本化,并迫使它在每一步都重新评估和修订计划。对总步数和重复动作的内置限制也避免了无休止循环。由于环境只提供简单反馈,智能体必须能够注意到自己所感知到的内容,例如马克杯是否脏了、水龙头是否在出水,并在任务推进过程中持续跟踪自己所处的状态。

评估 AsgardBench

我们在 AsgardBench 上测试了多款领先的视觉能力模型,并观察到,表现优异的模型若要稳定成功,必须以视觉感知为依据。在这些模型中,视觉输入都显著提升了表现:与只提供场景文本描述相比,大多数模型在获得图像输入后,成功率提升了两倍以上。这与一些早先的基准不同,在那些基准中,智能体即使没有视觉,也可以通过依赖关于哪里出错的文本反馈而取得相当不错的表现。

提供这类详细的失败信息,同样会提升 AsgardBench 中所有模型的表现,但这也可能掩盖真正的问题。即便为纯文本智能体提供了详细反馈,最强的视觉能力模型仍然表现更好,这表明该基准确实需要仅靠文本无法替代的视觉依据。AsgardBench 的表现见图 2。

参与讨论

正在确认登录状态…