

我们在日常生活中如何做决策?我们常常根据我们的常识有偏见。那么机器人呢?他们能根据常识做出决策吗?成功完成人类指令需要具备常识的具体化代理。由于对实际世界更多细节的需求,现有的LLMs产生了不可行的行动序列。
北京国家信息科学与技术研究中心和自动化学院的研究人员提出了一种在具有物理场景约束的具体化任务中的任务规划代理(TaPA)。这些代理通过将LLMs与视觉感知模型对齐,根据场景中现有的对象生成可执行计划。
研究人员声称,TaPA能够在不限制任务类型和目标对象的情况下生成具体化的计划。他们首先创建了一个多模态数据集,其中每个样本是一个视觉场景、指令和相应计划的三元组。从生成的数据集中,他们通过根据场景的对象列表预测动作步骤来微调预训练的LLaMA网络,进一步将其指定为任务规划器。
然后,具体化代理有效地访问站立点以收集RGB图像,为多视角图像的开放词汇探测器提供足够的各种视图信息。这个整体过程允许TaPA根据场景信息和人类指令逐步生成可执行的动作。
他们如何生成多模态数据集?其中一种方法是利用视觉语言模型和大规模多模态模型。然而,由于缺乏大规模的多模态数据集来训练规划代理,在现实室内场景中创造和实现具体化任务规划是具有挑战性的。他们使用GPT-3.5结合提供的场景表示和设计提示来生成用于微调规划代理的大规模多模态数据集。
研究人员通过预训练的LLMs训练了任务规划器,并构建了包含80个室内场景、15K条指令和行动计划的多模态数据集。他们设计了几种图像收集策略,以探索周围的3D场景,如随机位置的位置选择标准和旋转相机以获取每个位置选择标准的多视角图像。受到聚类方法的启发,他们将整个场景分成几个子区域,以提高感知的性能。
研究人员声称,TaPA代理的生成行动计划的成功率要高于最先进的LLMs,包括LlaMA和GPT-3.5,以及大规模多模态模型如LLaVA。与LLaVA和GPT-3.5相比,TaPA能更好地理解输入对象列表,幻觉案例的百分比分别减少了26.7%和5%。
研究人员声称,他们收集的多模态数据集的统计数据表明,这些任务比传统的指令跟踪任务更加复杂,实施步骤更长,需要进一步进行优化的新方法。