Press "Enter" to skip to content

“结识PaLM-E:一个新的拥有5620亿参数的具身多模态语言模型,能够执行机器人操作规划、视觉问答等任务”

“结识PaLM-E:一个新的拥有5620亿参数的具身多模态语言模型,能够执行机器人操作规划、视觉问答等任务” 四海 第1张“结识PaLM-E:一个新的拥有5620亿参数的具身多模态语言模型,能够执行机器人操作规划、视觉问答等任务” 四海 第2张

大型语言模型(LLMs)展示了在包括对话、逐步推理、数学问题解决和代码撰写在内的各个领域中的强大推理能力。尽管将大量文本数据用于LLMs的训练可以产生与其物理环境有关的表示,但将这些表示与真实世界的视觉和物理传感器模态相连接对于解决计算机视觉和机器人领域中更广泛的基于真实世界的问题至关重要。

以前的工作将LLMs的输出与学习到的机器人策略和可行性函数结合起来进行决策,但这种方法受到限制。以前的工作的局限性在于LLM只接收文本输入,这对于许多需要场景的几何配置至关重要的任务来说是不足够的。此外,他们的研究表明,在常见的视觉语言任务(如视觉问答)上训练的最先进的视觉语言模型无法直接解决机器人推理问题。在这项研究中,来自Google和TU Berlin的研究人员提出了具有体现的语言模型,该模型直接包括来自具体代理的传感器模态的连续输入,并允许语言模型在实际世界中进行更准确的顺序决策。他们开发了PaLM-E,这是一个单一的大型具体化多模态模型,具有积极的迁移效果,可以解决多种观察模态下的多种具体化推理问题。

PaLM-E LLM表现出积极的迁移效果,即学习者在学习第二语言(L2)时可以将他们在第一语言(L1)中的知识或技能应用于L2学习中,从而更快、更有效地掌握L2。例如,如果学习者的L1与他们正在学习的L2具有相似的语法结构,他们可能能够利用对L1语法的了解来更快地理解和应用L2语法规则。同样,如果学习者的L1和L2共享同源词(在两种语言中拼写和含义相似的词),他们可以通过识别和记忆这些同源词来快速扩展他们的L2词汇量。积极迁移与负迁移相对应,负迁移发生在学习者的L1的知识或技能干扰他们获得L2的能力时。例如,如果学习者的L1的语法结构与他们的L2大相径庭,即使他们在理解上理解了L2的语法规则,他们也可能在正确应用L2的语法规则时遇到困难。

与基于Transformer的LLM的自注意力层处理语言标记的方式类似,图片和状态估计等输入也被合并到与语言标记相同的潜在嵌入中。他们首先通过编码器将连续输入注入到预训练的LLM中。这些编码器经过端到端训练,可以产生自然语言中的顺序判断,具体化代理可以通过配置低层规则或响应具体化查询来理解这些判断。通过对比各种输入表示(例如标准与以物体为中心的ViT编码用于视觉输入)、在训练编码器时冻结与微调语言模型以及研究在多个任务上进行联合训练是否能够实现迁移,他们在一系列情境中评估了这种方法。

他们在三个机器人操作领域(其中两个在真实世界中是闭环的)、常见的视觉语言任务(如VQA和图片描述)和语言任务上测试了这种技术,以确定该方法的广度。根据他们的研究结果,多任务训练相对于单一任务训练可以提高性能。他们展示了在机器人任务中这种任务之间的迁移可能导致更高的数据效率,包括在新的物品组合或未知对象上表现出一次性或零次性的泛化,并大大提高从少量训练样本中的学习性能。据他们所知,将540B的PaLM LLM和22B的Vision Transformer(ViT)结合起来创建了迄今为止发表的最大的视觉语言模型,使PaLM-E扩展到了562B个参数。

在没有使用任务特定的微调的情况下,PaLM-E-562B在OK-VQA基准测试上取得了最先进的性能。他们还发现,即使只在单个图像示例上进行训练,PaLM-E-562B显示出了广泛的技能,包括零次多模态思维链(CoT)少量提示、无OCR算术推理和多图像推理。在他们的知识范围内,使用端到端模型在多模态数据上展示零次CoT尚未被证明具体化程序。

总结他们的主要贡献,他们(1)建议并展示了如何在训练多模态大型语言模型时包含具体化数据,以创建一个通用的、迁移学习的、多具体化决策代理。他们证明,即使最先进的通用视觉语言模型在开箱即用的情况下不能有效解决具体化推理问题(零-shot),也有可能训练一个既有效的具体化推理器又能胜任任务的通用视觉语言模型。在研究这种模型的最佳训练方法时,

他们(3)提供了新的架构概念,包括实体标记的多模态标记和神经场景表示。最后但并非最不重要的是,他们(4)证明了PaLM-E不仅是一个具体化推理器,而且还是一个定量技能丰富的视觉和语言通用模型,并且(5)显示扩大语言模型的规模可以实现多模态微调而减少灾难性遗忘。可以在他们的项目网站上找到各种演示。

Leave a Reply

Your email address will not be published. Required fields are marked *