Press "Enter" to skip to content

美国电脑图形处理器公司NVIDIA和德克萨斯大学奥斯丁分校共同研发出了MimicGen:一种用于机器人的自主数据生成系统

通过模仿学习人类示范,可以训练机器人执行各种操作行为。一种流行的方法涉及通过各种控制界面,让人类操作员与机器人臂进行远程操纵,产生机器人执行不同操作任务的多个示范,并使用这些数据训练机器人独立执行这些任务。最近的努力尝试通过与更多的人类操作员在更广泛的功能范围内收集更多的数据来扩展这个范例。这些研究已经证明,在大规模、多样化的数据集上进行模仿学习可以取得令人印象深刻的性能,使机器人能够推广到新的物体和未知的任务。

这意味着收集大量丰富的数据集是创建广泛熟练的机器人的关键第一步。但是,这一成就只有通过昂贵和耗时的人工工作才能实现。看一个机器人模仿案例研究,该案例中,机器人的任务是将一只可乐罐从一个垃圾桶移动到另一个垃圾桶。尽管只有一个场景、一个物品和一个机器人参与这个简单的任务,但需要一个庞大的数据集200个演示才能达到73.3%的相对成功率。对于最近尝试扩展到具有不同场景和物品的环境的努力,需要更大规模的数据集,包括数万个演示。例如,它表明,只有使用超过20,000个轨迹的数据集,才能推广具有物体和目标微小变化的挑战。

图1:研究人员提供了一个数据生成系统,通过重新利用人类示范使其在新的情境中变得有用,可以从少量人类示范中生成大量不同的数据集。他们使用MimicGen为各种物品、机器人装备和场景设置提供数据。

在约1.5年的RT-1数据收集工作中,涉及到多位人类操作员、多个月份、多个厨房和机器人臂,以97%的成功率成功地重新安排、清理和恢复物品。然而,在现实世界的厨房中实现这样一个系统所需要的年数仍待发现。他们问:“这些数据在多大程度上包含不同的操作行为?”这些数据集可能包括在不同的环境或情况下使用的类似的操作技术。例如,当抓取一个杯子时,无论杯子放在台面的何处,人类操作员的机器人轨迹可能是非常相似的。

将这些轨迹调整到不同的情况中可以帮助产生各种各样的行为。虽然有希望,但这些方法的应用受到其对特定任务和算法的假设的限制。相反,他们希望创建一个可以轻松整合到当前模仿学习过程中并增强各种活动性能的通用系统。在这项研究中,他们提供了一种独特的数据收集技术,该技术可以使用少量的人类示例自动生成跨多种场景的大规模数据集。他们的技术MimicGen将有限数量的人类示范拆分为以物品为中心的部分。

然后,它选择一个人类示范,对每个以物品为中心的部分进行空间改变,将它们拼接在一起,并指导机器人按照这条新路径进行操作,在不同的情境中采集最新的示范,其中包含不同的物体姿势。尽管方法简单,但他们发现这种方法非常擅长从各种情境中生成庞大的数据集。这些数据集可用于模仿学习,以训练能胜任的智能体。

他们的贡献包括以下内容:

• NVIDIA和UT Austin的研究人员提出了MimicGen技术,该技术利用新的情境适应性,从有限数量的人类示范中创建大规模、多样化的数据集。

• 他们展示了MimicGen可以在各种场景配置、物体实例和机器人臂上提供高质量的数据,这些数据在原始示范中没有包含,以通过模仿学习训练熟练的智能体(见图1)。拾取和放置、插入和与关节式物体的互动仅是MimicGen广泛适用于的许多长期和高精度活动中的几个例子,这些活动需要具备不同的操作能力。只使用200个源人类示范,他们为两个模拟器和一个真实的机器人臂的18个任务生成了50,000多个额外的演示。

• 他们的方法与收集更多人类示范相比表现相当;这就引发了一个重要的问题,即何时需要向人类请求额外数据。使用MimicGen生成相同数量的合成数据(例如,从10个人类生成200个示范与从200个人类生成200个示范)会导致相似的代理性能。

Leave a Reply

Your email address will not be published. Required fields are marked *