Meta AI,一家领先的人工智能(AI)研究机构,最近发布了一种具有突破性的算法,承诺将彻底改变机器人领域。在他们的研究论文《从人类视频中获取作为机器人多功能表示的可供性》中,作者探讨了将YouTube视频应用于机器人学习和复制人类动作的强大训练工具。通过利用在线教学视频的丰富资源,这种尖端算法旨在弥合静态数据集和真实世界机器人应用之间的差距,使机器人能够以更大的多样性和适应性执行复杂任务。 这种创新方法的核心是“可供性”概念。可供性代表对象或环境提供的潜在行为或互动。通过通过分析人类视频来训练机器人理解和利用这些可供性,Meta AI的算法为机器人提供了一个多功能表示,用于执行各种复杂任务。这一突破提高了机器人模仿人类动作的能力,并赋予它们在新的和不熟悉的环境中应用所获得的知识的能力。 为了确保将这种基于可供性的模型无缝集成到机器人的学习过程中,Meta AI的研究人员将其纳入了四种不同的机器人学习范式中。这些范式包括离线模仿学习,探索,目标条件学习和强化学习的动作参数化。通过将可供性识别的能力与这些学习方法相结合,机器人可以获得新的技能,并以更高的精度和效率执行任务。 为了有效地训练可供性模型,Meta AI利用大规模的人类视频数据集,如Ego4D和Epic Kitchens。通过分析这些视频,研究人员使用现成的手-物体交互检测器来识别接触区域并跟踪接触后手腕的轨迹。然而,当场景中的人物存在时,会出现一个重要挑战,即分布转移。为了克服这个障碍,研究人员利用可用的相机信息将接触点和接触后轨迹投影到一个与人无关的框架中,然后将其作为输入提供给他们的模型。 在这一突破之前,机器人在模仿动作方面的能力有限,主要局限于复制特定环境。然而,通过Meta AI的最新算法,在泛化机器人动作方面取得了重大进展。这意味着机器人现在可以在新的和不熟悉的环境中应用所获得的知识,展示出更高的适应性。 Meta AI致力于推进计算机视觉领域的发展,并促进研究人员和开发人员之间的合作。根据这一承诺,该组织计划共享其项目的代码和数据集。通过使这些资源对其他人可访问,Meta AI旨在鼓励对这项技术进行进一步的探索和开发。这种开放的方法将促进自学习机器人的发展,它们可以从YouTube视频中获得新的技能和知识,推动机器人领域进入新的创新领域。
Leave a CommentTag: Tech News
在一系列前所未有的事件中,一种名为Zeroscope的下一代开源AI模型已经在市场上推出,具备在现代图形卡上运行最先进的文本到视频服务的能力,并且以相对较低的成本提供给用户。中国的Modelscope旗下的Zeroscope旨在通过解锁新的AI用例,彻底改变媒体和视频创作领域。 了解Zeroscope的功能组成对于理解它如何通过文本革新视频生成领域非常重要。这个开源模型的独特之处在于它的两个关键组件,Zeroscope V2和Zeroscope V2XL;Zeroscope_v2 567w,用于以576×320像素的分辨率快速创建内容以探索视频概念。然后可以使用zeroscope_v2_XL将高质量视频升级到“高清”分辨率1024×576,因此用户可以使用ZeroScope V2快速创建视频,然后使用V2XL进行升级。 除此之外,由于多级模型的17亿个参数,Zeroscope的要求令人惊讶地易于管理。Zeroscope在较低分辨率下的VRAM需求为7.9千兆字节,而在较高分辨率下为15.3千兆字节。较小的模型可以在许多标准图形卡上执行,使其可供更广泛和更一般的用户使用。 Zeroscope通过对近10,000个剪辑和近30,000个帧进行偏移噪声的战略训练。这种非传统的行为组合为Zeroscope开启了新的机遇和可能性。通过引入随机物体移动、帧时序的微小变化和轻微扭曲等变化,模型改善了对数据分布的理解,从而帮助模型以多样化的尺度生成更真实的视频,并有效地解释文本描述中微妙的变化。凭借所有这些功能,Zerscope迅速成为商业文本到视频模型提供商Runway的有力竞争对手。 文本到视频作为一项工作仍在进展中,生成的视频片段往往较短且存在一些视觉缺陷。然而,如果我们看一下图像AI模型的发展历程,它们在达到照片逼真质量之前也面临了类似的挑战。主要挑战是视频生成在训练和生成阶段都需要更多的资源。 Zeroscope作为一种强大的文本到视频模型的出现为许多新的数字进展和用例铺平了道路,例如: 个性化游戏、虚拟现实和元宇宙:Zeroscope的转换能力可以重新定义视频游戏中的故事叙述。玩家可以通过他们的话语实时影响剪辑和游戏玩法,实现难以想象的互动和个性化。此外,游戏开发者可以快速原型和可视化游戏场景,加快开发速度。 个性化电影:Zeroscope的技术通过基于用户描述生成个性化内容来颠覆媒体行业。用户可以输入情节或场景描述,并根据其回应创建个性化视频。此功能可以实现观众的积极参与,并为定制内容创作开辟了新的途径,例如个性化视频广告或用户定制的电影场景。 合成创作者:Zeroscope为依靠AI将其想法编写、制作和编辑成现实的新一代创作者铺平了道路。它消除了视频创作中的技术技能障碍,并有可能为自动化、高质量的视频内容建立新的标准。人类和AI创作者之间的界限变得模糊,拓宽了创造力的领域。 Zeroscope旨在成为一种轻量级的突破性模型,可以轻松进行微调,并且不需要特殊的资源设置,使其不仅成为多个普通用户可以使用的工具,而且许多缺乏大型实验室资源的新兴研究人员现在可以使用此类算法来更好地理解它们并以合理的成本推进整个领域的发展。看到激烈竞争将激励Zeroscope的创作者创新并占据强劲的市场地位将是令人惊叹的。
Leave a Comment多模态大型语言模型(MLLMs)在各种活动中已经展示了成功,包括语言、视觉和视觉语言任务。在零样本和少样本条件下,MLLMs可以感知文本、图片和音频等通用模态,并使用自由形式的文本生成答案。在本研究中,它们使多模态大型语言模型具备自我定位的能力。对于视觉语言任务,定位能力可以提供更实用和有效的人工智能界面。该模型可以解释图片区域及其地理坐标,让用户可以直接指向图像中的物品或区域,而不是输入冗长的文本描述来引用它。 图1:展示了使用KOSMOS-2生成的选定样本。视觉定位、定位问题回答、使用边界框的多模态引用、定位图片字幕和视觉定位都是一些例子。 该模型的定位功能还使其能够提供视觉响应(即边界框),这可以帮助其他视觉语言任务,如理解指代表达式。与仅基于文本的响应相比,视觉响应更精确,能够消除指代模糊。生成的自由形式文本响应的定位能力可以将名词短语和指代术语与图片区域连接起来,以产生更准确、丰富和详尽的响应。微软研究的研究人员介绍了具备定位能力的多模态大型语言模型KOSMOS-2,该模型基于Transformer通过下一个单词预测任务进行训练。 他们构建了一个基于网络规模的数据集,其中包含了图片和文本的定位配对,并将其与KOSMOS-1中的多模态语料库进行整合,以充分利用定位的潜力训练模型。定位的图片和文本配对是来自LAION-2B和COYO-700M的子集。他们提供了一个流程,从字幕中提取和连接文本片段(如名词短语和指代表达式)到图片中相应对象或区域的空间位置(如边界框)。他们将边界框的地理坐标转化为一串位置标记,并在相应的文本片段之后添加。数据格式充当了将图像元素与字幕链接起来的“超链接”。 实验结果表明,KOSMOS-2在定位任务(短语定位和指代表达理解)和指代任务(指代表达式生成)上表现优秀,并且在KOSMOS-1评估的语言和视觉语言任务上也表现出竞争力。图1说明了通过定位功能,KOSMOS-2可以用于更多的下游任务,如定位图片字幕和定位视觉问题回答。GitHub上提供了在线演示。
Leave a Comment多年来,文本到图像生成领域得到了广泛的探索,并取得了重要进展。研究人员通过在大规模数据集上训练大规模模型,实现了零样本文本到图像生成,能够处理任意文本输入。DALL-E和CogView等开创性作品为研究人员提出了许多方法,使得生成与文本描述对齐的高分辨率图像成为可能,展现了卓越的保真度。这些大规模模型不仅革新了文本到图像生成,还对包括图像处理和视频生成在内的其他各种应用产生了深远影响。 尽管上述大规模文本到图像生成模型在生成与文本对齐的创造性输出方面表现出色,但在生成用户指定的新颖和独特概念时往往面临挑战。因此,研究人员探索了各种方法来定制预训练的文本到图像生成模型。 例如,一些方法涉及使用有限数量的样本对预训练生成模型进行微调。为了防止过拟合,采用不同的正则化技术。其他方法旨在将用户提供的新概念编码为单词嵌入。这种嵌入可以通过优化过程或来自编码器网络获得。这些方法使得能够根据用户输入文本定制生成新概念,同时满足额外的要求。 尽管文本到图像生成取得了重大进展,但最近的研究引发了对正则化方法在定制化方面潜在局限性的担忧。有人怀疑这些正则化技术可能会无意中限制定制化生成的能力,导致细节的丢失。 为了克服这一挑战,提出了一种新颖的框架ProFusion。其架构如下所示。 ProFusion包括一个称为PromptNet的预训练编码器,它从输入图像和随机噪声中推断出条件词嵌入,以及一种称为Fusion Sampling的新型采样方法。与先前的方法相比,ProFusion在训练过程中消除了对正则化的要求。相反,该问题在推理过程中通过Fusion Sampling方法有效地解决。 实际上,作者认为,尽管正则化可以实现受文本条件限制的内容创作,但它也会导致细节信息的丢失,从而导致性能下降。 Fusion Sampling在每个时间步骤包括两个阶段。第一步是融合阶段,它将输入图像嵌入和条件文本的信息编码为带有噪声的部分输出。之后,进行改进阶段,根据选择的超参数更新预测。更新预测有助于Fusion Sampling保留输入图像的细节信息,并将输出条件化为输入提示。 这种方法不仅节省了培训时间,还消除了与正则化方法相关的超参数调整的需要。 下面报告的结果不言自明。 我们可以看到ProFusion与最先进的方法进行了比较。提出的方法在保留与面部特征相关的细节方面表现优异。 这就是ProFusion的摘要,一种具有最先进质量的无正则化框架,用于文本到图像生成。如果您感兴趣,可以在下面的链接中了解更多关于这种技术的信息。
Leave a Comment在MosaicML-7B取得巨大成功之后,MosaicML再次超越了他们之前设定的基准。在这个新的突破性发布中,MosaicML推出了MosaicML-30B。 MosaicML是一个非常精确和强大的预训练transformer。MosaicML声称,MosaicML-30B甚至比ChatGPT3更好。 MosaicML-30B发布之前,MosaicML-7B已经席卷了人工智能界。MPT-7B的基础指导、基础聊天和故事创作都取得了巨大的成功。公司声称,这些模型在全球下载了300多万次。推动MosaicML推出更好的引擎(如MPT-30B)的最大原因之一是社区对他们之前发布的模型的热衷。 令人难以置信的是,社区如何运用这些MPT引擎构建出更好的调整并提供具体的使用案例。一些有趣的案例包括LLaVA-MPT。LLaVa-MPT将视觉理解添加到预训练的MPT-7B中。 类似地,GGML优化MPT引擎以在Apple Silicon和CPU上更好地运行。GPT4ALL是另一个使用案例,它让您使用MPT作为基础引擎运行类似于GPT4的聊天选项。 仔细观察,MosaicML能够给大公司带来激烈竞争和更好的替代品的最大原因之一是他们提供的竞争性特性列表以及他们的模型相对于不同用例的适应性和相对简单的集成。 在这个发布中,MosaicML还声称他们的MPT-30B比现有的ChatGPT3表现更好,但使用的参数数量只有ChatGPT的三分之一,使其成为相对于现有生成解决方案来说非常轻量级的模型。 它比MosaicML现有的MPT-7B更好,并且这个MPT-30B可以在商业许可下进行商业使用。 不仅如此,MPT-30B还带有两个预训练模型,即MPT-30B-Instruct和MPT-30B-Chat,这两个模型能够受到单个指令的影响,并且能够进行较长时间的多轮对话。 它之所以更好的原因还有很多。MosaicML设计MPT-30B采用自下而上的方法,确保每个移动部件都能更好地执行和更高效地运行。MPT-30B通过8k个标记上下文窗口进行训练。它通过ALiBi支持更长的上下文。 借助FlashAttention,它改进了训练和推断性能。MPT-30B还具备更强的编码能力,这要归功于他们所处理的数据的多样性。该模型在Nvidia的H100上扩展到了8K的上下文窗口。该公司声称,就他们所知,这是在H100上进行训练的第一个LLM模型,而这些模型对于客户来说是随时可用的。 MosaicML还保持了模型的轻量级,这有助于新兴组织降低运营成本。 MPT-30B的大小也是特意选择的,以便在单个GPU上轻松部署。1xA100-80GB以16位精度或1xA100-40GB以8位精度可以运行该系统。其他相当的LLMs,如Falcon-40B,具有更大的参数数量,并且不能在单个数据中心GPU上提供服务(今天);这就需要2个或更多的GPU,从而增加了最低推理系统成本。
Leave a Comment自从Transformer设计被发现以来,训练大型人工神经网络的技术已经取得了巨大进展,但支撑这一成就的科学仍处于萌芽阶段。在Transformer发布的同时,一种秩序感逐渐形成,这种秩序在同一时间的大量复杂结果中展现出来,表明性能随着计算量或网络规模的增加而可预测地提高,这种现象现在被称为缩放定律。这些缩放规则成为后续深度学习规模研究的指南,而对这些定律变化的发现导致了性能的大幅提升。 在本文中,研究者探讨了如何通过不同的方式提高数据质量。高质量的数据可以产生更好的结果;例如,数据清洗是创建当前数据集的关键步骤,可以使数据集相对较小或能够通过更多迭代运行数据。最近针对TinyStories的研究表明,高质量数据的好处远不止于此。通过大幅改变缩放定律,改善数据质量可能使得能够用更瘦的训练/模型匹配大规模模型的性能。 在本研究中,微软研究的作者证明了高质量的数据可以进一步提高大型语言模型的最先进技术,同时显著减少数据集的大小和训练计算量。较小的模型需要更少的训练,可以大大减少LLM的环境成本。他们从文档字符串中构建了特定的Python函数,使用LLM进行编码训练。HumanEval是后一篇论文中建议使用的评估标准,常用于比较LLM在代码上的性能。 他们通过对1.3B参数模型进行大约8次7B令牌(略大于50B总令牌数)的预训练,然后对少于2亿个令牌进行微调,展示了高质量数据违反现有缩放规则的能力。总的来说,他们在“课本质量”的数据上进行预训练,包括人工创造的(使用GPT-3.5)和从网络来源筛选的,然后在“类似于课本的练习”数据上进行微调。尽管数据集和模型大小都比竞争模型小几个数量级,但他们在HumanEval上获得了50.6%的pass@1准确率,在MBPP(Mostly Basic Python Programs)上获得了55.5%的pass@1准确率,这是仅使用一个LLM生成的最佳自我报告数字之一。 通过对1.3B参数模型进行大约8次7B令牌的预训练(观察总令牌数略大于50B),然后对少于2亿个令牌进行微调,他们展示了高质量数据违反现有缩放规则的能力。总的来说,他们在“课本质量”的数据上进行预训练,包括人工创造的(使用GPT-3.5)和从网络来源筛选的,然后在“类似于课本的练习”数据上进行微调。尽管数据集和模型大小都比竞争模型小几个数量级,但他们在HumanEval上获得了50.6%的pass@1准确率,在MBPP(Mostly Basic Python Programs)上获得了55.5%的pass@1准确率,这是仅使用一个LLM生成的最佳自我报告数字之一。
Leave a Comment近几个月,由于大规模语言模型(LLMs)的广泛公开部署,倡导者、政治家和来自各个学科的学者都表现出了极大的兴趣和活动。虽然这种关注是有道理的,因为新技术带来了紧迫的问题,但它也可能忽略了一些关键因素。 最近,大规模语言模型以及基于它们构建的产品,例如ChatGPT,引起了来自记者、政策制定者和跨学科学者的广泛关注。然而,由于这种技术在很多方面都是出人意料的,简明扼要的解释很容易忽略关键细节。 这其中有八个意想不到的方面: LLMs的能力将随着更多的投资而可预测地增加,即使没有刻意的创新。 LLMs的研究和投资的最近增加可以在很大程度上归因于规模定律的结果。当研究人员增加将来模型中输入的数据量、模型的大小(以参数为单位)以及用于训练它们的计算量时,规模定律允许他们精确地预测这些模型将具有多么有能力(以FLOP为单位)的某些粗略但相关的指标。因此,他们可能做出一些关键的设计决策,例如在特定预算内的最佳模型大小,而无需进行大量昂贵的实验。 在当代人工智能研究的背景下,预测的准确率是前所未有的。由于它使研发团队能够提供数百万美元的模型培训计划,并确信这些项目将成功开发出经济上有益的系统,因此它也是推动投资的有力工具。 尽管最先进的LLMs的训练方法尚未公开,但最近的深入报告暗示这些系统的基本架构甚至没有改变。 随着资源不断注入LLMs,常常会出现意想不到的关键行为。 在大多数情况下,模型正确预测未完成文本的延续能力(根据其预训练测试损失衡量)只能通过缩放规则来预测。 尽管这个指标平均上与模型在许多实际活动中的实用性相关,但很难预测模型何时开始展示特定的才能或成为执行特定任务的能力。 更具体地说,GPT-3的能力执行少量样本学习——也就是在单次交互中从少量示例中学习新任务——以及思维链推理——也就是在请求时写出其推理,如同学生在数学考试上所做的那样,并展示出更好的表现——使其成为第一个现代LLM。 未来的LLMs可能会开发出所需的任何功能,并且很少有被普遍接受的界限。 然而,LLMs所取得的进展有时比专家预期的要少。 LLMs经常获取并使用外部世界的表示。 越来越多的证据表明,LLMs建立了世界的内部表示,使它们能够以对文本的特定语言形式不敏感的抽象层次进行推理。这种现象的证据在最大和最新的模型中最为强烈,因此应该预计在更大规模的系统中,这种现象将变得更加强大。 然而,当前的LLMs需要更加有效地做到这一点。 以下发现基于各种实验技术和理论模型,支持这种说法。 模型的内部颜色表示与人类感知颜色的实证发现高度一致。 模型可以推断作者的知识和信念,预测文档的未来走向。 故事用于告诉模型,然后模型会改变其对故事中所代表的对象的特征和位置的内部表示。 有时,模型可以提供如何在纸上描绘奇怪事物的信息。 许多常识推理测试都被模型通过了,即使是像Winograd Schema Challenge这样的测试,也没有任何文本提示答案。 这些发现反驳了传统智能模型仅仅是统计下一个词的预测器,并且无法推广其学习或推理超越文本的普遍观点。…
Leave a CommentAI幻觉并非新问题。人工智能(AI)在过去几年取得了显著进展,变得更加熟练,可以执行以前只能由人类完成的活动。然而,幻觉是一个对AI构成了巨大障碍的问题。开发者已经警告,AI模型产生完全错误的事实并用虚构的答案回答问题,似乎这些答案是真实的,这可能会危及应用程序的准确性、可靠性和信任度,因此幻觉是开发和部署AI系统的严重障碍。因此,从事AI工作的人正在积极寻求解决这个问题的方法。本文将探讨AI幻觉的影响和影响,以及用户可能采取的减少接受或传播不正确信息的危险的措施。 什么是AI幻觉? 所谓人工智能幻觉的现象是指AI模型产生了预期之外的结果。请注意,一些AI模型已经被教导了有意地制造没有与现实世界输入(数据)相关联的输出。 幻觉是用来描述当AI算法和深度学习神经网络创建结果不是真实的、不匹配算法接受过的任何数据或没有遵循任何其他可辨别的模式的情况。 AI幻觉可以采取许多不同的形式,从制造虚假新闻报道到虚假的关于人、历史事件或科学事实的断言或文件。例如,像ChatGPT这样的AI程序可以制造一个有完整传记和从未真实存在的成就的历史人物。在当前社交媒体和即时通信的时代,一个单一的推文或Facebook帖子可以在几秒钟内达到数百万人,这种不正确信息传播的潜力尤其令人担忧。 为什么会发生AI幻觉? 具有欺骗AI程序使其误分类的输入数据——对抗性示例——可能会导致AI幻觉。例如,开发人员使用数据(例如图像、文本或其他类型)来训练AI系统;如果数据被改变或扭曲,应用程序将以不同的方式解释输入并产生不正确的结果。 使用编码器-解码器(输入-输出)序列,AI中的变压器是一种深度学习模型,它利用自我关注(语句中单词之间的语义联系)创建类似于人类写作的文本。对于幻觉而言,如果语言模型的训练数据和资源充足且准确,那么预期输出将是虚构的和错误的。语言模型可能会产生一个故事或叙述,没有不合逻辑的间隙或模糊的联系。 发现AI幻觉的方法 作为人工智能的一个子领域,计算机视觉旨在教会计算机从视觉输入(例如图片、绘画、电影和现实生活)中提取有用的数据,它正在培训计算机像人类一样看待世界。但是,由于计算机不是人类,它们必须依靠算法和模式来“理解”图片,而不是直接接触人类感知。因此,人工智能可能无法区分薯片和落叶。这种情况也经过了常识测试:与人类可能看到的相比,AI生成的图像。当然,随着AI变得更加先进,这变得越来越困难。 如果人工智能没有迅速融入日常生活,这一切都会显得荒谬和有趣。自动驾驶汽车已经采用了人工智能,其中幻觉可能导致死亡。虽然这还没有发生,但在实际世界中开车时误认物品是一场灾难,只等发生。 在使用流行的AI应用程序时,以下是几种识别AI幻觉的技术: 1. 大型语言处理模型 像ChatGPT这样的大型处理模型生成的信息中的语法错误是罕见的,但当它们发生时,你应该对幻觉持怀疑态度。同样,当生成的文本内容不合理、不符合提供的上下文或与输入数据不匹配时,应该对幻觉持怀疑态度。 2. 计算机视觉 人工智能有一个子领域叫做计算机视觉,机器学习和计算机科学,它使机器能够像人眼一样检测和解释图像。它们依赖于卷积神经网络中的大量视觉训练数据。 如果用于训练的视觉数据模式发生变化,就会出现幻觉。例如,如果计算机还没有接受过网球的图像训练,它可能会错误地将网球识别为绿色或橙色。如果计算机错误地将站在人类雕像旁的马识别为真实的马,它也可能会产生AI幻觉。 将产生的输出与人类预期观察到的输出进行比较,将帮助您识别计算机视觉幻觉。 3. 自动驾驶汽车 由于人工智能的推动,自动驾驶汽车在汽车工业中越来越受欢迎。自动驾驶汽车的先驱们,如福特的BlueCruise和特斯拉的Autopilot,推动了这一计划。通过查看特斯拉Autopilot感知的方式和内容,您可以了解一些关于人工智能如何支持自动驾驶汽车的知识。 幻觉对人类和人工智能模型的影响是不同的。人工智能幻觉是错误的结果,与现实极不一致或在提供的提示的情况下毫无意义。例如,AI聊天机器人可能会因噪声或其他结构问题而以语法或逻辑上不正确的方式回答,或错误地识别一个对象。…
Leave a Comment人工智能和机器学习领域正在快速发展,这要归功于它们在几乎所有行业中的惊人能力和用例。随着人工智能逐渐被整合到不同领域中,并且愈发受到欢迎,也出现了与之相关的问题和限制。根本原因分析(RCA)是一种发现问题根本原因以找到最佳解决方案的方法。它有助于确定模型中事件或故障的深层原因。在IT运营、电信等领域,尤其是在人工智能领域,模型的复杂性经常导致事件降低了产品系统的可靠性和有效性。通过RCA的帮助,该方法寻找多个因素并建立它们之间的因果关系,以期为这些情况提供解释。 最近,Salesforce AI的一组研究人员推出了PyRCA,这是一个针对人工智能运维(AIOps)领域的根本原因分析(RCA)的开源Python机器学习库。PyRCA提供了一个全面的框架,使用户能够独立地找到指标和事件根本原因之间的复杂因果关系。该库提供了图形构建和评分操作,并具有支持多种广泛使用的RCA模型的统一接口,同时提供了快速模型创建、测试和部署的简化方法。 这个根本原因分析的全面Python库提供了一个端到端的框架,包括数据加载、因果图发现、根本原因定位和RCA结果可视化。它支持多个模型来创建图形和评分根本原因,并帮助用户快速加载相关数据并识别各种系统组件之间的因果联系。PyRCA带有一个GUI仪表板,使交互式RCA更加容易,从而提供了更流畅的用户体验,并更好地与实际情况相适应。该GUI的点和点击接口具有直观性,并赋予用户与库进行交互并将他们的专业知识注入RCA过程的能力。 有了PyRCA,工程师和研究人员现在可以轻松地分析结果、可视化因果联系,并通过GUI仪表板在RCA过程中前进。该团队分享的PyRCA的一些关键功能如下: PyRCA旨在提供一个标准化和高度适应性的框架,以流行的pandas.DataFrame格式加载度量数据并基准测试各种RCA模型。 通过一个单一的接口,PyRCA提供了访问各种模型的机会,用于发现因果网络和定位根本原因。用户也可以选择完全自定义每个模型以适应其独特的要求,包括GES、PC、随机漫步和假设测试模型。 通过结合用户提供的领域知识,库中提供的RCA模型可以被加强,使其在处理嘈杂的度量数据时更具韧性。 通过实现一个从RCA基类继承的单个类,开发人员可以快速将新的RCA模型添加到PyRCA中。 PyRCA包提供了一个可视化工具,使用户能够比较多个模型、审查RCA结果,并快速包含领域知识,而无需任何代码。 该团队详细解释了PyRCA的架构和主要功能。它提供了该库设计和核心能力的概述。
Leave a Comment计算机生成的动画每天都变得更加逼真。这种进步最能体现在视频游戏中。想想《古墓丽影》系列中的第一个Lara Croft和最近的Lara Croft。我们从一个只有230个多边形的木偶做出了怪异的动作,到了一个在屏幕上平滑移动的逼真角色。 在计算机动画中生成自然且多样化的动作长期以来一直是一个具有挑战性的问题。传统的方法,如动作捕捉系统和手动动画制作,已知是昂贵和耗时的,导致缺乏风格、骨骼结构和模型类型多样性的有限动作数据集。动画生成的手动和耗时特性需要在行业中寻找一种自动化解决方案。 现有的数据驱动运动合成方法在其效果方面受到限制。然而,近年来,深度学习已经成为计算机动画中一种强大的技术,能够在大型和全面的数据集上训练时合成多样化和逼真的动作。 深度学习方法在运动合成方面表现出色,但它们存在局限性,限制了它们的实际适用性。首先,它们需要长时间的训练时间,这可能是动画制作流程中的重要瓶颈。其次,它们容易出现视觉伪影,如抖动或过度平滑,影响合成动作的质量。最后,它们很难适应大型和复杂的骨架结构,限制了它们在需要复杂动作时的使用。 我们知道有一种可靠的运动合成方法在实际场景中有需求。然而,这些问题并不容易克服。那么,什么是解决方案?是时候见识一下GenMM了。 GenMM是一种基于运动最近邻和运动匹配的替代方法。它使用运动匹配,这是工业界广泛使用的角色动画技术,并产生高质量的动画,看起来自然并适应不同的局部环境。 GenMM可以使用单个输入生成动作。来源:http://weiyuli.xyz/GenMM/ GenMM是一种生成模型,可以从单个或少量示例序列中提取多样化的动作。它通过利用广泛的运动捕捉数据库来近似整个自然运动空间来实现这一点。 GenMM将双向相似性作为一种新的生成成本函数。这种相似性度量确保合成的运动序列只包含所提供的示例的运动补丁,反之亦然。这种方法保持了运动匹配的质量,同时实现了生成能力。为了进一步增强多样性,它使用了一个多阶段框架,逐步合成运动序列,这些运动序列与示例相比具有最小的分布差异。此外,还引入了一个无条件的噪声输入到管道中,受到基于GAN的图像合成方法成功的启发,以实现高度多样化的合成结果。 GenMM概述。来源:https://arxiv.org/pdf/2306.00378.pdf 除了其多样化运动生成能力外,GenMM还证明了它是一种可扩展的框架,可以扩展到超出仅使用运动匹配的能力的各种场景。这些场景包括运动完成、关键帧引导生成、无限循环和运动重组,展示了生成运动匹配方法所能实现的广泛应用范围。
Leave a Comment玫瑰的本质由其独特的几何形状、纹理和材料组成。这可以用来创建不同大小和形状的玫瑰,并在各种位置和具有广泛的照明效果。即使每朵玫瑰都有独特的像素值,我们仍然可以将它们识别为同一类的成员。 研究人员来自斯坦福大学、牛津大学和康奈尔技术学院,他们希望利用来自单张照片的数据,创建一个可以用于从不同角度和照明下生成新形状和图像的模型。 解决这个问题陈述有三个障碍: 由于训练数据集中只有一张图像,而且只有几百个实例,因此推断问题非常松散。 在这些情况下可能会有广泛的可能像素值,因为不知道姿态或照明条件。 没有两朵玫瑰是相同的,需要捕捉它们的形状、纹理和材料的分布,以利用底层的多视角信息。因此,旨在推断的对象固有属性是概率的,而不是确定的。与当前用于静态对象或场景的多视角重建或神经渲染方法相比,这是一个重要的变化。 所提出的方法以物体固有属性为起点,用于诱导模型创建中的偏差。这些规则有两个部分: 要呈现的实例应该都具有相同的物体固有属性或几何、纹理和材料的分布。 固有属性不是相互独立的,而是以一种特定的方式交织在一起,由渲染引擎定义,最终由物理世界定义。 更具体地说,他们的模型采用单个输入图像,并使用一组实例掩模和实例的特定姿态分布,学习物体三维形状、表面反射率和光泽度的分布的神经表示,从而消除了姿态和照明波动的影响。这种基于物理的、明确的解缠可以帮助他们简要解释实例。它使模型能够获取物体固有属性,而不会过度拟合由单个图像提供的稀疏观察数据。 正如研究人员所提到的,由此产生的模型可以实现多种用途。例如,可以通过从学习的物体固有属性中随机采样来生成具有不同身份的新实例。可以通过调整这些外部元素来重新渲染具有新的相机角度和照明设置的合成实例。 团队进行了彻底的测试,以展示模型的改进形状重建和生成性能、创新的视图合成和重照。
Leave a Comment微软研究人员推出了一个名为ZeRO++的新系统,该系统已经被开发用于优化大型AI模型的训练,解决了高数据传输开销和带宽有限的挑战。ZeRO++在现有的ZeRO优化基础上进行了扩展,提供了增强的通信策略,以提高训练效率,缩短训练时间和降低训练成本。 如Turing-NLG、ChatGPT和GPT-4等大型模型的训练需要跨多个GPU设备使用大量存储器和计算资源。DeepSpeed开发的ZeRO++引入了通信优化策略,以克服在每个GPU上使用小批量大小或在低带宽集群上训练时ZeRO的局限性。 ZeRO优化的家族,包括ZeRO-Inference,使模型状态在GPU之间进行分区,而不是复制,利用集体GPU内存和计算能力。然而,在训练过程中,ZeRO可能会产生高通信开销。ZeRO++通过融合三组通信优化解决了这个问题:量化权重通信(qwZ)、分层权重分区(hpZ)和量化梯度通信(qgZ)。 为了减少参数通信量,ZeRO++对权重进行了量化,利用基于块的量化来保留训练精度。这个优化的量化过程比基本的量化更快,更准确。为了在反向传播期间最小化通信开销,ZeRO++通过在每台机器内维护一个完整的模型副本来以GPU内存为代价进行通信。对于梯度通信,ZeRO++引入了一种新颖的量化梯度通信范式qgZ,以减少跨节点的流量和延迟。 这些通信优化导致通信量的大幅度减少。与ZeRO相比,ZeRO++实现了高达4倍的减少,提高了训练吞吐量和效率。当每个GPU使用小批量大小时,在高带宽集群中,ZeRO++比ZeRO-3提高了28%至36%的吞吐量。在低带宽集群中,ZeRO++与ZeRO-3相比实现了平均2倍的加速,使大型模型训练更加普及。 ZeRO++不仅限于训练场景,还扩展到使用人类反馈(RLHF)训练的对话模型中的强化学习。通过将ZeRO++与DeepSpeed-Chat集成,可以使RLHF训练受益于改进的生成和训练阶段,实现比ZeRO更高达2.25倍的更好的生成吞吐量和1.26倍的更好的训练吞吐量。 DeepSpeed发布了ZeRO++,以使大型模型训练更加高效和适用于AI社区。该系统旨在加速训练,减少通信开销并实现更大的批量大小,从而节省时间和资源。研究人员和实践者可以利用ZeRO++更有效地训练像ChatGPT这样的模型,并探索AI中的新可能性。
Leave a Comment随着人工智能的日益普及,几乎每天都会发布带有全新功能和解决能力的新模型。最近,研究人员一直在努力提出方法来加强人工智能模型对未知测试分布的抵抗力,并减少对虚假特征的依赖。考虑到自动驾驶汽车和自主厨房机器人的例子,它们尚未被广泛部署,因为它们在分布外(OOD)环境中的行为所带来的挑战,这些环境与模型接触到的训练数据有很大的差异。 许多研究已经探讨了虚假相关性(SCs)的问题,并提出了减少其对模型性能的负面影响的方法。已经证明,在像ImageNet这样的知名数据集上训练的分类器依赖于背景数据,这些数据与类标签存在虚假关联,但不一定具有预测性。尽管在开发解决SC问题的方法方面已经取得了进展,但仍需要解决现有基准的局限性。目前的基准测试,如Waterbirds和CelebA发色基准测试,存在局限性,其中之一是它们专注于简单的一对一(O2O)虚假相关性,而实际上,许多对多(M2M)虚假相关性更常见,涉及类和背景的群组。 最近,来自伦敦大学学院的研究人员介绍了一个名为Spawrious数据集的图像分类基准套件,其中包含类和背景之间的虚假相关性。它包括一对一(O2O)和一对多(M2M)虚假相关性,这些已经被分类为三个难度级别:简单,中等和困难。该数据集包含约152,000张高质量的照片逼真图像,使用文本到图像模型生成,采用图像字幕模型过滤不适合的图像,确保数据集的质量和相关性。 评估Spawrious数据集后,表现出了不可思议的性能,因为该数据集对当前的最先进(SOTA)组鲁棒性方法提出了挑战,例如Hard-splits,其中没有一种测试方法使用在ImageNet上预训练的ResNet50模型实现了70%以上的准确性。该团队提到,模型的性能问题是由于它们依赖虚假背景而导致的,通过查看其错误分类的分类,说明了Spawrious数据集如何成功地测试分类器并揭示它们在错误相关性方面的弱点。 为了说明O2O和M2M基准测试之间的差异,该团队使用了一个夏季收集训练数据的例子,其中包括来自两个不同位置的两组动物物种,每个动物组都与特定的背景组相关联。然而,随着季节的变化和动物的迁移,群组交换位置,导致动物组和背景之间的虚假相关性以无法一对一匹配的方式发生变化。这凸显了捕捉M2M虚假相关性中复杂关系和相互依赖性的必要性。 Spawrious似乎是一套有前途的基准套件,用于OOD,领域通用算法,以及评估和提高模型在存在虚假特征的情况下的鲁棒性。
Leave a Comment最近,文本到图像生成方面取得了一些进展,出现了可以合成高度逼真和多样化图像的扩散模型。然而,尽管这些模型具有令人印象深刻的能力,像Stable Diffusion这样的扩散模型在需要空间或常识推理的提示方面仍然需要帮助,导致生成的图片不准确。 为了解决这个挑战,加州大学伯克利分校和加州大学旧金山分校的研究团队提出了一种新的基于LLM的扩散(LMD)方法,可以增强文本到图像生成中的提示理解。他们已经确定了场景,包括否定、数字、属性分配和空间关系,在这些场景中,Stable Diffusion与LMD相比存在不足。 研究人员采用了一种成本效益的解决方案,避免了训练大型语言模型(LLMs)和扩散模型的昂贵和耗时过程。他们将现成的冻结LLMs集成到扩散模型中,形成了一个两阶段的生成过程,提供了增强的空间和常识推理能力。 在第一阶段,LLM被调整为文本引导的布局生成器,通过上下文学习。当给出一个图像提示时,LLM会产生一个由边界框和相应描述组成的场景布局。在第二阶段,扩散模型通过使用一个新颖的控制器来生成图像,由生成的布局进行引导。两个阶段都使用冻结的预训练模型,没有对LLM或扩散模型进行任何参数优化。 LMD除了改进提示理解外,还提供了几个优点。它可以实现基于对话的多轮场景规定,允许用户为每个提示提供额外的澄清和修改。此外,LMD可以处理不受基础扩散模型支持的语言提示。通过将支持多轮对话的LLM纳入其中,用户可以在初始布局生成后查询LLM,并为随后的图像生成接收更新的布局,便于请求添加对象或更改它们的位置或描述等。 此外,通过在上下文学习过程中提供非英语提示的示例和英语布局和背景描述,LMD接受非英语提示,即使基础扩散模型不支持给定的语言也能生成带有英语描述的布局。 研究人员通过与LMD利用的基础扩散模型Stable Diffusion 2.1进行比较,验证了LMD的优越性。他们邀请读者探索他们的工作,进行全面评估和进一步比较。 总之,LMD提出了一种新的方法,以解决扩散模型在准确遵循需要空间或常识推理的提示方面的局限性。通过集成冻结LLMs并采用两阶段生成过程,LMD显著增强了文本到图像生成任务中的提示理解能力。它提供了其他功能,如基于对话的场景规定和处理不支持的语言提示。研究团队的工作为通过集成现成的冻结模型来改善合成图像的准确性和多样性开辟了新的可能性。
Leave a Comment大型语言模型(LLMs)是人工智能(AI)领域的一项重大突破性进展。这些模型(例如 GPT-3)彻底改变了自然语言理解。由于这些模型具有解释大量现有数据和生成类似人类的文本的能力,因此这些模型具有巨大的潜力,可以塑造人机交互和通信的未来并开启新的可能性。然而,尽管 LLMs 取得了巨大的成功,但与此类模型通常相关的一个显著挑战是它们的计算效率低下,即使在最强大的硬件上也会导致性能缓慢。由于这些模型包含数百万乃至数十亿个参数,因此训练此类模型需要广泛的计算资源,内存和处理能力,并非总是可用。此外,这些具有缓慢响应时间的复杂体系结构可能使 LLMs 无法实用于实时或交互式应用程序。因此,解决这些挑战变得至关重要,以释放 LLMs 的全部潜力并使其好处更广泛地可用。 针对这个问题陈述,加州大学伯克利分校的研究人员开发了 vLLM,这是一个开源库,是 LLM 推理和服务的一个更简单,更快速,更便宜的替代方案。目前,大型模型系统组织(LMSYS)正在使用该库来驱动其Vicuna和 Chatbot Arena。通过切换到 vLLM 作为其后端,与最初基于 HuggingFace 转换器的后端相比,研究组织已成功高效地处理峰值流量(比以前多 5 倍),同时使用有限的计算资源并降低高运营成本。目前,vLLM 支持几个 HuggingFace 模型,如 GPT-2,GPT BigCode…
Leave a Comment随着人工智能(AI)生成的合成和文本到图像生成媒体的大量增加,虚假个人资料的复杂性也随之增加。领英与加州大学伯克利分校合作研究了尖端的检测方法。他们最近的检测方法能够准确地识别人工生成的个人资料图片,正确率达到99.6%,同时将真实图片误判为虚假图片的概率仅为1%。 有两种类型的取证方法可以用于调查这个问题。 基于假设的方法可以发现人工合成的面孔中的异常。这些方法通过学习显著的语义离群值来受益。然而,学习能力合成引擎似乎已经拥有了这些特征,这是一个问题。 基于数据驱动的方法,如机器学习,可以将自然面孔与 CGI 面孔区分开来。当出现在其专业领域之外的图像时,训练过的系统经常会在分类方面遇到困难。 所提出的方法采用混合方法,首先识别计算机生成的面孔中的独特几何属性,然后采用数据驱动的方法来测量和检测它。该方法使用轻量级、易于训练的分类器,并需要对一小组合成面孔进行培训。使用了五种不同的合成引擎来构建41,500个合成面孔,并使用了100,000个真实的领英个人资料图片作为额外的数据。 为了查看实际(公开可用的)LinkedIn个人资料图片与合成生成的(StyleGAN2)面孔的差异,他们将每个平均400张图片并排放置。由于人们的实际照片彼此非常不同,大多数个人资料图片只是普通的头像照片。相比之下,典型的 StyleGAN 面孔具有非常清晰的特征和锐利的眼睛。这是因为 StyleGAN 面孔的眼部位置和瞳距被标准化了。真实的个人资料图片通常关注上半身和肩膀,而 StyleGAN 面孔一般是从脖子以下合成的。他们希望利用社交群体内部和之间存在的相似性和差异。 为了识别 FaceForensics++ 数据集中的深度伪造面孔交换,研究人员将一个单类变分自动编码器(VAE)与一个基线单类自动编码器结合起来。与以前的面孔交换深伪造工作不同,这项工作强调了合成面孔(例如 StyleGAN)。研究人员还使用了一个相当简单且易于训练的分类器,并在相对较少的合成图像上实现了可比的总体分类性能。 他们使用 Generated.photos 和 Stable Diffusion 生成的图像评估了模型的泛化能力。使用生成对抗网络(GAN)生成的 Generated.photos…
Leave a Comment自史前时代以来,人们一直使用素描进行交流和记录。在过去的十年中,研究人员在理解如何使用分类和合成的素描方面取得了巨大的进展,以及更新颖的应用,如建模视觉抽象、样式转移和连续笔画拟合。然而,只有基于素描的图像检索(SBIR)及其细粒度对应物(FGSBIR)研究了素描的表现潜力。最近的系统已经成熟,可用于商业应用,这是素描表现力可能产生重大影响的极好证明。 素描非常引人入胜,因为它们自动捕捉微妙和个人的视觉线索。然而,对人类素描的这些内在特质的研究一直局限于图像检索领域。科学家们首次训练系统使用素描的表现力来完成视觉中最基本的任务:检测场景中的物体。最终产品是一个基于素描检测物体的框架,因此可以将注意力集中在一群斑马中的特定“斑马”(例如吃草的斑马)。此外,研究人员要求模型在以下情况下成功: 在没有预期结果的情况下进入测试(零射击)。 不需要额外的边界框或类标签(如完全监督)。 研究人员进一步规定,基于素描的检测器也以零射击的方式运作,增加了系统的新颖性。在接下来的部分中,他们详细介绍了如何将物体检测从封闭集转换为开放词汇配置。例如,物体检测器使用原型学习而不是分类头,编码查询素描特征作为支持集。然后,在弱监督物体检测(WSOD)环境中,通过所有可想象的类别或实例的原型之间的多类交叉熵损失进行模型训练。物体检测在图像级别上操作,而SBIR是通过对单个对象的素描和照片进行配对训练的。因此,SBIR对象检测器训练需要在对象级别和图像级别特征之间建立桥梁。 研究人员的贡献是: 培养人类素描表现力对物体检测的影响。 基于素描构建的物体检测器可以理解试图传达的信息。 用于传统类别级别和实例级别检测的物体检测器。 一种新的提示学习配置,将CLIP和SBIR结合起来生成一个素描感知的检测器,可以在没有边界框注释或类标签的情况下以零射击方式运行。 结果优于零射击设置中的SOD和WSOD。 研究人员没有从头开始,而是展示了基础模型(如CLIP)和为基于素描的图像检索(SBIR)构建的现有素描模型之间的直观协同作用,它们已经可以优雅地解决该任务。特别是,他们首先在SBIR模型的素描和照片分支上分别进行单独的提示,然后使用CLIP的泛化能力构建高度可泛化的素描和照片编码器。为了确保检测到的框的区域嵌入与SBIR素描和照片的嵌入匹配,他们设计了一种训练范式来调整学习的编码器以进行项目检测。在工业标准物体检测数据集(包括PASCAL-VOC和MS-COCO)上进行测试时,该框架在零射击设置中的表现优于监督(SOD)和弱监督(WSOD)物体检测器。 总之 为了改进物体检测,研究人员积极倡导人类素描表现力。建议的素描启用物体识别框架是一个实例感知和部件感知的物体检测器,可以理解素描中试图表达的信息。因此,他们设计了一种创新的提示学习设置,将CLIP和SBIR结合起来,教育一个不需要边界框注释或类标签的素描奖励检测器。该检测器还被指定为可以在各种用途中以零射击方式运行。另一方面,SBIR是通过对单个物品的素描和照片进行配对训练的。他们使用数据增强方法来增加对破坏的抵抗力和对词汇外的泛化能力,以帮助弥合物体和图像级别之间的差距。在零射击设置中,所得框架的表现优于监督和弱监督物体检测器。
Leave a Comment扩散模型。如果您一直关注人工智能领域的进展,您一定经常听到这个术语。它们是使生成式人工智能方法革命成为可能的关键。我们现在有了可以在几秒钟内使用文本提示生成逼真图像的模型。它们已经革新了内容生成、图像编辑、超分辨率、视频合成和3D资产生成。 尽管这种印象深刻的性能并不便宜。扩散模型在计算要求方面非常苛刻。这意味着您需要真正高端的GPU才能充分利用它们。是的,也有尝试让它们在本地计算机上运行,但即使如此,您也需要高端计算机。另一方面,使用云提供商可能是一种替代方案,但在这种情况下,您可能会冒着隐私风险。 然后,我们还需要考虑到的是即时性。对于大多数人来说,他们花在手机上的时间比花在计算机上的时间更长。如果您想在移动设备上使用扩散模型,那么祝您好运,因为它对设备本身的有限硬件功率要求过高。 扩散模型是下一个大事,但在将它们应用于实际应用程序之前,我们需要解决它们的复杂性。已经有多次尝试专注于加速移动设备上的推理,但它们没有实现无缝的用户体验或定量评估生成质量。好吧,这是一个故事,直到现在,因为我们有一个新的玩家进入领域,它的名字叫做SnapFusion。 SnapFusion是首个在移动设备上生成图像的文本到图像扩散模型,时间不到2秒。它优化了UNet架构并减少了去噪步骤的数量,以提高推理速度。此外,它使用了不断发展的训练框架,引入了数据蒸馏管道,并在步骤蒸馏过程中增强了学习目标。 SnapFusion概览。来源: https://arxiv.org/pdf/2306.00980.pdf 在对结构进行任何更改之前,SnapFusion的作者首先研究了SD-v1.5的架构冗余性,以获得高效的神经网络。然而,由于高昂的培训成本,将传统剪枝或架构搜索技术应用于SD是具有挑战性的。架构的任何更改都可能导致性能下降,需要进行大量的微调和大量的计算资源。因此,这条路被堵住了,他们不得不开发替代解决方案,可以在逐渐提高其效率的同时保持预训练UNet模型的性能。 为了增加推理速度,SnapFusion专注于优化UNet架构,这是有条件扩散模型中的瓶颈。现有的作品主要关注后训练优化,但是SnapFusion确定了架构冗余并提出了一个不断发展的训练框架,其表现优于原始的稳定扩散模型,同时显著提高了速度。它还引入了一个数据蒸馏管道,以压缩和加速图像解码器。 SnapFusion包括一个强大的训练阶段,在该阶段应用随机前向传播以执行每个交叉关注和ResNet块,并具有一定的概率。这种强大的训练增强确保网络对架构排列具有容忍性,从而允许准确评估每个块和稳定的架构演变。 通过使用通过通道缩减获得的解码器的合成数据来训练解码器,可以实现高效的图像解码器。该压缩解码器具有显著较少的参数,并且比SD-v1.5的解码器更快。蒸馏过程涉及使用文本提示生成两个图像,一个来自高效解码器,另一个来自SD-v1.5,以获得从SD-v1.5的UNet中获得的潜在表示。 提出的阶段蒸馏方法包括一个香草蒸馏损失目标,旨在最小化学生UNet的预测和教师UNet的嘈杂潜在表示之间的差异。此外,引入了CFG感知蒸馏损失目标,以提高CLIP分数。CFG引导预测在教师和学生模型中使用,其中CFG比例是随机抽样的,以在训练期间在FID和CLIP分数之间提供权衡。 SnapFusion生成的样本图像。来源:https://arxiv.org/pdf/2306.00980.pdf 由于改进的阶段蒸馏和网络架构开发,SnapFusion可以在移动设备上不到2秒的时间内从文本提示生成512×512像素的图像。生成的图像展示了与最先进的稳定扩散模型相似的质量。
Leave a Comment音乐是由和谐、旋律和节奏组成的艺术,渗透到人类生活的各个方面。随着深度生成模型的蓬勃发展,音乐生成近年来受到了广泛关注。作为一类重要的生成模型,语言模型(LMs)在建模复杂的长期上下文关系方面表现出了非凡的建模能力。基于此,AudioLM和许多后续工作成功地将LMs应用于音频合成。与基于LM的方法相似,扩散概率模型(DPMs)作为另一类竞争性的生成模型,也表现出了合成语音、声音和音乐的卓越能力。 然而,从自由形式文本生成音乐仍然具有挑战性,因为允许的音乐描述可以是多种多样的,与流派、乐器、节奏、情境,甚至一些主观感受有关。 传统的文本到音乐生成模型通常关注于特定的属性,如音频延续或快速采样,而有些模型则优先考虑稳健的测试,这有时是由领域内的专家(例如音乐制作人)进行的。此外,大多数模型都是在大规模的音乐数据集上训练的,并且展示了最新的生成性能,具有高保真度和对文本提示各种方面的忠实度。 然而,这些方法的成功,如MusicLM或Noise2Music,带来了高计算成本,这将严重妨碍它们的实用性。相比之下,基于DPMs构建的其他方法使高质量音乐的有效采样成为可能。然而,他们所展示的案例相对较小,并且显示了有限的内部动态。为了实现可行的音乐创作工具,生成模型的高效性至关重要,因为它有助于与人类反馈进行交互式创作,正如先前的研究所述。 尽管LMs和DPMs都显示出了很好的结果,但相关问题并不是是否应该优先选择其中一种,而是是否可能同时利用两种方法的优势。 根据上述动机,提出了一种称为MeLoDy的方法。该策略的概述如下图所示。 在分析MusicLM的成功后,作者利用MusicLM中最高级别的LM,称为语义LM,来模拟音乐的语义结构,确定旋律、节奏、动态、音色和节奏的整体安排。在这种语义LM的条件下,他们利用DPMs的非自回归性质,借助成功的采样加速技术,高效有效地模拟声学。 此外,作者提出了所谓的双通道扩散(DPD)模型,而不是采用经典的扩散过程。事实上,对原始数据进行处理会指数增加计算费用。提出的解决方案是将原始数据降低到低维潜在表示。减少数据的维数会减少对操作的影响,从而减少模型运行时间。随后,原始数据可以通过预先训练的自编码器从潜在表示中重构出来。 模型产生的一些输出样本可在以下链接中获得:https://efficient-melody.github.io/。目前该代码尚未发布,这意味着目前无法在线或本地尝试它。 这就是MeLoDy的概述,这是一种生成最先进音质的高效LM引导扩散模型。如果您有兴趣,可以在下面的链接中了解更多关于这种技术的信息。
Leave a Comment大型语言模型(LLMs)近几个月来备受瞩目。作为人工智能领域最好的进展之一,这些模型正在改变人类与机器交互的方式。由于每个行业都在采用这些模型,它们是人工智能接管世界的最佳例证。 LLM在生成文本方面表现出色,尤其是在涉及复杂交互和知识检索的任务中,最著名的例子是OpenAI开发的基于GPT 3.5和GPT 4转换器架构的ChatGPT聊天机器人。除了文本生成外,像CLIP(对比性语言-图像预训练)这样的模型也已经被开发出来,用于图像生成,可以根据图像内容创建文本。 为了在音频生成和理解方面取得进展,谷歌的研究人员介绍了AudioPaLM,这是一个大型语言模型,可以处理语音理解和生成任务。 AudioPaLM结合了两个现有模型的优点,即PaLM-2模型和AudioLM模型,以产生一个统一的多模态架构,可以处理和生成文本和语音。这使得AudioPaLM可以处理各种应用,从语音识别到语音转文本。 虽然AudioLM擅长维护诸如讲话者身份和语气之类的语言信息,但是PaLM-2,即基于文本的语言模型,专门处理文本特定的语言知识。通过结合这两个模型,AudioPaLM利用了PaLM-2的语言专业知识和AudioLM的语言信息保留,从而更全面地理解和创建文本和语音。 AudioPaLM利用联合词汇表,可以使用有限的离散标记表示语音和文本。将这个联合词汇表与标记任务描述相结合,可以在各种基于语音和文本的任务上训练单个仅解码器模型。传统上,语音识别,文本到语音合成和语音到语音翻译等任务是由分开的模型处理的,现在可以统一到单个架构和训练过程中。 在评估中,AudioPaLM在语音翻译方面的表现超过了现有系统。它展示了零-shot语音到文本翻译的能力,可以准确地将语音翻译为以前未遇到过的语言,从而为更广泛的语言支持开辟了可能性。AudioPaLM还可以基于简短的语音提示跨语言传递声音,并可以捕捉和复制不同语言中的不同声音,从而实现语音转换和适应。 该团队提到的关键贡献是: AudioPaLM利用了文本预训练中PaLM和PaLM-2s的能力。 它在自动语音翻译和语音到语音翻译基准方面取得了SOTA结果,并在自动语音识别基准方面表现出色。 该模型通过声音传递实现了声音到声音的翻译,超越了现有方法在语音质量和声音保留方面。 AudioPaLM通过执行未见过的语言组合的自动语音翻译来展示了零-shot能力。 总之,AudioPaLM是一个统一的LLM,通过利用基于文本的LLM的能力和结合音频提示技术来处理语音和文本,是LLM列表中值得期待的新成员。
Leave a Comment在机器智能研究的最新发表论文中,一组研究人员深入探讨了视觉语言预训练(VLP)及其在多模态任务中的应用。该论文探讨了单模态训练的思想以及它与多模态适应性的不同之处。然后,该报告展示了VLP的五个重要领域:特征提取、模型架构、预训练目标、预训练数据集和下游任务。然后,研究人员回顾了现有的VLP模型以及它们如何在不同领域上进行适应和发展。 人工智能领域一直试图以与人类相同的方式对模型进行训练,让它们像人类一样感知、思考和理解模式和细微差别。各种尝试已经被做出来,以尽可能多地纳入数据输入领域,如视觉、音频或文本数据。但大多数这些方法都试图以单模态的方式解决“理解”的问题。 单模态方法是一种方法,在这种方法中,您只考虑一个方面来评估一种情况,例如在视频中,您只关注其音频或转录,而在多模态方法中,您尝试针对尽可能多的可用特征,并将它们纳入模型中。例如,在分析视频时,您会考虑音频、转录和说话者的面部表情,以真正“理解”上下文。 多模态方法本身具有挑战性,因为它需要大量的资源,并且需要大量的标记数据来训练能力强的模型。基于变压器结构的预训练模型通过利用自监督学习和附加任务从大规模无标记数据中学习通用表示来解决了这个问题。 以单模态方式预先训练模型,例如在NLP中的BERT,已经通过有限标记数据的微调表现出了显着的有效性。研究人员通过将相同的设计理念扩展到多模态领域来探索视觉语言预训练(VLP)的可行性。VLP使用预训练模型在大规模数据集上学习模态之间的语义对应关系。 研究人员回顾了VLP方法在五个主要领域中取得的进展。首先,他们讨论了VLP模型如何预处理和表示图像、视频和文本以获得相应的特征,并突出了使用的各种模型。其次,他们还探讨了单流和双流融合以及仅编码器与编码器-解码器设计的可用性和使用情况。 本文还更多地探讨了VLP模型的预训练,将其归类为完成、匹配和特定类型。这些目标很重要,因为它们有助于定义通用的视觉语言表示。研究人员还概述了预训练数据集的两个主要类别:图像语言模型和视频语言模型。该论文强调多模态方法如何帮助在理解上下文和生成更好映射内容方面实现更好的理解和准确性。最后,本文介绍了VLP中下游任务的目标和细节,强调它们在评估预先训练模型的有效性方面的重要性。 https://link.springer.com/content/pdf/10.1007/s11633-022-1369-5.pdf https://link.springer.com/content/pdf/10.1007/s11633-022-1369-5.pdf 本文提供了SOTA VLP模型的详细概述。它列出了这些模型并强调了它们的主要特点和性能。提及和覆盖的模型是前沿技术发展的坚实基础,也可作为未来发展的基准。 根据研究论文,VLP架构的未来看起来很有前途和可靠性。他们提出了各种改进领域,例如整合声学信息、知识和认知学习、快速调整、模型压缩和加速以及域外预训练。这些改进领域旨在激发新时代的研究人员在VLP领域取得突破性进展。
Leave a Comment许多领域,包括生物学和保护,以及娱乐和虚拟内容的开发,都可以从捕捉和建模三维动物形态和态度中受益。因为它们不需要动物保持静止,保持特定的姿势,与观察者进行身体接触或执行任何其他协作任务,相机是观察动物的自然传感器。利用照片研究动物已经有很长的历史,例如著名的“马在奔跑”动态摄影。然而,与早期的人体三维形状和姿态研究不同,最近开发了能够根据动物的独特形状和姿势进行改变的表现性三维模型。在这里,他们专注于从单张照片中重建三维狗的挑战。 他们将狗作为模型物种的原因是因为它们具有强烈的四足样的关节变形和品种之间广泛的形状变化。狗经常被相机捕捉到。因此,各种姿势,形状和设置都很容易获取。建模人和狗可能在外观上具有相似的困难,但它们呈现出非常不同的技术难题。人们已经可以获得大量的三维扫描和动作捕捉数据。由于数据涵盖了正确的姿势和形态变量,因此学习像SMPL或GHUM这样的鲁棒,关节模型已经成为可能。 相反,收集动物的三维观察数据是具有挑战性的,目前需要更多此类数据来训练同样具有表现力的三维统计模型,以考虑所有可能的形态和位置。现在,由于SMAL(从玩具模型中学习的参数化四足动物模型),已经可以从照片中重建动物的三维模型,包括狗。然而,SMAL是许多物种的通用模型,从猫到河马。虽然它可以描绘不同动物的许多体型,但它却不能描绘狗品种的独特和微小细节,例如巨大的耳朵范围。为了解决这个问题,ETH苏黎世联邦理工学院,德国智能系统Max Planck研究所和IMATI-CNR研究所的研究人员提供了第一个D-SMAL参数化模型,可以正确地表示狗。 另一个问题是,与人类相比,狗的动作捕捉数据相对较少,并且存在的数据中,坐姿和躺姿很少被捕捉到。因此,当前的算法很难推断狗的某些姿势。例如,从历史数据中学习三维姿势的先验知识将会偏向于站立和行走姿势。通过利用通用约束,可以减弱这个先验知识,但是姿势估计会变得严重不确定。为了解决这个问题,他们使用了物理接触的信息,这是建模动物(土地)时被忽视的信息,例如它们受重力影响,因此会站立,坐下或躺在地上。 在存在广泛自遮挡的情况下,他们展示了如何使用地面接触信息来估计复杂的狗的姿势。虽然地面平面限制已经用于人体姿势估计,但对于四足动物来说,潜在的优势更大。四条腿意味着更多的接触点,坐或躺下时更多的身体部位被遮挡,以及更大的非刚性变形。早期研究的另一个缺点是重建管道通常是在2D图片上进行训练的,因为收集配对的3D数据(带有匹配的2D图像)具有挑战性。因此,他们经常预测位置和形状,当重新投影时,与视觉证据非常相似,但沿着观察方向被扭曲。 由于缺乏配对数据,所以在从不同角度观察时,三维重建可能是错误的,因为没有足够的信息来确定在深度方向上放置更远或甚至被遮挡的身体部位的位置。再次,他们发现模拟地面接触是有益的。他们不再手动重建(或合成)配对的2D和3D数据,而是转向更宽松的三维监督方法,并获取地面接触标签。他们要求注释者指示狗下面的地表是否平坦,并在三维动物上注释地面接触点。他们通过向注释者呈现真实的照片来实现这一点。 图1 显示了BITE如何能够从单个输入图像中估计狗的三维形态和态度。该模型能够处理各种品种和类型,以及超出训练姿势范围的困难姿势,包括坐在地上或躺在地上。 他们发现,网络可以从单个图像中准确地学习分类表面和检测接触点,以便它们也可以在测试时使用。这些标签不仅用于训练。基于最新的前沿模型BARC,他们的重建系统称为BITE。他们使用新颖的D-SMAL狗模型作为初始粗配步骤重新训练BARC。随后,他们将结果预测发送到他们最近创建的精细化网络,使用接地损失进行训练,以改善相机的设置和狗的姿态。他们还可以在测试时使用接地损失,以完全自主地优化对测试图片的适配。 这大大提高了重建的质量。即使BARC姿势先验的训练集不包含这样的姿势,他们也可以使用BITE得到正确站在(局部平面)地面上或以坐姿和躺姿逼真重建的狗(见图1)。以往的3D狗重建工作要么是通过主观视觉评估,要么是通过反投影到图片并评估2D残差来评估,因此投影掉了与深度相关的不准确性。他们通过从不同的视角生成实际犬只的3D扫描,制作了一个独特的半合成数据集,以弥补客观3D评估的缺失。他们使用这个新数据集评估BITE及其主要竞争对手,证明BITE为该领域建立了新的标准。 他们的贡献总结如下: 1.他们提供了D-SMAL,这是一个从SMAL发展出来的全新的、针对犬只的3D姿势和形状模型。 2.他们创建了BITE,这是一个神经模型,旨在提高3D狗姿势的同时评估局部地面平面。BITE鼓励具有说服力的接地。 3.他们证明了在使用该模型之前,可以恢复与之编码非常不同的狗的位置(必须很小的先验)。 4.使用复杂的StanfordExtra数据集,他们改进了单目3D姿势估计的最新技术水平。 5.为了促进向真正的3D评估的过渡,他们提供了一个基于实际犬只扫描的新的半合成3D测试集合。
Leave a Comment过去2-3年,使用人工智能(AI)从文本生成图像的研究质量和数量出现了惊人的增长。在这个领域里最具突破性和革命性的工作之一是指最先进的生成模型——扩散模型。这些模型通过利用深度学习算法的能力,完全改变了如何使用文本描述生成高质量图像的方法。此外,除了扩散模型,还存在一系列功能强大的其他技术,提供了一条生成接近照片般逼真的视觉内容的令人兴奋的路径。然而,这些最先进技术取得的杰出成果也有一定的局限性。许多新兴的生成AI技术依赖于扩散模型,这需要复杂的架构和大量的计算资源进行训练和图像生成。这些先进的方法还降低了推理速度,使它们在实时实现方面不切实际。此外,这些技术的复杂性直接与它们所实现的进步相关,这对公众掌握这些模型的内部工作方式构成了挑战,从而导致它们被视为黑匣子模型。 为了解决前面提到的问题,德国Technische Hochschule Ingolstadt和Wand Technologies的研究人员提出了一种新颖的文本条件图像生成技术。这种创新技术与扩散类似,但生成高质量图像的速度更快。这个基于卷积的模型的图像采样阶段可以仅使用12个步骤完成,同时仍能产生出色的图像质量。这种方法因其显著的简单性和降低的图像生成速度而脱颖而出,从而允许用户对模型进行条件设置,并享受现有最先进技术中缺乏的优势。所提出的技术的固有简单性已经显著提高了其可访问性,使来自不同背景的个人能够轻松掌握和实施这种文本到图像技术。为了通过实验评估验证他们的方法,研究人员还训练了一个名为“Paella”的文本条件模型,该模型具有惊人的10亿个参数。该团队还在MIT许可证下开源了其代码和模型权重,以鼓励围绕他们的工作进行研究。 扩散模型经历了一个学习过程,逐步从每个训练实例中消除不同程度的噪声。在推理过程中,当呈现出纯噪声时,模型通过逐步减少几百个步骤的噪声来生成图像。德国研究人员设计的技术在很大程度上借鉴了这些扩散模型的原理。像扩散模型一样,Paella从代表图像的标记中去除不同程度的噪声,并利用它们生成新图像。该模型在LAION-5B美学数据集的900 million个图像-文本对上进行了训练。Paella使用基于卷积神经网络的预训练编码器-解码器体系结构,能够使用来自预训练期间学习的8192个标记集的256个标记来表示256 x 256的图像。为了在训练阶段为其示例添加噪声,研究人员还在此列表中包括了一些随机选择的标记。 为了基于图像的文本描述生成文本嵌入,研究人员利用了CLIP(对比语言-图像预训练)模型,该模型建立了图像和文本描述之间的联系。然后,采用U-Net CNN体系结构来训练模型生成完整的原始标记,利用先前迭代中生成的文本嵌入和标记。这个迭代过程重复了12次,每次逐渐替换以前生成的标记的一小部分。在剩余生成的标记的指导下,U-Net逐步减少每个步骤的噪声。在推理过程中,CLIP基于给定的文本提示产生一个嵌入,U-Net为随机选择的256个标记的完整集合重构了所有标记12次。最后,解码器利用生成的标记生成图像。 为了评估他们的方法的有效性,研究人员采用了Fréchet inception距离(FID)指标来比较Paella模型和稳定扩散模型得到的结果。虽然结果略微偏向稳定扩散,但Paella在速度方面具有显著优势。这项研究突出了先前的努力,因为它专注于完全重新配置架构,这在以前并未考虑过。总之,与现有的模型相比,Paella可以使用更小的模型大小和更少的采样步骤生成高质量的图像,仍然可以实现可观的结果。研究团队强调了他们方法的易用性,该方法提供了一个简单的设置,可以被从不同背景中的个人轻松采用,包括非技术领域,因为随着时间的推移,生成AI领域越来越受到关注。
Leave a Comment2023年是LLMs的年份。ChatGPT,GPT-4,LLaMA等新的LLM模型正在接连抢占聚光灯。这些模型已经彻底改变了自然语言处理领域,并越来越广泛地应用于各个领域。 LLMs具有展现广泛行为的显著能力,包括进行对话,这可以导致与类似人类的谈话者进行交谈的引人注目的幻觉。然而,重要的是要认识到,基于LLM的对话代理在几个方面与人类存在显着差异。 我们的语言技能是通过与世界的具体互动发展起来的。我们作为个体,通过社交化和沉浸在语言用户社区中获得认知能力和语言能力。这一过程在婴儿身上发生得更快,随着我们长大,我们的学习过程变慢,但基础仍然相同。 相比之下,LLMs是在大量人类生成的文本上进行训练的无体神经网络,其主要目标是基于给定的上下文预测下一个单词或标记。它们的训练围绕着从语言数据中学习统计模式,而不是通过直接体验物理世界。 尽管存在这些差异,但我们倾向于用LLMs来模仿人类。我们在聊天机器人、助手等方面使用这种方法。然而,这种方法带来了一个具有挑战性的困境。我们如何描述和理解LLMs的行为? 使用熟悉的民间心理学语言是很自然的,像使用“知道”、“理解”和“思考”这样的术语来描述对话代理,就像我们对待人类一样。然而,当这些语言被过分字面地理解时,这种语言会促进拟人化,夸大了AI系统和人类之间的相似之处,同时掩盖了它们的深刻差异。 那么我们如何应对这个困境?我们如何为AI模型描述“理解”和“知道”这些术语?让我们来看看“角色扮演”论文。 在这篇论文中,作者提出采用替代概念框架和隐喻来有效地思考和谈论基于LLM的对话代理。他们主张使用两个主要隐喻:将对话代理视为扮演单一角色或作为可能角色的多元超定位的模拟集合。这些隐喻提供了不同的角度来理解对话代理的行为,并具有其独特的优势。 自回归采样的示例。来源:https://arxiv.org/pdf/2305.16367.pdf 第一个隐喻将对话代理描述为扮演具体角色。当给定提示时,代理尝试以与分配的角色或人物相匹配的方式继续对话。它旨在根据与该角色相关联的期望进行回应。 第二个隐喻将对话代理视为来自各种来源的不同角色的集合。这些代理已经接受了广泛的材料培训,如书籍、脚本、采访和文章,这使它们对不同类型的角色和情节有很多了解。随着对话的进行,代理根据其训练数据调整其角色和人物,使其能够适应并以角色回应。 对话代理中的轮流发言的示例。来源:https://arxiv.org/pdf/2305.16367.pdf 通过采用这个框架,研究人员和用户可以探索对话代理人的重要方面,如欺骗和自我意识,而不会错误地将这些概念归因于人类。相反,重点转向理解对话代理人在角色扮演场景中的行为以及它们可以模仿的各种角色。 总之,基于LLM的对话代理人具有模拟人类对话的能力,但它们与实际人类语言用户有很大的不同。通过使用替代隐喻,比如将对话代理人视为角色扮演者或模拟的组合,我们可以更好地理解和讨论它们的行为。这些隐喻为基于LLM的对话系统的复杂动态提供了洞见,使我们能够欣赏它们的创造潜力,同时认识到它们与人类的根本区别。
Leave a Comment计算机视觉是人工智能领域中最受欢迎的领域之一。使用计算机视觉开发的模型能够从不同类型的媒体中提取有意义的信息,无论是数字图像、视频还是其他视觉输入。它教会了机器如何感知和理解视觉信息,然后根据细节采取行动。随着一种名为追踪任何点(TAPIR)的新模型的推出,计算机视觉取得了重大进步。TAPIR的目标是有效地跟踪视频序列中的特定兴趣点。 TAPIR模型由Google DeepMind、VGG、工程科学系和牛津大学的研究人员团队开发,其算法包括两个阶段——匹配阶段和精炼阶段。在匹配阶段,TAPIR模型单独分析每个视频序列帧,以寻找适合查询点的候选点匹配。这一步旨在确定查询点在每个帧中的最可能相关点,为了确保TAPIR模型能够跟踪查询点在视频中的运动,这个过程是逐帧进行的。 在确定候选点匹配的匹配阶段之后,TAPIR模型使用精炼阶段。在这个阶段中,TAPIR模型基于局部相关性更新轨迹(查询点所在路径)和查询特征,因此考虑到每个帧中的周围信息,以提高跟踪查询点的准确性和精度。通过集成局部相关性,精炼阶段提高了模型精确跟踪查询点的能力,并调整视频序列中的变化。 为了评估TAPIR模型,该团队使用了TAP-Vid基准测试数据集,它是用于视频跟踪任务的标准化评估数据集。结果显示,TAPIR模型的表现明显优于基线技术。使用称为平均Jaccard(AJ)的度量衡量的性能改进显示,TAPIR模型在DAVIS(密集注释视频分割)基准测试中的AJ相对于其他方法实现了约20%的绝对改进。 该模型旨在便于快速并行推理长视频序列,即它可以同时处理多个帧,提高跟踪任务的效率。该团队提到,该模型可以实时应用,使其能够处理和跟踪添加新视频帧的点。它可以在256×256视频上跟踪256个点,速度约为每秒40帧(fps),还可以扩展以处理更高分辨率的电影,使其具有处理各种大小和质量的视频的灵活性。 该团队为用户提供了两个在线Google Colab演示,以尝试TAPIR而无需安装。第一个Colab演示允许用户在自己的视频上运行模型,提供交互式体验以测试和观察模型的性能。第二个演示重点介绍如何在线运行TAPIR。此外,用户可以通过克隆提供的代码库,在现代GPU上跟踪自己的网络摄像头上的点并实时运行TAPIR。
Leave a CommentAI工具正在快速发展,新的工具不断推出。查看下面一些可以增强您日常工作的AI工具。 tl;dv 这个工具由GPT模型提供动力,是Zoom和Google Meet的会议记录器。 tl;dv 为用户转录和总结通话。 Otter AI Otter.AI使用人工智能,为用户提供实时会议笔记转录,这些笔记可共享、可搜索、易于访问和安全。 Taskade Taskade是一款AI生产力工具,可帮助用户高效地管理任务和项目。 Notion AI Notion AI是一款写作助手,可以帮助用户在Notion工作区内写作、头脑风暴、编辑和总结。 Bing 微软推出了AI驱动的Bing搜索引擎,就像在搜索网络时拥有研究助手、个人计划师和创意伙伴。 Bard Bard是由Google开发的聊天机器人,可帮助提高生产力并将想法变为现实。 Forefront Forefront AI是一个平台,提供GPT-4、图像生成、自定义角色和可共享聊天等免费访问,从而为企业提供了改进的效率和用户体验。 Merlin Merlin是一个ChatGPT扩展程序,可帮助用户在任何网站上完成任何任务,提供博客摘要和Gmail AI写手等功能。…
Leave a Comment大型语言模型(LLMs)已经成为了人工智能领域的热门话题。它们近期的影响和惊人的表现已经帮助医疗保健、金融、娱乐等各个行业做出了很大的贡献。像 GPT-3.5、GPT 4、DALLE 2 和 BERT 这样的知名 LLMs,也被称为基础模型,可以执行非凡的任务,通过提供一个简短的自然语言提示,为我们生活带来了独一无二的内容。 最近的视觉基础模型(VFMs)如 SAM、X-Decoder 和 SEEM 在计算机视觉方面取得了许多进展。虽然 VFMs 在 2D 感知任务方面取得了巨大的进步,但 3D VFM 研究仍需要改进。研究人员建议扩展当前的 2D VFMs 用于 3D 感知任务。一个关键的…
Leave a Comment人类总是与周围环境互动。他们在空间中移动,触摸物品,坐在椅子上或睡在床上。这些互动详细说明了场景设置和物体位置。默剧演员利用他们对这种关系的理解,仅凭身体动作创造富有想象力的3D环境。他们能教计算机模仿人类动作并制作合适的3D场景吗?包括建筑、游戏、虚拟现实和合成合成数据的多个领域可能会从这种技术中受益。例如,有大量的3D人体运动数据集,例如AMASS,但这些数据集很少包含有关它们采集的3D设置的详细信息。 他们能够使用AMASS为所有动作创建可信的3D场景吗?如果可以,他们可以使用AMASS创建具有现实人类-场景互动的训练数据。他们开发了一种新颖的技术,称为MIME(挖掘互动和运动以推断3D环境),它基于3D人体运动创建可信的内部3D场景,以响应此类查询。它是如何实现的?以下是基本假设:(1)空间内的人体运动表示物品的缺失,从本质上定义了图片中没有家具的区域。此外,它在接触场景时限制了3D物体的种类和位置;例如,坐着的人必须坐在椅子、沙发、床等上。 图1:从人类运动中估计3D场景。他们使用3D人体运动(左侧)重新创建出现过的现实3D设置,例如从运动捕捉或身体穿戴传感器中获得的运动。他们的生成模型能够生成多种逼真的场景(右侧),其中考虑了人与场景的适当互动,包括人的位置和姿势。 德国智能系统Max Planck研究所和Adobe的研究人员创建了MIME,这是一种基于变压器的自回归3D场景生成技术,以将这些直觉转化为具体形式。给定一个空的平面图和一个人体运动序列,MIME预测人体将接触到的家具。此外,它预测不会与人接触但与其他物品相匹配并符合人体运动带来的自由空间限制的可信物品。他们将运动分为接触和非接触片段,以为人体运动条件3D场景创建。他们使用POSA估计可能的接触姿势。非接触姿势将脚的顶点投射到地面平面上,以建立房间的自由空间,并将其记录为2D地图。 POSA预测的接触顶点创建反映接触姿势和相关的3D人体模型的3D边界框。满足接触和自由空间标准的对象被期望自回归使用此数据作为变压器的输入;参见图1。他们扩展了大规模合成场景数据集3D-FRONT,创建了一个名为3D-FRONT HUMAN的新数据集,以训练MIME。他们自动向3D场景中添加人物,包括非接触人物(一系列步行动作和站立的人)和接触人物(坐、接触和躺着的人)。为此,他们使用RenderPeople扫描的静态接触姿势和AMASS的运动序列。 MIME在推理时间为输入运动创建逼真的3D场景布局,表示为3D边界框。他们从3D-FUTURE集合中选择3D模型,然后根据人的位置和场景之间的几何限制微调它们的3D位置。他们的方法在不进行任何调整的情况下适用于已记录的真实运动序列,例如PROX-D。 总之,它们提供以下内容: • 一款全新的运动条件生成模型,用于自动回归地创建与人接触但避免占据运动定义空位的物品的3D房间场景。 • 通过使用来自AMASS的运动数据和RenderPeople的静态接触/立姿姿势,创建了一个由互动人物和自由空间中的人物组成的全新3D场景数据集。 他们的代码和视频演示均可在GitHub上获得。他们还有一个视频解释他们的方法。
Leave a Comment