IGEL是针对文本的指令定制的德语大型语言模型。IGEL 001版本(Instruct-igel-001)是一个原始的概念验证,旨在确定是否可以通过将现有的开源模型与德语翻译指令数据集相结合来构建德语指令定制模型。 IGEL的第一个版本基于BigScience BLOOM,由Malte Ostendorff本地化为德语。IGEL旨在执行与自然语言理解相关的各种任务,包括情感分析、语言翻译和问题回答,在每个领域都具有高准确性和可靠性。 团队想要尝试LLM在德语指令建模任务中的表现如何。他们使用预训练的自定义BLOOM模型(6B)并使用基于翻译指令的数据集进行微调来实现这一目标。为了构建数据集,他们使用了一种称为自动翻译的方法将英语指令转化为德语。尽管由于这种策略存在较大的翻译错误的可能性,但他们的目标是确定模型是否仍然能够学习生成指令回复。 Instruct-igel-001中的LoRA定制BLOOM-CLP Deutsch(6.4B参数)具有用于Hugging Face Transformers的合并权重。在对naive翻译的指令数据集进行训练之前,并没有太多关注数据的清理、筛选或后处理。 团队提到,幻觉、有毒性和刻板印象只是instruct-igel-001存在的一些问题,这些问题在语言模型中很常见。他们计划完成聊天模型的开发,以创建一个对话界面。这将以超越传统的请求-响应方法的方式改善数据质量。
Leave a CommentTag: Tech News
AI图像生成器是人工智能的前沿应用,能够根据用户给定的某些参数或提示,创建独特、高质量的图像。通过机器学习算法和神经网络,这些生成器分析无数现有图像,以理解它们的结构、颜色、上下文等。然后利用这个庞大的知识库生成符合用户规格的新图像,这些图像具有细节丰富、逼真、与用户规格一致的特点。 AI图像生成器在各行各业中的角色 由于其便利性、高效性和创造力,AI图像生成器在许多行业中都得到了广泛应用。 数字营销 在数字营销领域,AI图像生成器是一种福音。市场营销人员现在可以在不需要专业设计师或摄影师的情况下创建定制视觉效果,从而节省时间和资源。它们为社交媒体、博客文章、广告等提供了快速创建引人注目视觉效果的方法,极大增强了在线参与度。 游戏和娱乐 游戏行业正在利用AI图像生成器的力量设计复杂的游戏环境、角色和道具。这些工具可以快速生成高质量的图形,从而减少开发时间和成本。 电子商务 AI图像生成器也正在彻底改变电子商务行业。它们可以在各种环境中创建产品图像,为客户提供更互动的购物体验。 AI图像生成器如何重新定义创造力 AI图像生成器正在重新定义创造力,并扩大创作者的可能性领域。它们为视觉组合提供了无限选择,鼓励人们进行实验和创新。用户可以提供描述或提示,AI将生成相应的图像,为将抽象概念具体化提供机会。 AI图像生成器的未来前景 AI图像生成器具有巨大的未来增长潜力。这项技术不断优化,以产生越来越逼真的图像。随着AI算法的改进,生成图像的精确度和复杂度也将提高。这些生成器可能很快用于创建高度逼真的不存在的人物、地点或物品的描绘,为虚拟现实、电影制作和室内设计等领域带来令人兴奋的可能性。 2023年最佳AI图像生成器 Shutterstock AI图像生成器 FotorAI图像生成器 Nightcafe Dream By Wombo DALL-E 2 Midjourney Dream…
Leave a Comment近年来,深度学习(DL)特别是生成对抗网络(GAN)在生成高度逼真和多样化的人脸方面取得了重大突破。这些人脸在现实中并不存在,但在视频游戏、化妆品行业和计算机辅助设计等领域有着广泛的应用。然而,当这些人工生成的人脸被滥用时,会带来重大的安全和伦理问题。 合成或虚假人脸的滥用可能导致严重的后果。例如,在美国选举中,曾经有人使用GAN生成的人脸图像创建虚假的社交媒体账号,快速传播针对特定群体的虚假信息。类似地,一名17岁的高中生通过一种名为StyleGAN2的强大生成模型成功欺骗Twitter,使其验证了一张美国国会候选人的虚假头像。这些事件凸显了滥用GAN生成的人脸图像可能带来的潜在风险,并突出了解决其安全和伦理问题的重要性。 为了解决GAN生成的虚假人脸问题,已经提出了几种方法来区分虚假的GAN生成人脸和真实的人脸。这些研究的结果表明,简单的有监督深度学习分类器通常在检测GAN生成图像方面非常有效。这些分类器通常被称为法证分类器或模型。 然而,一个聪明的攻击者可以使用对抗机器学习技术来操纵这些虚假图像,以逃避法证分类器的检测,同时保持高的视觉质量。最近的研究通过展示对生成模型的流形进行潜空间优化的对抗性探索,可以生成被针对性法证检测器错误分类的逼真人脸。此外,他们还表明,与在图像空间上施加约束的传统对抗攻击相比,由此产生的对抗性虚假人脸显示出更少的伪影。 然而,这项工作存在一个重大局限性。即它无法控制生成的对抗性人脸的属性,如肤色、表情或年龄。对于那些希望通过社交媒体平台迅速传播虚假宣传,特定针对某些族群或年龄群体的攻击者来说,控制这些人脸属性至关重要。 鉴于潜在的影响,图像取证研究人员必须深入研究和开发属性条件攻击。通过这样做,他们可以揭示现有法证人脸分类器的漏洞,并最终努力设计未来的有效防御机制。本文介绍的研究旨在解决对抗攻击中对属性控制的迫切需求,以确保全面了解漏洞并促进强大的对策的发展。 下面报告了所提出方法的概述。 提出了两种架构,一种与基于属性的生成相关,另一种与文本生成相关。无论是通过图像驱动还是通过文本引导,所提出的方法旨在生成逼真的对抗性虚假人脸,可以欺骗法证人脸检测器。该技术利用StyleGAN2的高度解缠空间,在统一框架内构建属性条件下的无约束攻击。 具体而言,引入了一种高效算法,通过对抗性优化属性特定的潜在变量来生成一个展示给定参考图像中属性的虚假人脸。这个过程有效地将参考图像中的所需粗细节转移到生成的虚假图像中。当进行基于图像的属性条件时,语义属性从提供的参考图像中转移到生成的虚假图像中。这是通过在引导感知损失的指导下在对抗空间中搜索来实现的,从而使所需属性转移到生成的虚假图像中。 此外,Contrastive Language-Image Pre-training(CLIP)的联合图像-文本表示能力被用于根据提供的文本描述生成虚假的人脸。这样可以强制生成的对抗性人脸图像与相应的文本描述保持一致。通过利用CLIP的文本引导特征空间,该方法在该特征空间中搜索对抗性潜在编码,从而生成与文本中描述的属性相符的虚假人脸。 本文展示了一些可用的结果。 这是一种生成逼真对抗性人脸以逃避法证分类器的新颖AI技术摘要。如果您对此工作感兴趣并想了解更多信息,可以通过下面的链接找到更多信息。
Leave a Comment目前,为定制应用实现大型语言模型(LLM)对于大多数个人来说非常困难。创建一个可以以高准确度和速度为专业领域生成内容或模仿写作风格的LLM需要大量时间和专业知识。 Stochastic拥有一支由明智的ML工程师、博士后和哈佛研究生组成的团队,致力于优化和加速LLMs的人工智能。他们推出了xTuring,这是一个开源解决方案,让用户只需三行代码即可创建自己的LLM。 自动化文本传递、聊天机器人、语言翻译和内容生成等应用是人们努力开发和创建具有这些概念的新应用的领域。对这些模型进行训练和微调可能耗时且昂贵。无论使用LLaMA、GPT-J、GPT-2还是其他方法,xTuring都可以轻松快速地进行模型优化。 xTuring作为单GPU或多GPU训练框架的多功能性意味着用户可以根据自己的特定硬件配置定制模型。xTuring使用内存高效的微调技术,如LoRA,加快学习过程,并将硬件支出减少多达90%。通过减少微调所需的内存量,LoRA促进了更快速和有效的模型训练。 xTuring的微调能力使用LLaMA 7B模型作为基准,并将xTuring与其他微调技术进行了比较。数据集包含52K个指令,测试时使用了335GB的CPU内存和4xA100 GPU。 结果表明,使用DeepSpeed + CPU卸载每个时期对LLaMA 7B模型进行21小时的训练时,GPU使用了33.5GB,CPU使用了190GB的内存。而使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载进行微调时,内存使用量分别降至23.7GB和21.9GB。CPU使用的RAM量从14.9GB降低到10.2GB。此外,使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载时,训练时间从40分钟缩短到20分钟每个时期。 开始使用xTuring非常简单。该工具的用户界面设计简单易学易用。用户只需几次鼠标点击即可微调模型,剩下的工作由xTuring完成。由于其易用性,xTuring是初学者和有经验用户的理想选择。 团队表示,由于xTuring允许单GPU和多GPU训练,使用LoRA等内存高效方法,并具有直观的界面,因此它是调整大型语言模型的最佳选择。…
Leave a Comment近期,著名的BERT模型一直是自然语言处理中领先的语言模型之一。该语言模型适用于多个NLP任务,这些任务将输入序列转换为输出序列。BERT(Bidirectional Encoder Representations from Transformers)使用了Transformer注意机制。注意机制学习文本语料库中单词或子词之间的上下文关系。BERT语言模型是自然语言处理进展的最重要例子之一,并使用了自监督学习技术。 在开发BERT模型之前,语言模型在训练时分析文本序列,要么从左到右,要么从左到右和从右到左结合。这种单向方法对于通过预测下一个单词来生成句子,并将其附加到序列中,然后预测下一个到下一个单词,直到获得完整的有意义的句子的工作效果很好。通过BERT,引入了双向训练,与以前的语言模型相比,它能更深入地理解语言上下文和流。 最初的BERT模型发布为英文。随后,开发了其他语言模型,如法文的CamemBERT和意大利文的GilBERTo。最近,苏黎世大学的研究人员开发了一种适用于瑞士的多语言模型。这个模型名为SwissBERT,它在瑞士标准德语、法语、意大利语和罗曼什语Grischun中训练了超过2100万篇瑞士新闻文章,总计120亿个标记。 SwissBERT的引入是为了克服瑞士研究人员在执行多语言任务时面临的挑战。瑞士主要有四种官方语言-德语、法语、意大利语和罗曼什语,对于每种特定语言,单独的语言模型很难进行组合以执行多语言任务。此外,第四种国家语言罗曼什语也没有单独的神经语言模型。由于在自然语言处理领域实现多语言任务有一定难度,瑞士国家语言在SwissBERT之前没有统一的模型。SwissBERT通过简单地结合这些语言的文章,并通过隐式利用新闻中的共同实体和事件来创建多语言表示,克服了这一挑战。 SwissBERT模型是由预先训练在81种语言中的跨语言模块(X-MOD)转换器重新建模而来。研究人员通过训练自定义语言适配器,将预先训练的X-MOD转换器适应到他们的语料库中。他们为SwissBERT创建了一个瑞士特定的子词汇表,得到的模型包含了1.53亿个参数。 研究团队在一些任务上评估了SwissBERT的性能,包括对当代新闻(SwissNER)中的命名实体进行识别和检测用户生成的对瑞士政治的立场。SwissBERT的表现优于常见的基准模型,并在检测立场方面优于XLM-R。在对罗曼什语的能力进行评估时,发现SwissBERT在零-shot跨语言转移和德语-罗曼什语单词和句子的对齐方面明显优于未经该语言训练的模型。然而,在识别历史上经过OCR处理的新闻中的命名实体方面,该模型表现不佳。 研究人员发布了带有用于下游任务微调的SwissBERT示例。这个模型在未来的研究甚至非商业目的上似乎很有前景。通过进一步的适应,下游任务可以从该模型的多语言能力中受益。
Leave a Comment由于离散声学令牌建模的进展,自动回归语音和音乐的生成方面取得了显著进展。为了有效地进行图片生成,研究人员提出了非自回归并行迭代解码方法。与自回归方法相比,需要在过去和未来的序列组成部分上进行条件处理的填充工作更适合于并行迭代解码。在本研究中,他们利用声学令牌建模和同时迭代解码来进行音乐音频合成。据他们所知,这是首次将并行迭代解码应用于神经音频音乐合成。 他们使用基于令牌的提示来调整他们的模型,称为VampNet,以适应各种应用。通过故意隐藏的音乐令牌序列,他们展示了指导VampNet生成并填充空白的能力。这个过程的结果可以是高质量的音频压缩方法,也可以是与原始输入音乐在风格、流派、节奏和乐器方面非常相似,但在音色和节奏方面有一些细微差别的变体。与自回归音乐模型不同,他们的方法允许提示放置在任何位置,后者只能通过使用一些前缀音频作为提示,并由模型产生可能跟随其后的音乐。 图1:VampNet概述。首先,他们使用音频令牌化器将音频分解为一系列不同的令牌。令牌首先被屏蔽,然后被发送到一个屏蔽生成模型,该模型使用有效的迭代并行解码采样技术,在两个级别上为屏蔽令牌预测值。然后将输出解码为音频。 他们研究了各种提示设计,如周期性、压缩和受音乐启发的设计(如节拍掩蔽)。他们发现,当指示其创建循环和变化时,他们的模型表现出色,因此被命名为VampNet。他们提供了可以下载的代码,并强烈建议人们查看他们的音频样本。Descript Inc.和Northwestern University的研究人员介绍了一种使用屏蔽声学令牌建模生成音乐的方法,输入音频文件可以通过各种方式提示VampNet,因为它是双向的。VampNet是一个很好的工具,可以在音乐压缩和通过各种提示方法进行音乐生成之间连续运行。 音乐家可以使用VampNet录制一个简短的循环,将其输入系统,每次重复循环区域时,VampNet都会提供创意上的音乐变体。他们打算在进一步的工作中研究VampNet及其提示方法在交互式音乐共创方面的潜力,以及屏蔽声学令牌建模的表示学习能力。
Leave a Comment谷歌最近在今年的Google I/O大会上发布了NotebookLM,原名为Tailwind项目。作为一个以人工智能为先导的实验,NotebookLM是一种独特的笔记本,旨在通过利用语言模型的能力来增强学习。由谷歌实验室开发,这个实验性产品旨在重新想象笔记软件,将强大的语言模型作为其核心。 NotebookLM的动机来自于当今快节奏世界中个人面临的信息过载日益增加的挑战。数据的丰富可能令人不知所措,使人们难以提取有意义的见解。谷歌意识到了这个困境,并与学生、教授和知识工作者进行了交流,以了解他们的困难。其中最普遍的挑战之一是从多个来源综合事实和观点的耗时过程。 为此,谷歌着手创建一种解决方案,使用户能够更高效地在海量信息中建立联系,主要使用对他们最重要的来源。结果就是NotebookLM,一个实验性产品,旨在利用语言模型和用户现有内容,以加速获得关键见解。可以将其视为一个虚拟研究助手,可以总结事实、解释复杂概念,并基于用户选择的来源促进新的联系探索。 NotebookLM通过“源地基”这个概念使自己与传统的人工智能聊天机器人区别开来。通过将语言模型与用户的笔记和来源联系在一起,NotebookLM创建了一个个性化的人工智能,熟悉与每个用户相关的特定信息。该过程始于选择Google文档作为源地基。与Google文档的集成提供了三个主要功能: 1. 获取摘要:将Google文档添加到NotebookLM后,系统会自动生成文档摘要以及关键主题和问题,以帮助用户更好地理解材料。 2. 提问:当用户希望深入了解时,他们可以询问有关上传的文档的问题。例如,医学生可以上传一篇关于神经科学的科学文章,并指示NotebookLM“创建一个与多巴胺相关的关键术语词汇表”。 3. 生成创意:NotebookLM的功能不仅限于问答交互。它擅长帮助用户生成创意。例如,内容创作者可以上传他们对新视频的创意,并要求NotebookLM“为这个主题生成一个短视频的剧本”。 NotebookLM的源地基减少了模型产生不准确回答的风险,但对AI的输出进行事实核查仍然至关重要。谷歌通过在每个回答中包含引文来简化这个过程,展示所使用的来源中最相关的原始引用。 NotebookLM的开发是谷歌实验室内的一个小团队的协作努力。该团队的主要目标是构建一个满足用户需求的产品,并确保负责任的技术部署。为实现这些目标,谷歌将积极寻求用户和社区的反馈,以提高NotebookLM的实用性。此外,该公司遵守与其AI原则一致的严格安全标准,并在扩大用户群体和引入新功能之前实施适当的安全措施。 为了解决隐私问题,谷歌设计了NotebookLM,限制模型对用户选择的上传来源材料的访问。此外,用户的文件和与AI的互动保持私密,并对其他用户不可访问。谷歌不使用收集的数据来训练新的AI模型,强调对用户隐私和数据保护的承诺。 谷歌旨在根据用户反馈不断改进产品,使其越来越有价值和用户友好。通过NotebookLM,谷歌设想革新笔记和信息综合,为用户提供一个强大的工具,帮助他们在广阔的知识领域中导航,并将信息转化为可行的见解。
Leave a Comment随着大型语言模型(LLM)的最近引入,其多样性和能力引起了人工智能领域的广泛关注。这些模型经过大量数据的训练,具备了在自然语言指令下理解、推理和生成文本的出色人类模仿能力。这些模型在零样本和少样本任务中表现良好,可以根据自然语言指令进行微调,以应对未预见的挑战。 当前的LLM及其开发主要集中在英语和资源丰富的语言上。大多数现有的LLM专门针对英语进行设计和训练,导致这些模型的研究和开发中存在英语的主导偏见。为了解决这个限制,来自DAMO Academy和阿里巴巴集团的研究人员提出了一种多语种LLM,称为POLYLM(多语种大型语言模型)。与现有的缺乏13B模型的多语种LLM不同,该团队发布了POLYLM-13B和POLYLM-1.7B以促进使用。 POLYLM是使用来自公开可访问的源(包括维基百科、mC4和CC-100)的640B标记的大规模数据集构建的。团队还提出了一种课程学习技术,以解决低资源语言的数据不足问题。该方法在训练过程中逐渐增加高质量的低资源语言比例,同时最初更加关注英语。重点是将通用知识从英语转移到其他语言。 该团队还开发了MULTIALPACA,一种多语种指令数据集,用于监督微调(SFT)阶段。现有的多语种SFT数据集要么通过手动注释获得(耗时且昂贵),要么通过机器翻译获得(可能导致翻译错误且缺乏文化细微差别)。这种多语种自我指导方法自动提供高质量的多语种指令数据,以克服这些限制,并利用英语种子、多语种翻译、指令生成和过滤系统。 为了评估和评估LLM的多语种能力,该团队开发了一个基准,该基准源于现有的多语种任务,包括问答、语言理解、文本生成和跨语言机器翻译。该基准通过精心设计的提示覆盖了15种语言的十个任务。通过大量实验,该团队证明了他们的预训练模型在非英语语言中的性能优于开源模型。所提出的课程训练策略在保持英语熟练度的同时提高了多语种性能。使用多语种指令数据还显著增强了POLYLM处理多语种零样本任务的能力。 该团队总结了以下贡献。 开发了一个熟练的13B规模模型,其在西班牙语、俄语、阿拉伯语、日语、韩语、泰语、印尼语和中文等主要非英语语言中表现良好。该模型补充了现有开源模型在这些语言中要么不熟练,要么具有较小版本且能力不同的不足之处。 提出了一种先进的课程学习方法,促进了从英语到多种非英语语言和特定自然语言处理任务(如机器翻译)的通用知识的传递。 提出了一个名为MULTIALPACA的数据集,它补充了现有的指令数据集,使LLM能够更好地遵循多语种指令,特别是来自非英语母语的指令。
Leave a Comment毫无疑问,AI机器人能够生成高质量和流畅的自然语言。长期以来,研究人员和从业者一直在思考构建一个充满具有人类行为的代理人的沙盒文明,以了解不同类型的互动、人际关系、社会理论等。可靠的人类行为替身可能会推动各种交互应用的发展,从虚拟现实到社交技能培训到原型程序。研究人员从斯坦福大学和谷歌研究中提出了一种利用生成模型模仿类人个体和紧急集体行为以响应其身份、变化经验和环境的代理人。 该小组的主要贡献可总结如下: 行为是合理的,因为它在代理人不断演化的经验和环境条件下进行动态调节,被称为生成代理人。 为实现生成代理人在快速变化的条件下具备长期记忆、检索、反思、社交互动和场景规划的能力而提出了革命性的框架。 使用两种类型的测试(控制试验和端到端测试)来确定架构的不同部分的价值,并发现类似故障记忆检索等问题。 讨论了应用生成代理人的交互系统对社会和伦理学带来的优势和潜在危险。 该小组的目标是创建一个虚拟开放世界框架,在这个框架中,智能代理人以自然语言安排日程、交换信息、建立友谊,并根据环境和历史线索协调团体活动。通过将大型语言模型(LLM)与基于LLM输出合成和提取数据的机制相结合,团队创建了一种新颖的代理人架构,使代理人能够从过去的错误中学习,并在保持长期角色连贯性的同时进行更精确的实时推理。 复杂行为可以通过代理人对录音进行递归合成来进行引导。代理人的内存流是一个数据库,包含代理人先前经历的完整记录。为了适应不断变化的环境,代理人可以从其内存流中获取相关数据,处理这些知识,并制定行动计划。 研究人员招募了人类评分员,并让他们建议的25个生成代理人在使用Phaser在线游戏开发框架开发的Smallville沙盒环境中作为非玩家角色(NPCs)运行。实验的标志是代理人对角色的一致表现以及对类人记忆、计划、反应和反思的令人信服的模仿。他们在两个完整的游戏日内用自然语言相互交流。 应用 通过将生成代理人与多模型相结合,有朝一日可以拥有能够在线和离线与人类互动的社交机器人。因此,现在可以原型化社会系统和想法,测试新的交互体验,并构建越来越逼真的人类行为模型。 人本设计过程是另一个可以使用GOMS和Keystroke Level Model等认知模型的领域。 使用生成代理人作为用户替身可以更多了解他们的需求和偏好,从而实现更个性化和高效的技术交互。 通过在角色扮演、社交原型、沉浸式环境和游戏中使用,这项研究有助于推动基于LLM的由动态和交互人类行为的代理人构成的模拟系统的发展。在进一步的研究中,可以进一步发展本文中建议的生成代理人架构的组成部分。例如,可以调整检索功能中包含的相关性、新近性和重要性函数,以提高检索模块在特定上下文中找到最相关材料的能力。还可以采取措施提高架构的性能,节省成本。 未来的研究应该通过更长时间的观察生成代理人的行为,以全面了解它们的能力和限制,因为本研究对其行为的评估仅限于非常短的时间线。
Leave a Comment人员再识别(Person Re-ID)是一种先进的计算机视觉方法,可以更容易地通过不同地点和时间的监控摄像头来识别人员。尽管个人图像具有改善安全和公共安全的巨大潜力,但其使用存在着重大的隐私问题。由于根据数据隐私法律法规,个人图像被视为私人信息,因此这些问题需要隐私保护的解决方案。 现有的隐私保护人员再识别方法存在一定的局限性。传统的加密方法可以提供较强的隐私保护,但无法对加密数据进行计算。同态加密(HE)直接支持对密文进行计算,但不允许云服务器访问计算结果。此外,现有的浮点特征向量加密机制存在解码和计算错误的问题。 最近,发表了一篇新文章,提出一种名为FREED的新的隐私保护人员再识别解决方案。该系统将隐私保护的人员再识别定义为加密特征向量的相似性度量,使得云服务器可以在不泄露任何个人图像隐私的情况下执行再识别操作。 具体而言,FREED利用新的编码机制和安全批处理计算协议来加密浮点特征向量并有效地执行再识别操作。 FREED引入了三个关键组件来保护特征向量的隐私: 编码机制(ECMO)将浮点特征向量转换为整数,确保准确性并避免解码错误。 安全批处理乘法(BatchSMUL)协议高效计算加密特征向量的相似性度量,减少计算成本。 安全批处理部分解密(BatchPDec)协议安全地对相似性度量进行排序,实现准确的人员再识别,同时不泄露个人隐私。 通过这些组件,可以提供一个强大的隐私保护解决方案,用于人员再识别任务。 提出使用ECMO将浮点特征向量转换为整数,具有两个关键优势。首先,它消除了其他编码方法常见的解码错误。ECMO确保在加密和解密后更准确地检索原始特征向量,保留其准确性,并提高人员再识别的准确性。其次,与传统方法相比,这种转换为整数显著降低了计算错误率和加密成本。ECMO的更高效和精确的过程提高了方案的整体准确性和实用性,适用于实际应用。 通过对计算和通信开销方面的效率进行评估,测试表明ECMO相对于其他编码技术具有较低的错误率。同时还确定了控制参数设置。FREED提供了一种安全可行的人员再识别方法,相比先前的协议在计算和通信方面性能更好。 总之,本文介绍了FREED,一种新颖有效的隐私保护人员再识别解决方案。通过利用编码机制(ECMO)将浮点特征向量转换为整数,FREED解决了传统编码方法的局限性,提高了准确性并减少了计算和计算错误。安全批处理乘法(BatchSMUL)和安全批处理部分解密(BatchPDec)协议提高了系统的效率。通过广泛的实验评估,FREED在计算和通信方面展示了其有效性和效率,相比于MGN等方法,FREED为解决人员再识别中的隐私挑战提供了一种有希望的方法,同时保持了高准确性和实用性,适用于实际应用。
Leave a Comment姿势、眼神、面部表情、手势等,统称为“肢体语言”,一直是许多学术研究的课题。准确记录、解读和创建非言语信号可以极大地增强遥感、增强现实(AR)和虚拟现实(VR)环境中人物形象的逼真程度。 现有的最先进的人物形象模型,如SMPL系列中的模型,可以正确地描绘出逼真姿势中不同的人体形态。然而,它们受到其使用的基于网格的表示和3D网格质量的限制。此外,这类模型通常只模拟裸体,不包含服装和头发,从而降低了结果的逼真度。 他们介绍了X-Avatar,这是一种创新模型,可以在数字化人物形象中捕捉到人类表情的完整范围,以创建逼真的遥感、增强现实和虚拟现实环境。X-Avatar是由瑞士苏黎世联邦理工学院(ETH Zurich)和微软(Microsoft)研究人员开发的一种富有表现力的隐式人类人物模型。它可以捕捉高保真度的人体和手部动作、面部情绪和其他外貌特征。该技术可以从完整的3D扫描或RGB-D数据中学习,生成身体、手部、面部情绪和外貌的综合模型。 研究人员提出了一种部位感知的学习前向蒙皮模块,可以通过SMPL-X参数空间控制,实现X-Avatar的富有表现力的动画。研究人员提出了独特的部位感知采样和初始化算法,以有效地训练神经形状和变形场。研究人员通过一个纹理网络,根据位置、面部表情、几何形状和变形表面的法线来增强几何和变形场,以捕捉具有高频细节的人物外貌。这样可以提高细小身体部位的保真度,同时在关节骨骼数量增加的情况下保持训练的有效性。研究人员凭经验证明,该方法在动画任务上相对于强基线模型在数据领域和质量方面取得了更优秀的定量和定性结果。 研究人员提出了一个名为X-Humans的新数据集,其中包含来自20个受试者的233个高质量纹理扫描序列,共计35,500个数据帧,以促进对表达人物形象的研究。X-Avatar提供了一种以关节神经隐式表面为特征的人体模型,适应着穿着衣物的个体的多样拓扑结构,并实现了更好的几何分辨率和整体外貌的保真度。研究的作者定义了三个不同的神经场:一个用于使用隐式占据网络建模几何形状,另一个用于使用学习的前向线性混合蒙皮(LBS)建模变形,具有连续的蒙皮权重,第三个用于使用RGB颜色值建模外貌。 X-Avatar模型可以接受3D姿势扫描或RGB-D图像进行处理。其设计的一部分包括一个用于在规范空间中建模几何形状的塑形网络,以及一个使用学习的线性混合蒙皮(LBS)建立规范和变形区域之间对应关系的变形网络。 研究人员从SMPL-X的参数空间开始,这是一种捕捉全身人物形状、外貌和变形的SMPL扩展,特别关注手部位置和面部情绪,以生成富有表现力和可控的人类人物形象。以关节神经隐式表面来描述人体模型,代表着穿着衣物的个体的各种拓扑结构。同时,一种独特的部位感知初始化方法通过提高对细小身体部位的采样率,极大地增强了结果的逼真度。 结果表明,X-Avatar可以准确记录人体和手部姿势,以及面部情绪和外貌,从而可以创造出更具表现力和逼真的人物形象。这个倡议的团队衷心希望他们的方法可以激发更多的研究,赋予人工智能更多的个性。 使用的数据集 高质量纹理扫描和SMPL[-X]注册;20个受试者;233个序列;35,427个帧;身体姿势+手势+面部表情;各种服装和发型选择;各个年龄段 特点 有几种方法可以教授X-Avatars。 训练中使用的3D扫描图像,右上方。底部:测试姿势驱动的人物形象。 教学目的使用的RGB-D信息,顶部。测试姿势的人物形象表现较差。 该方法在动画测试中恢复了更好的手部灵活性和面部表情,超过了其他基线模型。这导致使用PyMAF-X从单眼RGB影片中恢复的运动进行动画化的X-Avatars。 限制 X-Avatar在模拟露肩上衣或裤子(例如,裙子)时存在困难。然而,研究人员通常只对每个主题训练一个模型,因此他们在单个个体之外的泛化能力仍然需要扩展。 贡献 X-Avatar是第一个全面捕捉身体姿势、手势、面部情绪和外观的富有表现力的隐式人类化身模型。 考虑底层结构的初始化和采样过程提高了输出质量并保持了训练效率。 X-Humans是一个全新的数据集,包含20个人的233个序列,总共有35,500帧高质量纹理扫描,显示了各种身体、手势和面部情绪。 X-Avatar在捕捉身体姿势,手势,面部情绪和整体外观方面无与伦比。研究人员使用最近发布的X-Humans数据集展示了该方法的效果。
Leave a Comment视觉变压器(ViT)因其简单性、灵活性和可扩展性而快速取代基于卷积的神经网络。图片被分割成补丁,并且每个补丁被线性投影到一个令牌上,构成了这个模型的基础。输入照片通常被划分为一组固定数量的补丁,然后再使用。 最近的研究发表了对这个模型的潜在改进:FlexiViT允许连续的序列长度范围,因此通过在单个设计中适应不同的补丁尺寸来计算成本。这是通过在每次训练迭代中随机选择补丁尺寸,并使用缩放技术来适应初始卷积嵌入中的多个补丁尺寸来实现的。Pix2Struct的替代补丁方法,保持了纵横比,对于图表和文档理解等任务非常有价值。 NaViT是谷歌研究人员开发的一种替代方法。Patch n’ Pack是一种技术,它允许在保持纵横比的同时改变分辨率,通过将来自不同图像的许多补丁打包到一个序列中。这个想法基于“示例打包”,这是一种在自然语言处理中使用的技术,通过将多个实例合并成一个序列来高效训练具有不同长度输入的模型。科学家们发现,随机采样分辨率可以显著减少训练时间。NaViT在广泛的解决方案范围内实现了出色的性能,便于在推理时平滑地权衡成本和性能,并且可以以较低的成本轻松适应新的任务。 从示例打包所实现的固定批次形状中出现了像保持纵横比的解析率采样、可变的令牌丢弃率和自适应计算等研究思路。 NaViT在预训练期间的计算效率尤为令人印象深刻,并在微调过程中持续存在。成功地将单个NaViT应用于不同的分辨率,可以在性能和推理成本之间实现平滑的权衡。 在训练和操作过程中将数据输入深度神经网络是常见的实践。因此,计算机视觉应用必须使用预定的批次大小和几何形状,以确保在现有硬件上获得最佳性能。由于这个原因和卷积神经网络固有的架构限制,将图像调整大小或填充到预定大小已经成为常见的做法。 虽然NaViT基于原始的ViT,但理论上可以使用任何可以处理补丁序列的ViT变种。研究人员对ViT进行了以下结构性改变以支持Patch n’ Pack。Patch n’ Pack是一种将序列打包应用于视觉变换器的简单方法,它显著提高了训练效率,这已经被研究界证明过。由此产生的NaViT模型具有灵活性,易于适应新的任务,而不会造成巨大的成本开销。自适应计算和提高训练和推理效率的新算法的研究只是Patch n’ Pack所带来的可能性的两个例子,而这些以前因需要固定的批次形式而受到限制。他们还认为NaViT对ViT来说是朝着正确方向迈出的一步,因为它代表了大多数计算机视觉模型的传统CNN设计输入和建模流程的改变。
Leave a CommentTransformer模型最近越来越受欢迎。这些神经网络模型遵循顺序输入中的关系,比如句子中的单词,以学习上下文和含义。随着OpenAI提出的GPT 3.5和GPT 4等模型的引入,人工智能领域,特别是深度学习领域取得了巨大的进步,成为了热门话题。竞技编程、对话式问题回答、组合优化问题和图学习任务都将Transformer作为关键组件。 Transformer模型在竞技编程中用于根据文本描述生成解决方案。ChatGPT是一个著名的基于GPT的聊天机器人模型,也是一个备受喜爱的对话式问答模型,是Transformer模型的最佳例子。Transformer模型还被用于解决组合优化问题,如旅行推销员问题,并且在图学习任务中取得了成功,特别是在预测分子特性方面。 Transformer模型在图像、音频、视频和无向图等多种形式的模态中表现出了极高的灵活性,但是对于有向图的Transformer仍然缺乏关注。为了填补这一空白,一组研究人员提出了两种专门针对有向图设计的方向和结构感知的位置编码。磁性拉普拉斯是组合拉普拉斯的方向感知扩展,为第一个提出的位置编码提供了基础。所提供的特征向量捕捉了关键的结构信息,同时考虑了图中边的方向性。通过在位置编码方法中包含这些特征向量,Transformer模型更加关注图的方向性,从而成功地表示了有向图中的语义和依赖关系。 方向随机游走编码是第二种提出的位置编码技术。随机游走是一种探索和分析图的流行方法,模型通过在图中进行随机游走,并将游走信息融入到位置编码中,更多地了解有向图的方向结构。由于它有助于模型理解图内链接和信息流动,这种知识在多种下游任务中被使用。 研究团队表示,经验分析表明,方向和结构感知的位置编码在许多下游任务中表现良好。其中之一是排序网络的正确性测试,即确定一组操作是否真正构成排序网络。所提出的模型在排序网络的图表示中利用图的方向性信息,相对于Open Graph Benchmark Code2的先前最先进方法提高了14.7%。 研究团队总结了以下贡献: 建立了常用于Transformer的正弦位置编码与拉普拉斯特征向量之间的明确联系。 研究团队提出了扩展到有向图的谱位置编码,为位置编码中加入方向性信息提供了一种方式。 将随机游走位置编码扩展到有向图,使得模型能够捕捉到图的方向结构。 研究团队评估了结构感知位置编码在各种图距离预测中的预测能力,展示了其有效性。他们引入了预测排序网络正确性的任务,展示了方向性在该应用中的重要性。 研究团队量化了将程序语句序列表示为有向图的好处,并提出了一种新的源代码图构建方法,提高了预测性能和鲁棒性。 在OGB Code2数据集上取得了新的最先进性能,特别是在函数名预测方面,F1分数提高了2.85%,相对改进率为14.7%。
Leave a Comment人工智能近年来取得了巨大的进步。其中,大型语言模型的引入引起了广泛关注,因为它具有令人难以置信的模仿人类能力。这些模型不仅在语言处理方面取得了成功,还在计算机视觉领域取得了成就。尽管AI系统在自然语言处理和可控图像生成方面取得了显著成就,但包括通用图像分割在内的像素级图像理解领域仍存在一定的局限性。 图像分割是将图像分割为不同部分的技术,取得了很大的改进,但要创建一个能处理不同粒度的各种图像的通用图像分割模型仍在讨论中。在该领域取得进展的两个主要挑战是充足的训练数据的可用性和模型设计的灵活性限制。现有方法通常使用单输入、单输出的流水线,无法预测不同粒度的分割掩码并处理不同的细节级别。此外,扩展既具有语义知识又具有粒度知识的分割数据集是昂贵的。 为了解决这些限制,一个研究团队提出了Semantic-SAM,一种基于用户输入的通用图像分割模型,可以在任意所需的粒度上对对象进行分割和识别。该模型能够为对象和部分提供语义标签,并根据用户的点击预测不同粒度的掩码。Semantic-SAM的解码器架构采用了多选择学习策略,使模型具备处理多个粒度的能力。每个点击由多个查询表示,每个查询具有不同的嵌入级别。这些查询通过与不同粒度的真实掩码学习。 该团队分享了Semantic-SAM如何通过使用解耦的部件和对象分类策略来解决语义意识问题。该模型使用共享的文本编码器分别对对象和部件进行编码,从而实现不同的分割过程,并根据输入类型调整损失函数。这种策略确保了模型能够处理来自SAM数据集(该数据集缺少一些分类标签)以及来自通用分割数据的数据。 该团队结合了七个代表不同粒度的数据集,以增强语义和粒度,包括SA-1B数据集、部分分割数据集如PASCAL Part、PACO和PartImagenet,以及通用分割数据集如MSCOCO和Objects365。数据格式已重新调整以符合Semantic-SAM的训练目标。 经过评估和测试,Semantic-SAM表现出比现有模型更优异的性能。当与交互式分割技术(如SA-1B可提示分割和COCO全景分割)结合使用时,性能显著提高。该模型实现了惊人的2.3个框AP增益和1.2个掩码AP增益。在粒度完整性方面,它比SAM表现更好,超过3.4个1-IoU。 Semantic-SAM绝对是图像分割领域的创新进展。该模型通过融合通用表示、语义意识和粒度丰富性,为像素级图像分析创造了新的机会。
Leave a Comment生成式人工智能在计算机视觉领域引起了广泛的关注。最近在文本驱动的图像和视频合成方面取得的进展,例如文本到图像(T2I)和文本到视频(T2V),借助扩散模型的出现,展示了卓越的保真度和生成质量。这些进展展示了相当大的图像和视频合成、编辑和动画潜力。然而,合成的图像/视频与完美仍有很大差距,特别是对于人类中心的应用,如人类舞蹈合成。尽管人类舞蹈合成有着悠久的历史,但现有方法在合成内容与真实舞蹈场景之间存在很大的差距。 从生成对抗网络(GANs)时代开始,研究人员尝试扩展视频到视频的风格转移,将舞蹈动作从源视频转移到目标个体,这通常需要对目标人员进行人员特定的微调。 最近的一系列工作利用预先训练的基于扩散的T2I/T2V模型,根据文本提示生成舞蹈图像/视频。这种粗粒度的条件极大地限制了可控性的程度,使用户几乎不可能精确指定预期的主题,即人类外观,以及舞蹈动作,即人类姿势。 虽然引入了ControlNet部分缓解了这个问题,通过将几何人体关键点的姿势控制与之结合,但由于其依赖于文本提示,ControlNet如何确保参考图像中丰富的语义一致性,如人类外观,仍然不清楚。此外,几乎所有现有方法都是在有限的舞蹈视频数据集上进行训练,要么具有有限的主题属性,要么具有过于简单的场景和背景。这导致对未见过的人物主题、姿势和背景组合的零样本泛化能力较差。 为了支持用户特定的短视频内容生成等实际应用,人类舞蹈生成必须符合真实舞蹈场景。因此,期望生成模型能够根据以下属性合成人类舞蹈图像/视频:保真度、泛化能力和组合性。 生成的图像/视频应通过保留与参考图像一致的人类主题和背景外观,同时准确遵循提供的姿势来展现保真度。该模型还应展示泛化能力,即在不需要人员特定微调的情况下处理未见过的人类主题、背景和姿势。最后,生成的图像/视频应展示组合性,允许从不同的图像/视频中选择任意组合的人类主题、背景和姿势。 在这方面,提出了一种新颖的名为DISCO的方法,用于在真实场景中生成人类舞蹈。该方法的概述如下图所示。 https://arxiv.org/abs/2307.00040 DISCO采用两个关键设计:一种具有分离控制的新颖模型架构,用于提高保真度和组合性,以及一种名为人类属性预训练的预训练策略,用于提高泛化能力。DISCO的新颖模型架构确保生成的舞蹈图像/视频能够忠实地捕捉所需的人类主题、背景和姿势,同时允许这些元素的灵活组合。此外,分离控制增强了模型维持忠实表示和适应多样组合的能力。此外,DISCO采用人类属性预训练策略增强模型的泛化能力。这种预训练技术赋予模型处理未见过的人类属性的能力,使其能够生成超越训练数据限制的高质量舞蹈内容。总体而言,DISCO提供了一个综合的解决方案,将复杂的模型架构与创新的预训练策略结合起来,有效解决了真实场景中人类舞蹈生成的挑战。 以下展示了生成的图像/视频以及与人类舞蹈生成的最先进技术的比较。 https://arxiv.org/abs/2307.00040 这是关于DISCO的摘要,一种生成人类舞蹈的新型人工智能技术。如果您感兴趣并想了解更多关于这项工作的信息,可以通过下面的链接找到更多信息。
Leave a CommentDeepSwap DeepSwap是一个基于人工智能的工具,适用于任何想要创建令人信服的深度伪造视频和图像的人。通过重新面向视频、图片、表情包、旧电影、GIF等方式,创建您的内容非常简单。该应用程序没有内容限制,因此用户可以上传任何内容的材料。此外,您还可以首次成为产品的订阅用户,享受50%的折扣。 Docktopus AI Docktopus是一种由AI驱动的演示工具,通过100多个可自定义的模板简化在线内容的创建,让用户能够在几秒钟内创建专业演示文稿。 Promptpal AI Promptpal AI帮助用户发现获取AI模型(如ChatGPT)最大利益的最佳提示。 Quinvio AI Quinvio是一种AI视频制作工具,可以通过直观的编辑器、AI辅助写作和选择AI发言人的选项快速制作视频演示。 Ask your PDF AskYourPdf是一种AI聊天机器人,可帮助用户轻松与PDF文档进行交互并提取洞见。 Supernormal AI Supernormal是一种AI工具,可以自动创建会议记录,每次会议可节省5-10分钟。 Suggesty Suggesty由GPT-3驱动,为Google搜索提供类似人类的答案。 ChatGPT Sidebar ChatGPT Sidebar是一款ChatGPT…
Leave a Comment自从大规模的OT和Wasserstein GANs出现以来,机器学习越来越倾向于使用神经网络来解决最优传输(OT)问题。最近,OT计划被证明可作为具有可比实际任务性能的生成模型使用。OT成本通常被计算并用作生成模型中生成器更新的损失函数。 人工智能研究所(AIRI)和斯科尔科技学院合作开发了一种利用神经网络优化跨学科信息共享的新算法。该算法的理论基础使其输出更易于理解,而不像竞争方法那样需要耦合训练数据集,如输入-输出示例,这种新方法可以在输入和输出领域的不同数据集上进行训练。 大规模训练数据集很难获得,但对于面部或语音识别以及医学图像分析等应用构建的现代机器学习模型来说是必要的。这就是为什么科学家和工程师经常通过人工手段模拟真实世界数据集的原因。生成模型的最新进展大大提高了生成文本和图像的质量,因此这项工作变得更加容易。 神经网络被教导从配对的训练样本和输入-输出图像集泛化和扩展到新的输入图像;这对于需要处理许多质量不同的相同照片的工作非常有用。换句话说,生成模型通过合成来自不同数据的数据,促进了从一个领域到另一个领域的过渡。例如,神经网络可以将手绘图转换为数字图像,或者改善卫星照片的清晰度。 将概率分布与确定性和随机传输映射对齐是该技术的独特应用,它是一种通用工具。该方法将增强非配对翻译(图像恢复,域适应性等)以外的现有模型。与基于GAN或扩散模型的常见方法相比,该方法允许更好地控制生成样本的多样性水平,并提高了学习映射的可解释性。研究人员可能需要修改所获得的OT映射以适应非配对活动。研究人员强调了某些任务的运输成本设计作为一个潜在的研究领域。 最优传输和生成学习的交集是所选择方法的核心。娱乐、设计、计算机图形学、渲染等领域广泛使用生成模型和高效的传输。上述领域中的几个问题可能适用于该方法。可能的缺点是,一些图形业务中的职业可能会受到先前工具的使用的影响,这些工具使图像处理技术公开可用。 由于成本过高或获取困难,研究人员通常不得不使用不相关的数据集,而不是理想的匹配数据集。团队回顾了苏联数学家和经济学家列昂尼德·坎托罗维奇的著作,借鉴了他关于有效货物运输(最优传输理论)的思想,以开发一种在领域之间规划最优数据传输的新方法。神经最优传输是一种使用深度神经网络和分开的数据集的新方法。 在非配对领域转换评估中,该算法在图片风格化和其他任务上实现了比现有方法更好的结果。此外,它需要较少的超参数,通常很难调整,具有更可解释的结果,并且基于坚实的数学基础而不是竞争方法。
Leave a Comment随着数字文本信息在一般和医疗领域中的数量急剧增加,对有效和准确的文本摘要模型的需求也在增加。文本摘要涉及将一篇冗长的写作压缩成简明的概述,同时保留材料的意义和价值。这已经成为自然语言处理(NLP)研究的重点已经很长时间了。 引入神经网络和深度学习技术,特别是使用编码器-解码器结构的序列到序列模型进行摘要生成,已经传达出积极的结果。与基于规则和统计的方法相比,这些方法生成的摘要更加自然和上下文适用。由于需要保留这些结果的上下文和关联特征以及在治疗环境中精确度的要求,这一努力变得更加困难。 研究人员使用ChatGPT来总结放射学报告,并对其进行了改进。为了充分利用ChatGPT的上下文学习能力,并通过交互不断改进它,研究人员开发并实施了一种新颖的迭代优化方法,使用快速工程学。更准确地说,我们采用相似性搜索算法来构建一个动态提示,其中包含语义上和临床上可比较的现有报告。ChatGPT通过这些并行报告进行训练,以理解类似成像表现的文本描述和摘要。 主要贡献 相似性搜索使得能够使用稀疏数据对语言模型(LLM)进行上下文学习。通过识别语料库中最可比较的案例,开发了一个包含LLM最相关数据的动态提示。 我们为迭代优化技术创建了一个动态提示系统。迭代提示首先评估LLM生成的回复,然后在后续迭代中提供更多指导。 一种利用领域特定信息的新方法来调整LLM。建议的方法可以在需要快速和有效地从现有LLM开发领域特定模型时使用。 方法 变量提示 动态样本使用语义搜索来获取与输入放射学报告相似的报告语料库中的示例;最终查询由相同的预定义查询与测试报告的“发现”部分组成,任务描述描述了角色。 迭代优化 通过迭代优化组件可以完成一些很酷的事情。这种方法的目标是通过使用迭代提示使ChatGPT逐步改进其答案。对于放射学报告摘要等重要应用来说,这也需要一种响应审查过程来检查回复的质量。 通过基于少量训练样本和迭代方法改进输入提示来研究使用大型语言模型(LLMs)进行放射学报告摘要的可行性。通过挖掘语料库中的合适实例,以在上下文中学习LLMs,然后用于提供交互提示。为了进一步提高输出,使用了一种迭代优化技术。该过程包括根据自动评估反馈教授LLM什么是好的和负面的回复。与使用大量医学文本数据进行预训练的其他方法相比,我们的策略已经证明更优越。在现代通用人工智能中,这项工作也为构建更多领域特定语言模型奠定了基础。 在研究ImpressionGPT的迭代框架时,我们意识到评估模型输出回复的质量是一项重要但困难的任务。研究人员假设,用于训练LLMs的领域特定和通用领域文本之间的巨大差异导致了观察到的评分差异。因此,通过使用细粒度的评估指标来检查获得的结果的具体细节。 为了更好地包含来自公共和本地数据源的领域特定数据,我们将在未来继续优化快速设计,同时解决数据隐私和安全问题,尤其是在处理许多组织时。我们还考虑使用知识图谱来使提示设计适应当前的领域知识。最后,我们计划将医学专家(如放射科医生)纳入到优化提示和对系统提供的结果提供客观反馈的迭代过程中。通过结合人类专家在开发LLMs过程中的判断和观点,我们可以得到更精确的结果。
Leave a Comment生成式人工智能的惊人增长引发了图片生成方面的令人着迷的进展,利用DALL-E、Imagen和Stable Diffusion等技术,可以根据文本提示创建出色的图像。这一成就可能不仅局限于2D数据。最近DreamFusion展示了文本到图像生成器可以用于创建高质量的3D模型,尽管生成器缺乏3D训练,但有足够的数据来重建3D形状。本文阐述了如何通过文本到图像生成器获得更多,并获得多个3D物体类型的关节模型。 也就是说,他们不是试图创建单个3D资产(DreamFusion),而是希望创建整个类别的关节3D物体的统计模型(如牛、羊和马),该模型可以用于从单个图像(无论是真实的还是数字化的)创建可用于增强现实/虚拟现实、游戏和内容创作的动画化的3D资产。他们通过训练一个可以根据物体的单张照片预测关节3D模型的网络来解决这个问题。为了引入这样的重建网络,先前的工作一直依赖于真实数据。然而,他们提出使用使用2D扩散模型(如Stable Diffusion)生成的合成数据。 牛津大学视觉几何组的研究人员提出了Farm3D,它是DreamFusion、RealFusion和Make-a-video-3D等3D生成器的一个补充,这些生成器可以通过测试时间优化从文本或图像开始创建单个的3D静态或动态资产,需要数小时。这提供了几个优点。首先,2D图像生成器倾向于生成准确和完好的物体类别示例,从而隐式地筛选训练数据并简化学习过程。其次,通过2D生成器隐含地提供了每个给定物体实例的虚拟视图,进一步提供了对理解的澄清。第三,它通过消除收集(可能还需要审查)真实数据的要求,增加了方法的适应性。 在测试时,他们的网络以前馈方式从单张图像中进行重建,仅需几秒钟即可生成可操作的关节3D模型(例如,可以进行动画化、重新照明),而不是固定的3D或4D工件。他们的方法适用于合成和分析,因为重建网络仅在虚拟输入上进行训练,但能够推广到实际照片。可以将该方法应用于动物行为的研究和保护。Farm3D基于两个重要的技术创新。首先,他们展示了如何通过快速工程使Stable Diffusion产生大量通常干净的物体类别图片,以学习关节3D模型。其次,他们展示了如何将得分蒸馏采样(SDS)损失扩展到合成多视图监督,以训练照片几何自编码器,即MagicPony。为了创建同一物体的新人工视图,照片几何自编码器将物体分成多个方面,这些方面有助于图像形成(例如物体的关节形状、外观、相机视点和照明)。 这些合成视图被输入到SDS损失中,以获得渐变更新和反向传播到自编码器的可学习参数。他们对Farm3D进行了基于3D生成和修复能力的定性评估。由于Farm3D能够进行重建和创建,因此可以在语义关键点传输等分析任务上进行定量评估。尽管该模型不使用任何真实图像进行训练,从而节省了耗时的数据收集和筛选过程,但他们展示了与各种基准相当甚至更好的性能。
Leave a Comment密歇根大学的研究人员开发了一个名为Zeus的开源优化框架,用于解决深度学习模型的能源消耗问题。随着使用更大模型和更多参数的趋势增长,训练这些模型所需的能量需求也在增加。Zeus通过在训练过程中识别能源消耗和训练速度之间的最佳平衡来解决此问题,而无需进行任何硬件更改或新基础设施。 Zeus通过使用两个软件开关实现这一目标:GPU功率限制和深度学习模型的批大小参数。GPU功率限制控制GPU消耗的电量,批大小参数控制在更新模型对数据关系的表示之前处理多少个样本。通过实时调整这些参数,Zeus旨在最小化能源消耗,同时尽可能少地对训练时间产生影响。 Zeus设计用于与各种机器学习任务和GPU配合使用,并且可以在不更改硬件或基础设施的情况下使用。此外,研究团队还开发了名为Chase的补充软件,该软件可以通过在低碳能源可用时优先考虑速度,在高峰时段优先考虑效率来降低DNN训练的碳足迹。 研究团队的目标是开发出符合实际情况、能够减少DNN训练的碳足迹并不与大型数据集大小或数据规定等约束冲突的解决方案。虽然由于需要使用最新数据而不总是可以将训练工作推迟到更绿色的时间范围内,但Zeus和Chase仍然可以在不牺牲准确性的情况下提供显著的能源节约。 通过减少深度学习模型的能源需求,Zeus和Chase的开发是解决深度学习模型能源消耗问题的关键一步。研究人员可以在不影响训练时间的情况下展示出显著的能源节约,从而减轻人工智能对环境的影响并促进可持续实践。 总之,Zeus是一个开源优化框架,旨在通过识别能源消耗和训练速度之间的最佳平衡来减少深度学习模型的能源消耗。通过调整GPU功率限制和批大小参数,Zeus最小化能源使用,同时不影响准确性。Zeus可以与各种机器学习任务和GPU配合使用,而补充软件Chase可以降低DNN训练的碳足迹。Zeus和Chase的开发促进了人工智能领域的可持续实践,并减轻了其对环境的影响。
Leave a Comment一种能够描述高维空间中复杂分布的强大生成模型是基于得分的生成模型(SBGMs),其中包括扩散模型。通常使用随机微分方程(SDE)模拟基于几乎总是高斯的源密度来产生样本。尽管基于模拟的去噪目标优化需要高斯源的假设,但SBGMs受其对高斯源的假设的限制,尽管其经验成功。由于物理或生物系统的时间发展中经常违背这一假设,如单细胞基因表达数据的情况,因此无法使用SBGMs来理解潜在动力学。 连续正则化流(CNFs),也称为流式生成模型,已成为解决这些问题的选择方法。通过普通微分方程(ODE)将源密度转换为目标密度,该ODE在流式模型中假设了确定性连续时间生成过程。以往的研究引入了无需模拟的训练目标,使得在假设高斯源的情况下,CNFs可以与SBGMs竞争,并且这些目标已扩展到任意源分布的情况。流式模型以前受到基于模拟的训练目标的限制,这些目标在训练时要求对ODE进行昂贵的积分。 然而,这些目标仍然需要涵盖学习随机动力学,这对于生成建模和恢复真实系统的动力学可能是有用的。薛定谔桥问题(SB)考虑了在某个参考过程下,源概率分布与目标概率分布之间的最可能演化。它是两个任意分布之间的随机映射的基本概率形式。建模自然随机动力学系统、平均场博弈和生成建模等问题都是使用SB问题的几个应用。SB问题通常缺乏封闭形式的解,除了几种特殊情况(如高斯)。但是,可以使用需要复制已学习的随机过程的迭代技术来近似它。 尽管在理论上有效,但这些方法存在数值和实际问题,仅允许高维缩放。魁北克Mila AI研究所、蒙特利尔大学、麦吉尔大学、多伦多大学和Vector研究机构的研究人员研究了薛定谔桥问题的无模拟得分和流匹配(2M)目标。 2M通过SB问题与熵最优传输(OT)之间的关系,将CNFs的无模拟目标和扩散模型的去噪训练目标同时推广到随机动力学和任意源分布上。 2M可以从源分布和目标分布之间的静态熵最优传输映射中受益,这些映射通过Sinkhorn方法或随机算法有效地近似,而不是需要在每次迭代中模拟SDE的动态SB方法。他们使用模拟和真实数据集展示了2M的实用性。在人工数据上,他们证明了2M在生成建模度量方面优于先前的类似工作,并发现了对真实薛定谔桥的更准确近似。他们通过将一系列薛定谔桥作为交叉测量序列(即不配对的时间序列观测)的建模来应用到实际数据中。 尽管先前已经有几种在静态或低维动态设置中使用薛定谔桥对细胞进行建模的方法,但2M是首个可以扩展到数千个基因维度的方法,因为它的训练不需要模拟。他们还提供了一个静态流形测地线映射,展示了薛定谔桥近似在非欧几里德成本下的最早的实际应用之一,从而增强了动态环境中的细胞插值。最后,他们证明,与静态最优传输示例相比,他们可以直接建模和重构控制细胞动力学的基因-基因相互作用网络。代码和示例可在GitHub上获取。
Leave a Comment