Press "Enter" to skip to content

Tag: Tech News

又一个大型语言模型!认识IGEL:一个针对指令调整的德语LLM家族

IGEL是针对文本的指令定制的德语大型语言模型。IGEL 001版本(Instruct-igel-001)是一个原始的概念验证,旨在确定是否可以通过将现有的开源模型与德语翻译指令数据集相结合来构建德语指令定制模型。 IGEL的第一个版本基于BigScience BLOOM,由Malte Ostendorff本地化为德语。IGEL旨在执行与自然语言理解相关的各种任务,包括情感分析、语言翻译和问题回答,在每个领域都具有高准确性和可靠性。 团队想要尝试LLM在德语指令建模任务中的表现如何。他们使用预训练的自定义BLOOM模型(6B)并使用基于翻译指令的数据集进行微调来实现这一目标。为了构建数据集,他们使用了一种称为自动翻译的方法将英语指令转化为德语。尽管由于这种策略存在较大的翻译错误的可能性,但他们的目标是确定模型是否仍然能够学习生成指令回复。 Instruct-igel-001中的LoRA定制BLOOM-CLP Deutsch(6.4B参数)具有用于Hugging Face Transformers的合并权重。在对naive翻译的指令数据集进行训练之前,并没有太多关注数据的清理、筛选或后处理。 团队提到,幻觉、有毒性和刻板印象只是instruct-igel-001存在的一些问题,这些问题在语言模型中很常见。他们计划完成聊天模型的开发,以创建一个对话界面。这将以超越传统的请求-响应方法的方式改善数据质量。

Leave a Comment

什么是AI图像生成器?2023年一些顶级AI图像生成器

AI图像生成器是人工智能的前沿应用,能够根据用户给定的某些参数或提示,创建独特、高质量的图像。通过机器学习算法和神经网络,这些生成器分析无数现有图像,以理解它们的结构、颜色、上下文等。然后利用这个庞大的知识库生成符合用户规格的新图像,这些图像具有细节丰富、逼真、与用户规格一致的特点。 AI图像生成器在各行各业中的角色 由于其便利性、高效性和创造力,AI图像生成器在许多行业中都得到了广泛应用。 数字营销 在数字营销领域,AI图像生成器是一种福音。市场营销人员现在可以在不需要专业设计师或摄影师的情况下创建定制视觉效果,从而节省时间和资源。它们为社交媒体、博客文章、广告等提供了快速创建引人注目视觉效果的方法,极大增强了在线参与度。 游戏和娱乐 游戏行业正在利用AI图像生成器的力量设计复杂的游戏环境、角色和道具。这些工具可以快速生成高质量的图形,从而减少开发时间和成本。 电子商务 AI图像生成器也正在彻底改变电子商务行业。它们可以在各种环境中创建产品图像,为客户提供更互动的购物体验。 AI图像生成器如何重新定义创造力 AI图像生成器正在重新定义创造力,并扩大创作者的可能性领域。它们为视觉组合提供了无限选择,鼓励人们进行实验和创新。用户可以提供描述或提示,AI将生成相应的图像,为将抽象概念具体化提供机会。 AI图像生成器的未来前景 AI图像生成器具有巨大的未来增长潜力。这项技术不断优化,以产生越来越逼真的图像。随着AI算法的改进,生成图像的精确度和复杂度也将提高。这些生成器可能很快用于创建高度逼真的不存在的人物、地点或物品的描绘,为虚拟现实、电影制作和室内设计等领域带来令人兴奋的可能性。 2023年最佳AI图像生成器 Shutterstock AI图像生成器 FotorAI图像生成器 Nightcafe Dream By Wombo DALL-E 2 Midjourney Dream…

Leave a Comment

“愚弄法证分类器:生成模型在对抗性人脸生成中的力量”

近年来,深度学习(DL)特别是生成对抗网络(GAN)在生成高度逼真和多样化的人脸方面取得了重大突破。这些人脸在现实中并不存在,但在视频游戏、化妆品行业和计算机辅助设计等领域有着广泛的应用。然而,当这些人工生成的人脸被滥用时,会带来重大的安全和伦理问题。 合成或虚假人脸的滥用可能导致严重的后果。例如,在美国选举中,曾经有人使用GAN生成的人脸图像创建虚假的社交媒体账号,快速传播针对特定群体的虚假信息。类似地,一名17岁的高中生通过一种名为StyleGAN2的强大生成模型成功欺骗Twitter,使其验证了一张美国国会候选人的虚假头像。这些事件凸显了滥用GAN生成的人脸图像可能带来的潜在风险,并突出了解决其安全和伦理问题的重要性。 为了解决GAN生成的虚假人脸问题,已经提出了几种方法来区分虚假的GAN生成人脸和真实的人脸。这些研究的结果表明,简单的有监督深度学习分类器通常在检测GAN生成图像方面非常有效。这些分类器通常被称为法证分类器或模型。 然而,一个聪明的攻击者可以使用对抗机器学习技术来操纵这些虚假图像,以逃避法证分类器的检测,同时保持高的视觉质量。最近的研究通过展示对生成模型的流形进行潜空间优化的对抗性探索,可以生成被针对性法证检测器错误分类的逼真人脸。此外,他们还表明,与在图像空间上施加约束的传统对抗攻击相比,由此产生的对抗性虚假人脸显示出更少的伪影。 然而,这项工作存在一个重大局限性。即它无法控制生成的对抗性人脸的属性,如肤色、表情或年龄。对于那些希望通过社交媒体平台迅速传播虚假宣传,特定针对某些族群或年龄群体的攻击者来说,控制这些人脸属性至关重要。 鉴于潜在的影响,图像取证研究人员必须深入研究和开发属性条件攻击。通过这样做,他们可以揭示现有法证人脸分类器的漏洞,并最终努力设计未来的有效防御机制。本文介绍的研究旨在解决对抗攻击中对属性控制的迫切需求,以确保全面了解漏洞并促进强大的对策的发展。 下面报告了所提出方法的概述。 提出了两种架构,一种与基于属性的生成相关,另一种与文本生成相关。无论是通过图像驱动还是通过文本引导,所提出的方法旨在生成逼真的对抗性虚假人脸,可以欺骗法证人脸检测器。该技术利用StyleGAN2的高度解缠空间,在统一框架内构建属性条件下的无约束攻击。 具体而言,引入了一种高效算法,通过对抗性优化属性特定的潜在变量来生成一个展示给定参考图像中属性的虚假人脸。这个过程有效地将参考图像中的所需粗细节转移到生成的虚假图像中。当进行基于图像的属性条件时,语义属性从提供的参考图像中转移到生成的虚假图像中。这是通过在引导感知损失的指导下在对抗空间中搜索来实现的,从而使所需属性转移到生成的虚假图像中。 此外,Contrastive Language-Image Pre-training(CLIP)的联合图像-文本表示能力被用于根据提供的文本描述生成虚假的人脸。这样可以强制生成的对抗性人脸图像与相应的文本描述保持一致。通过利用CLIP的文本引导特征空间,该方法在该特征空间中搜索对抗性潜在编码,从而生成与文本中描述的属性相符的虚假人脸。 本文展示了一些可用的结果。 这是一种生成逼真对抗性人脸以逃避法证分类器的新颖AI技术摘要。如果您对此工作感兴趣并想了解更多信息,可以通过下面的链接找到更多信息。

Leave a Comment

2023年顶级人工智能随机脸部生成应用程序

随机人脸生成器使用先进的图像处理方法创建随机人脸。大数据技术可以生成看似真实但实际上并不存在于现实世界中的随机人脸。 这些人脸肯定具有真实的面部细节,包括性别、年龄和情绪。这些程序适用于各种系统和文件类型。随机人脸生成器应用程序可在线、在台式计算机和移动设备上使用。人工智能和相关领域的最新进展使得随机人脸生成器应用程序能够在几秒钟内生成随机人脸。随着这项技术的进一步发展,它逐渐在视频游戏和电影等视觉媒体中得到测试。 随机AI人脸经常用于保护用户匿名性并在社交网络账户和其他网站上显示照片。就像在数字平台上工作时需要专门的虚假但真实的照片一样,您需要它们来满足您在营销、项目演示、广告等方面的多样化需求。人们经常使用这些人脸生成器来隐藏自己的身份,因为它们能产生清晰详细的图片。然而,这些照片也可能为图形艺术家的角色设计提供灵感。由于它们是独一无二的,AI生成的角色总是原创的。 以下是最好的随机人脸生成器。 DeepSwap DeepSwap是一个基于Web的工具,可以交换图片或视频中两个人的脸部,使用深度学习技术产生令人信服和逼真的结果。由于该产品具有用户友好的界面和丰富的自定义选择,面部交换将尽可能自然。更新至第5个版本的deepswap.ai是最好的人工智能人脸生成器之一。 DeepSwap的功能包括:使用深度学习技术交换图片或视频中两个人的脸部,以获得令人信服和逼真的结果。工具可以让用户更改交换后脸部的表情和面部特征,使其具有更加逼真的外观。用户可以在录制时查看最终产品,因为该软件可以实时跟踪脸部的动作并应用面部交换效果。该工具可以生成没有可见接缝或畸变的逼真、无缝、高质量的图像和视频。由于与知名社交网络的集成,用户可以轻松与朋友和关注者分享他们的面部交换作品。该工具还可以让用户交换图片或视频中多个人的脸部,产生有趣和引人入胜的“群体面部交换”效果。这个功能对制作幽默电影或模因特别有帮助。

Leave a Comment

“认识xTuring:一款开源工具,只需三行代码即可创建您自己的大型语言模型(LLMs)”

目前,为定制应用实现大型语言模型(LLM)对于大多数个人来说非常困难。创建一个可以以高准确度和速度为专业领域生成内容或模仿写作风格的LLM需要大量时间和专业知识。 Stochastic拥有一支由明智的ML工程师、博士后和哈佛研究生组成的团队,致力于优化和加速LLMs的人工智能。他们推出了xTuring,这是一个开源解决方案,让用户只需三行代码即可创建自己的LLM。 自动化文本传递、聊天机器人、语言翻译和内容生成等应用是人们努力开发和创建具有这些概念的新应用的领域。对这些模型进行训练和微调可能耗时且昂贵。无论使用LLaMA、GPT-J、GPT-2还是其他方法,xTuring都可以轻松快速地进行模型优化。 xTuring作为单GPU或多GPU训练框架的多功能性意味着用户可以根据自己的特定硬件配置定制模型。xTuring使用内存高效的微调技术,如LoRA,加快学习过程,并将硬件支出减少多达90%。通过减少微调所需的内存量,LoRA促进了更快速和有效的模型训练。 xTuring的微调能力使用LLaMA 7B模型作为基准,并将xTuring与其他微调技术进行了比较。数据集包含52K个指令,测试时使用了335GB的CPU内存和4xA100 GPU。 结果表明,使用DeepSpeed + CPU卸载每个时期对LLaMA 7B模型进行21小时的训练时,GPU使用了33.5GB,CPU使用了190GB的内存。而使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载进行微调时,内存使用量分别降至23.7GB和21.9GB。CPU使用的RAM量从14.9GB降低到10.2GB。此外,使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载时,训练时间从40分钟缩短到20分钟每个时期。 开始使用xTuring非常简单。该工具的用户界面设计简单易学易用。用户只需几次鼠标点击即可微调模型,剩下的工作由xTuring完成。由于其易用性,xTuring是初学者和有经验用户的理想选择。 团队表示,由于xTuring允许单GPU和多GPU训练,使用LoRA等内存高效方法,并具有直观的界面,因此它是调整大型语言模型的最佳选择。…

Leave a Comment

苏黎世大学的研究人员开发了SwissBERT:瑞士四种官方语言的多语言语言模型

近期,著名的BERT模型一直是自然语言处理中领先的语言模型之一。该语言模型适用于多个NLP任务,这些任务将输入序列转换为输出序列。BERT(Bidirectional Encoder Representations from Transformers)使用了Transformer注意机制。注意机制学习文本语料库中单词或子词之间的上下文关系。BERT语言模型是自然语言处理进展的最重要例子之一,并使用了自监督学习技术。 在开发BERT模型之前,语言模型在训练时分析文本序列,要么从左到右,要么从左到右和从右到左结合。这种单向方法对于通过预测下一个单词来生成句子,并将其附加到序列中,然后预测下一个到下一个单词,直到获得完整的有意义的句子的工作效果很好。通过BERT,引入了双向训练,与以前的语言模型相比,它能更深入地理解语言上下文和流。 最初的BERT模型发布为英文。随后,开发了其他语言模型,如法文的CamemBERT和意大利文的GilBERTo。最近,苏黎世大学的研究人员开发了一种适用于瑞士的多语言模型。这个模型名为SwissBERT,它在瑞士标准德语、法语、意大利语和罗曼什语Grischun中训练了超过2100万篇瑞士新闻文章,总计120亿个标记。 SwissBERT的引入是为了克服瑞士研究人员在执行多语言任务时面临的挑战。瑞士主要有四种官方语言-德语、法语、意大利语和罗曼什语,对于每种特定语言,单独的语言模型很难进行组合以执行多语言任务。此外,第四种国家语言罗曼什语也没有单独的神经语言模型。由于在自然语言处理领域实现多语言任务有一定难度,瑞士国家语言在SwissBERT之前没有统一的模型。SwissBERT通过简单地结合这些语言的文章,并通过隐式利用新闻中的共同实体和事件来创建多语言表示,克服了这一挑战。 SwissBERT模型是由预先训练在81种语言中的跨语言模块(X-MOD)转换器重新建模而来。研究人员通过训练自定义语言适配器,将预先训练的X-MOD转换器适应到他们的语料库中。他们为SwissBERT创建了一个瑞士特定的子词汇表,得到的模型包含了1.53亿个参数。 研究团队在一些任务上评估了SwissBERT的性能,包括对当代新闻(SwissNER)中的命名实体进行识别和检测用户生成的对瑞士政治的立场。SwissBERT的表现优于常见的基准模型,并在检测立场方面优于XLM-R。在对罗曼什语的能力进行评估时,发现SwissBERT在零-shot跨语言转移和德语-罗曼什语单词和句子的对齐方面明显优于未经该语言训练的模型。然而,在识别历史上经过OCR处理的新闻中的命名实体方面,该模型表现不佳。 研究人员发布了带有用于下游任务微调的SwissBERT示例。这个模型在未来的研究甚至非商业目的上似乎很有前景。通过进一步的适应,下游任务可以从该模型的多语言能力中受益。

Leave a Comment

2023年超参数优化的顶级工具/平台

超参数是用于调节算法在创建模型时的行为的参数。这些因素无法通过常规训练来发现。在训练模型之前,必须对其进行分配。 选择产生最佳性能的超参数组合的过程被称为机器学习中的超参数优化或调整。 根据任务的不同,有几种自动优化方法,每种方法都有其优点和缺点。 随着深度学习模型的复杂性增加,用于优化超参数的工具数量也在增加。对于超参数优化(HPO),通常有两种类别的工具包:依赖云计算资源的开源工具和服务。 下面展示了用于ML模型的顶级超参数优化库和工具。 贝叶斯优化 基于贝叶斯推断和高斯过程,一种名为BayesianOptimisation的Python程序使用贝叶斯全局优化来找到未知函数的最大值,迭代次数最少。这种方法最适用于高成本函数优化,其中在探索和开发之间取得正确平衡至关重要。 GPyOpt GPyOpt是一个基于贝叶斯优化的Python开源包。它使用GPy构建,GPy是一个用于建模高斯过程的Python框架。该库可以创建湿实验、自动设置模型和机器学习方法等。 Hyperopt Hyperopt是一个用于串行和并行优化的Python模块,可以包含条件、离散和实值维度的搜索空间。对于希望进行超参数优化(模型选择)的Python用户,它提供了并行化的技术和基础设施。该库支持的贝叶斯优化技术基于回归树和高斯过程。 Keras Tuner 使用Keras Tuner模块,我们可以找到机器学习模型的理想超参数。该库包含了HyperResNet和HyperXception两个预构建的可自定义的计算机视觉程序。 度量优化引擎(MOE) 度量优化引擎(MOE)是一个用于最佳实验设计的开源黑盒贝叶斯全局优化引擎。当评估参数需要时间或金钱时,MOE是一种有用的系统参数优化方法。它可以帮助解决各种问题,例如通过A/B测试最大化系统的点击率或转化率,调整昂贵批处理作业或机器学习预测方法的参数,设计工程系统或确定实验的理想参数。 Optuna Optuna是一个用于自动超参数优化的软件框架,非常适用于机器学习。它提供了一个用户API,具有命令式、按运行定义搜索空间的设计,可以动态构建超参数的搜索空间。该框架提供了许多库,用于平台无关的架构、简单的并行化和Pythonic的搜索空间。 Ray Tune Ray Tune是一个用于耗时任务(如深度学习和强化学习)的超参数优化框架。该框架具有多种用户友好的功能,包括可配置的试验变体创建、网格搜索、随机搜索和条件参数分布,以及可扩展的搜索算法实现,包括Population Based Training(PBT)、Median…

Leave a Comment

认识VampNet:一种用于音乐合成、压缩、修补和变异的掩码声学令牌建模方法

由于离散声学令牌建模的进展,自动回归语音和音乐的生成方面取得了显著进展。为了有效地进行图片生成,研究人员提出了非自回归并行迭代解码方法。与自回归方法相比,需要在过去和未来的序列组成部分上进行条件处理的填充工作更适合于并行迭代解码。在本研究中,他们利用声学令牌建模和同时迭代解码来进行音乐音频合成。据他们所知,这是首次将并行迭代解码应用于神经音频音乐合成。 他们使用基于令牌的提示来调整他们的模型,称为VampNet,以适应各种应用。通过故意隐藏的音乐令牌序列,他们展示了指导VampNet生成并填充空白的能力。这个过程的结果可以是高质量的音频压缩方法,也可以是与原始输入音乐在风格、流派、节奏和乐器方面非常相似,但在音色和节奏方面有一些细微差别的变体。与自回归音乐模型不同,他们的方法允许提示放置在任何位置,后者只能通过使用一些前缀音频作为提示,并由模型产生可能跟随其后的音乐。 图1:VampNet概述。首先,他们使用音频令牌化器将音频分解为一系列不同的令牌。令牌首先被屏蔽,然后被发送到一个屏蔽生成模型,该模型使用有效的迭代并行解码采样技术,在两个级别上为屏蔽令牌预测值。然后将输出解码为音频。 他们研究了各种提示设计,如周期性、压缩和受音乐启发的设计(如节拍掩蔽)。他们发现,当指示其创建循环和变化时,他们的模型表现出色,因此被命名为VampNet。他们提供了可以下载的代码,并强烈建议人们查看他们的音频样本。Descript Inc.和Northwestern University的研究人员介绍了一种使用屏蔽声学令牌建模生成音乐的方法,输入音频文件可以通过各种方式提示VampNet,因为它是双向的。VampNet是一个很好的工具,可以在音乐压缩和通过各种提示方法进行音乐生成之间连续运行。 音乐家可以使用VampNet录制一个简短的循环,将其输入系统,每次重复循环区域时,VampNet都会提供创意上的音乐变体。他们打算在进一步的工作中研究VampNet及其提示方法在交互式音乐共创方面的潜力,以及屏蔽声学令牌建模的表示学习能力。

Leave a Comment

NotebookLM 谷歌的实验性人工智能笔记本,用于增强学习和洞察力

谷歌最近在今年的Google I/O大会上发布了NotebookLM,原名为Tailwind项目。作为一个以人工智能为先导的实验,NotebookLM是一种独特的笔记本,旨在通过利用语言模型的能力来增强学习。由谷歌实验室开发,这个实验性产品旨在重新想象笔记软件,将强大的语言模型作为其核心。 NotebookLM的动机来自于当今快节奏世界中个人面临的信息过载日益增加的挑战。数据的丰富可能令人不知所措,使人们难以提取有意义的见解。谷歌意识到了这个困境,并与学生、教授和知识工作者进行了交流,以了解他们的困难。其中最普遍的挑战之一是从多个来源综合事实和观点的耗时过程。 为此,谷歌着手创建一种解决方案,使用户能够更高效地在海量信息中建立联系,主要使用对他们最重要的来源。结果就是NotebookLM,一个实验性产品,旨在利用语言模型和用户现有内容,以加速获得关键见解。可以将其视为一个虚拟研究助手,可以总结事实、解释复杂概念,并基于用户选择的来源促进新的联系探索。 NotebookLM通过“源地基”这个概念使自己与传统的人工智能聊天机器人区别开来。通过将语言模型与用户的笔记和来源联系在一起,NotebookLM创建了一个个性化的人工智能,熟悉与每个用户相关的特定信息。该过程始于选择Google文档作为源地基。与Google文档的集成提供了三个主要功能: 1. 获取摘要:将Google文档添加到NotebookLM后,系统会自动生成文档摘要以及关键主题和问题,以帮助用户更好地理解材料。 2. 提问:当用户希望深入了解时,他们可以询问有关上传的文档的问题。例如,医学生可以上传一篇关于神经科学的科学文章,并指示NotebookLM“创建一个与多巴胺相关的关键术语词汇表”。 3. 生成创意:NotebookLM的功能不仅限于问答交互。它擅长帮助用户生成创意。例如,内容创作者可以上传他们对新视频的创意,并要求NotebookLM“为这个主题生成一个短视频的剧本”。 NotebookLM的源地基减少了模型产生不准确回答的风险,但对AI的输出进行事实核查仍然至关重要。谷歌通过在每个回答中包含引文来简化这个过程,展示所使用的来源中最相关的原始引用。 NotebookLM的开发是谷歌实验室内的一个小团队的协作努力。该团队的主要目标是构建一个满足用户需求的产品,并确保负责任的技术部署。为实现这些目标,谷歌将积极寻求用户和社区的反馈,以提高NotebookLM的实用性。此外,该公司遵守与其AI原则一致的严格安全标准,并在扩大用户群体和引入新功能之前实施适当的安全措施。 为了解决隐私问题,谷歌设计了NotebookLM,限制模型对用户选择的上传来源材料的访问。此外,用户的文件和与AI的互动保持私密,并对其他用户不可访问。谷歌不使用收集的数据来训练新的AI模型,强调对用户隐私和数据保护的承诺。 谷歌旨在根据用户反馈不断改进产品,使其越来越有价值和用户友好。通过NotebookLM,谷歌设想革新笔记和信息综合,为用户提供一个强大的工具,帮助他们在广阔的知识领域中导航,并将信息转化为可行的见解。

Leave a Comment

认识PolyLM(Polyglot Large Language Model):一个开源的多语言LLM,训练了640B个Token,有两种模型大小1.7B和13B可供选择

随着大型语言模型(LLM)的最近引入,其多样性和能力引起了人工智能领域的广泛关注。这些模型经过大量数据的训练,具备了在自然语言指令下理解、推理和生成文本的出色人类模仿能力。这些模型在零样本和少样本任务中表现良好,可以根据自然语言指令进行微调,以应对未预见的挑战。 当前的LLM及其开发主要集中在英语和资源丰富的语言上。大多数现有的LLM专门针对英语进行设计和训练,导致这些模型的研究和开发中存在英语的主导偏见。为了解决这个限制,来自DAMO Academy和阿里巴巴集团的研究人员提出了一种多语种LLM,称为POLYLM(多语种大型语言模型)。与现有的缺乏13B模型的多语种LLM不同,该团队发布了POLYLM-13B和POLYLM-1.7B以促进使用。 POLYLM是使用来自公开可访问的源(包括维基百科、mC4和CC-100)的640B标记的大规模数据集构建的。团队还提出了一种课程学习技术,以解决低资源语言的数据不足问题。该方法在训练过程中逐渐增加高质量的低资源语言比例,同时最初更加关注英语。重点是将通用知识从英语转移到其他语言。 该团队还开发了MULTIALPACA,一种多语种指令数据集,用于监督微调(SFT)阶段。现有的多语种SFT数据集要么通过手动注释获得(耗时且昂贵),要么通过机器翻译获得(可能导致翻译错误且缺乏文化细微差别)。这种多语种自我指导方法自动提供高质量的多语种指令数据,以克服这些限制,并利用英语种子、多语种翻译、指令生成和过滤系统。 为了评估和评估LLM的多语种能力,该团队开发了一个基准,该基准源于现有的多语种任务,包括问答、语言理解、文本生成和跨语言机器翻译。该基准通过精心设计的提示覆盖了15种语言的十个任务。通过大量实验,该团队证明了他们的预训练模型在非英语语言中的性能优于开源模型。所提出的课程训练策略在保持英语熟练度的同时提高了多语种性能。使用多语种指令数据还显著增强了POLYLM处理多语种零样本任务的能力。 该团队总结了以下贡献。 开发了一个熟练的13B规模模型,其在西班牙语、俄语、阿拉伯语、日语、韩语、泰语、印尼语和中文等主要非英语语言中表现良好。该模型补充了现有开源模型在这些语言中要么不熟练,要么具有较小版本且能力不同的不足之处。 提出了一种先进的课程学习方法,促进了从英语到多种非英语语言和特定自然语言处理任务(如机器翻译)的通用知识的传递。 提出了一个名为MULTIALPACA的数据集,它补充了现有的指令数据集,使LLM能够更好地遵循多语种指令,特别是来自非英语母语的指令。

Leave a Comment

2023年的顶级计算机视觉工具/平台

计算机视觉使计算机和系统能够从数字照片、视频和其他视觉输入中提取有用的信息,并根据这些信息执行操作或提供建议。计算机视觉使机器具有感知、观察和理解的能力,就像人工智能使它们具有思考的能力一样。 人类视觉比计算机视觉具有优势,因为它存在的时间更长。通过终身的上下文,人的视觉有学习如何区分事物、确定它们与观察者的距离、确定它们是否在移动以及确定图像是否正确的优势。 通过相机、数据和算法代替视网膜、视神经和视觉皮层,计算机视觉教会计算机在更短的时间内执行类似的任务。一个经过训练的系统可以快速超越人类,因为它可以在每分钟检查成千上万个产品或过程,同时发现肉眼无法察觉的缺陷或问题。 能源、公用事业、制造业和汽车行业都使用计算机视觉,市场仍在不断扩大。 计算机视觉系统可以用于以下几种典型的工作: 对象分类。在对图像或视频中的对象进行预定标题分类之前,系统会分析视觉数据。例如,算法可以在图像中的所有项中识别出一只狗。 物品识别。系统分析视觉数据并识别出图片或视频中的特定对象。例如,算法可以从图像中的一组狗中挑选出一只特定的狗。 对象跟踪。系统分析视频,识别满足搜索条件的对象(或对象)并跟踪该对象的进展。 顶级计算机视觉工具 Kili Technology的视频标注工具 Kili Technology的视频标注工具旨在简化和加速从视频文件中创建高质量数据集的过程。该工具支持各种标注工具,包括边界框、多边形和分割,以实现精确的标注。通过先进的跟踪功能,您可以轻松地浏览帧并在直观的浏览视图中查看所有标签。 该工具支持各种视频格式,并与流行的云存储提供商无缝集成,确保与现有的机器学习流水线平稳集成。Kili Technology的视频标注工具是优化标注流程和构建强大数据集的终极工具包。 OpenCV OpenCV 是一个用于机器学习和计算机视觉的软件库。OpenCV 旨在为计算机视觉应用提供标准基础设施,并为用户提供超过2,500种传统和前沿算法。 这些算法可以用于人脸识别、去除红眼、识别对象、提取对象的3D模型、跟踪移动对象以及将多个帧拼接成高分辨率图像等任务。 Viso Suite Viso Suite 是一个完整的计算机视觉开发、部署和监控平台,使企业能够创建实用的计算机视觉应用。作为无代码平台的基础,Viso…

Leave a Comment

这篇来自斯坦福大学和谷歌的AI论文介绍了生成代理:交互式计算代理模拟人类行为

毫无疑问,AI机器人能够生成高质量和流畅的自然语言。长期以来,研究人员和从业者一直在思考构建一个充满具有人类行为的代理人的沙盒文明,以了解不同类型的互动、人际关系、社会理论等。可靠的人类行为替身可能会推动各种交互应用的发展,从虚拟现实到社交技能培训到原型程序。研究人员从斯坦福大学和谷歌研究中提出了一种利用生成模型模仿类人个体和紧急集体行为以响应其身份、变化经验和环境的代理人。 该小组的主要贡献可总结如下: 行为是合理的,因为它在代理人不断演化的经验和环境条件下进行动态调节,被称为生成代理人。 为实现生成代理人在快速变化的条件下具备长期记忆、检索、反思、社交互动和场景规划的能力而提出了革命性的框架。 使用两种类型的测试(控制试验和端到端测试)来确定架构的不同部分的价值,并发现类似故障记忆检索等问题。 讨论了应用生成代理人的交互系统对社会和伦理学带来的优势和潜在危险。 该小组的目标是创建一个虚拟开放世界框架,在这个框架中,智能代理人以自然语言安排日程、交换信息、建立友谊,并根据环境和历史线索协调团体活动。通过将大型语言模型(LLM)与基于LLM输出合成和提取数据的机制相结合,团队创建了一种新颖的代理人架构,使代理人能够从过去的错误中学习,并在保持长期角色连贯性的同时进行更精确的实时推理。 复杂行为可以通过代理人对录音进行递归合成来进行引导。代理人的内存流是一个数据库,包含代理人先前经历的完整记录。为了适应不断变化的环境,代理人可以从其内存流中获取相关数据,处理这些知识,并制定行动计划。 研究人员招募了人类评分员,并让他们建议的25个生成代理人在使用Phaser在线游戏开发框架开发的Smallville沙盒环境中作为非玩家角色(NPCs)运行。实验的标志是代理人对角色的一致表现以及对类人记忆、计划、反应和反思的令人信服的模仿。他们在两个完整的游戏日内用自然语言相互交流。 应用 通过将生成代理人与多模型相结合,有朝一日可以拥有能够在线和离线与人类互动的社交机器人。因此,现在可以原型化社会系统和想法,测试新的交互体验,并构建越来越逼真的人类行为模型。 人本设计过程是另一个可以使用GOMS和Keystroke Level Model等认知模型的领域。 使用生成代理人作为用户替身可以更多了解他们的需求和偏好,从而实现更个性化和高效的技术交互。 通过在角色扮演、社交原型、沉浸式环境和游戏中使用,这项研究有助于推动基于LLM的由动态和交互人类行为的代理人构成的模拟系统的发展。在进一步的研究中,可以进一步发展本文中建议的生成代理人架构的组成部分。例如,可以调整检索功能中包含的相关性、新近性和重要性函数,以提高检索模块在特定上下文中找到最相关材料的能力。还可以采取措施提高架构的性能,节省成本。 未来的研究应该通过更长时间的观察生成代理人的行为,以全面了解它们的能力和限制,因为本研究对其行为的评估仅限于非常短的时间线。

Leave a Comment

“可识别但不可见:一种保护隐私的人物再识别方案(论文摘要)”

人员再识别(Person Re-ID)是一种先进的计算机视觉方法,可以更容易地通过不同地点和时间的监控摄像头来识别人员。尽管个人图像具有改善安全和公共安全的巨大潜力,但其使用存在着重大的隐私问题。由于根据数据隐私法律法规,个人图像被视为私人信息,因此这些问题需要隐私保护的解决方案。 现有的隐私保护人员再识别方法存在一定的局限性。传统的加密方法可以提供较强的隐私保护,但无法对加密数据进行计算。同态加密(HE)直接支持对密文进行计算,但不允许云服务器访问计算结果。此外,现有的浮点特征向量加密机制存在解码和计算错误的问题。 最近,发表了一篇新文章,提出一种名为FREED的新的隐私保护人员再识别解决方案。该系统将隐私保护的人员再识别定义为加密特征向量的相似性度量,使得云服务器可以在不泄露任何个人图像隐私的情况下执行再识别操作。 具体而言,FREED利用新的编码机制和安全批处理计算协议来加密浮点特征向量并有效地执行再识别操作。 FREED引入了三个关键组件来保护特征向量的隐私: 编码机制(ECMO)将浮点特征向量转换为整数,确保准确性并避免解码错误。 安全批处理乘法(BatchSMUL)协议高效计算加密特征向量的相似性度量,减少计算成本。 安全批处理部分解密(BatchPDec)协议安全地对相似性度量进行排序,实现准确的人员再识别,同时不泄露个人隐私。 通过这些组件,可以提供一个强大的隐私保护解决方案,用于人员再识别任务。 提出使用ECMO将浮点特征向量转换为整数,具有两个关键优势。首先,它消除了其他编码方法常见的解码错误。ECMO确保在加密和解密后更准确地检索原始特征向量,保留其准确性,并提高人员再识别的准确性。其次,与传统方法相比,这种转换为整数显著降低了计算错误率和加密成本。ECMO的更高效和精确的过程提高了方案的整体准确性和实用性,适用于实际应用。 通过对计算和通信开销方面的效率进行评估,测试表明ECMO相对于其他编码技术具有较低的错误率。同时还确定了控制参数设置。FREED提供了一种安全可行的人员再识别方法,相比先前的协议在计算和通信方面性能更好。 总之,本文介绍了FREED,一种新颖有效的隐私保护人员再识别解决方案。通过利用编码机制(ECMO)将浮点特征向量转换为整数,FREED解决了传统编码方法的局限性,提高了准确性并减少了计算和计算错误。安全批处理乘法(BatchSMUL)和安全批处理部分解密(BatchPDec)协议提高了系统的效率。通过广泛的实验评估,FREED在计算和通信方面展示了其有效性和效率,相比于MGN等方法,FREED为解决人员再识别中的隐私挑战提供了一种有希望的方法,同时保持了高准确性和实用性,适用于实际应用。

Leave a Comment

顶级人工智能内容生成器(2023)

由于人工智能(AI)的出现,文字内容创作发生了根本性的变化。越来越多的人使用AI内容生成器,因为它们可以快速有效地产生高质量内容。以下是目前最好的几款人工智能内容生成器: Jasper Jasper 是一个生成型AI平台,可帮助生成特定品牌的内容。它包含50多个模板,涵盖各种内容类别,从社交网络账号到产品描述不等。用户只需通过三个简单的步骤来创建内容:选择一个模板,填写必要的数据,如标题、语气和描述,修改输出参数,然后点击生成。 Rytr Rytr 是一款热门的AI写作助手。用户只需选择使用场景并提供上下文信息,Rytr 就会神奇地为他们写作。它可以在几秒钟内自动生成吸引人、独特、高效的作品,适用于各种语气和语言的博客、电子邮件和广告文案。 Copysmith Copysmith 是一款适用于创建简短材料(如标语、产品描述和广告文案)的AI内容生成器。Copysmith 根据使用情况生成材料。用户可以自动编辑、改进或延长短语,甚至可以生成批量内容。 Frase 借助 Frase AI,用户可以快速进行深入的关键词研究,创建高质量的SEO内容并进行优化。为了帮助文章排名更高,其内置的优化功能会根据SEO提供关键词建议。AI 写作工具使用户可以撰写几个短语,然后将其扩展为段落,或者可以使用它自动生成基于模板的完整文本。 Copy.ai Copy.ai 是一款基于AI的内容生成器,可以用多种语言为电子邮件、广告、社交媒体帖子等生成内容。用户可以选择符合要求的模板,比如Instagram标题、列表式文章或冷邮件,它将生成内容。虽然专业版每月售价36美元,包括所有功能和无限字数,但在某些功能受限的情况下可以免费使用。 Articoolo Articoolo 是一款基于人工智能的内容生成器,可以在几分钟内生成任何主题的文章。如果问题可以用两到五个词充分表达,它的系统可以根据用户选择的主题生成一篇长达500字的文章。 Article Forge…

Leave a Comment

2023年机器学习模型的顶级合成数据工具/初创公司

有意创建的信息,而不是实际事件的结果,被称为合成数据。合成数据是通过算法生成的,并用于训练机器学习模型、验证数学模型,并作为测试生产或操作数据测试数据集的替代。 使用合成数据的优点包括在使用私有或受控数据时减轻限制,根据无法满足准确数据的特定情况调整数据要求,并为DevOps团队生成用于软件测试和质量保证的数据集。 尝试复制原始数据集复杂性时的限制可能会导致差异。完全替代准确数据是不可能的,因为仍然需要准确的数据来生成实际的合成信息示例。 合成数据有多重要? 开发人员需要大量细致注释的数据集来训练神经网络。当神经网络具有更多多样化的训练数据时,通常更准确。 问题在于编制和确定可能包含几千到数千万个项目的数据集需要大量的工作,并且经常是不可承受的。 现在出现了虚假数据。AI.Reverie的联合创始人保罗·瓦尔博斯基认为,从标注服务中获取的一张图片可能需要6美元,但可以以6美分的价格合成生成。 节省金钱只是个开始。瓦尔博斯基继续表示,通过确保您拥有数据的多样性以准确反映现实世界,合成数据对于处理隐私问题和减少偏见至关重要。 合成数据集有时优于现实世界的数据,因为它们可以自动进行标记,并且可以有意地包含罕见但关键的边角情况。 合成数据初创公司和企业名单 Datagen 成立于2018年的以色列公司Datagen获得了2200万美元的资金,其中包括去年2月的1850万美元A轮融资,这是该公司的正式亮相。由于它主要专注于逼真的视觉模拟和自然世界的重建,尤其擅长人体运动,Datagen将其特殊风格的合成数据称为“模拟数据”。Datagen使用生成对抗网络(GANs),这是一种越来越常见的人工智能方法,与许多处理合成数据的其他企业一样。它类似于计算机棋局中的两个系统之间的游戏,但一个系统生成虚假数据,而另一个系统评估结果的真实性。该公司将GANs与称为强化学习人形动作技术和超级渲染算法的东西相结合,在物理模拟器中进行研究开发。 Datagen的目标行业包括零售、机器人技术、增强和虚拟现实、物联网和自动驾驶汽车。以一个Amazon Go店铺为例,它的计算机视觉系统监视购物者,以确保没有人带走任何物品。 Parallel Domain 模拟自动驾驶车辆的环境可能是当今最常见的应用案例之一。这是Parallel Domain的主要业务领域,这是一家成立于2017年的硅谷初创公司,我们之前已经对其进行了介绍。自那时以来,该公司已经筹集了大约1390万美元的资金,其中包括去年年底的1100万美元A轮融资。丰田可能是其最重要的支持者和客户。该公司致力于教育自动驾驶汽车如何避免伤害人员,为其合成数据平台专注于一些最具挑战性的用例。最近,该公司与丰田研究院合作开发了一种使用合成数据教授自主系统对象永恒性的方法。尽管由于Parallel Domain的影响,现在AI可以在物体暂时消失时仍然追踪物体,但当前的感知系统仍然像孩子玩捉迷藏一样。此外,该公司还向公众提供了用于完全注释的合成相机和LiDAR数据集的数据可视化工具。该公司为自动无人机交付和自动驾驶提供人工训练数据。 Mindtech 成立于2017年的英国公司Mindtech筹集了约650万美元的资金。就在上个月,该公司完成了325万美元的种子轮融资。其中一位著名的投资者是In-Q-Tel,这是一家美国政府组织,为具有帮助像CIA这样的组织的潜力的创新提供资金。因此,这就是它。Mindtech开发的模块化工具Chameleon允许用户使用逼真的3D模型即时创建无限数量的场景和情境。根据该公司的说法,Chameleon专门设计为帮助其客户开发“理解和预测人类互动”的AI系统。除了向间谍机构提供服务外,Mindtech还向零售、智能家居、医疗保健、交通运输和机器人技术行业提供产品和服务。 合成人工智能 2019年初创公司合成人工智能在四月份与iRobot(IRBT)进行了450万美元的种子轮融资,可能是为了推进其智能家居机器人吸尘器的发展。与Datagen一样,合成人工智能使用生成对抗网络(GAN)与计算机生成图像(CGI)技术,这种技术几乎应用于每一部现代电影中,用于构建合成人类。该公司的首款产品FaceAPI允许公司为智能助手、远程会议、驾驶员监控和智能手机面部验证创建更强大的人工智能面部模型。为了增强人工智能模型在代表各种面部类型方面的能力,合成人工智能在六月份发布了4万个原始高分辨率的3D面部模型。 Oneview OneView是一家以色列初创公司,成立于2019年,融资350万美元。该公司的主要目标是为从卫星和航空照片中生成地理情报的人工智能算法提供人工数据。这些视图经常涵盖地球上的大片区域,包括城市、机场、港口和其他建筑物。OneView使用开源数据映射服务OpenStreetMap的实际数据来创建合成数据集的基础模型。该公司只需将2D图像转换为多次渲染的3D图像,以模拟各种情况,包括对象、天气、光照等等。您可以在此处了解更多关于该过程的信息。…

Leave a Comment

顶级人工智能AI驱动的Chrome扩展程序

机器为您撰写的想法已经从科幻小说变成了现实,这要归功于人工智能技术的进步。今天,有几个互联网工具和应用程序可以立即生成从电子邮件到整个博客文章的一切。 许多甚至作为您Google Chrome浏览器的扩展功能,让您在浏览和书写时随时随地访问它们。 Chrome浏览器已经有超过180,000个扩展可用,并且许多扩展正在积极开发,随着每一轮更新的循环。Chrome商店上最好的扩展都是使用人工智能的扩展。 来看看这些AI驱动的Chrome扩展的精选,它们可能在各种任务中对您有很大帮助! Criminal IP:基于AI的钓鱼链接检查器 这是一个免费扩展,它使用AI进行实时扫描和分类,分为五个类别:安全、低风险、中等风险、危险和严重,从而防止钓鱼、勒索软件、恶意软件和欺诈。它包括一个“诈骗屏蔽”功能,可立即阻止恶意链接,并提供“预检查此链接”选项以验证链接的安全性。此外,它还提供了一个高级模式,用于检测隐藏的钓鱼企图和评估安全漏洞。 Grammarly Grammarly利用自然语言处理技术,为您访问的每个平台或浏览器页面提供支持。您可以检查抄袭,修复内容的语气,并确保您的工作在语法上是正确的。 HyperWrite HyperWrite是一个个人写作助手,为写作思路创造材料,极大地简化了作家的工作。该插件根据文本的内容,在您的句子中建议合适的词汇和短语。HyperWrite还在其网站上创建了一个文本到图像的部分,除了写作辅助功能。 Otter.ai otter.ai是转录会议、聊天和视频对话的最佳扩展。它使用机器学习系统和人工智能,可以即时转录任何视频、电话会议或会议。该机器进一步编辑此转录,创建无瑕疵的句子,并为每个发言者分割材料。 AnyPicker AnyPicker是从网页上抓取数据的理想工具,因为它是专为从网站上提取数据而设计的。利用AI模式识别引擎,该插件分析页面内容并将其转化为可读的形式。这项技术对于监视竞争对手企业的网站,保持对其策略、SEO甚至数据挖掘的了解至关重要。 ContentBot ContentBot是另一个类似于Grammarly的AI写作辅助插件。该扩展是一个内容作者和SEO专家,可以为您扩大博客的读者群体提供优质材料。该程序可以生成博客文章、广告文案和社交媒体更新。 Seamless.ai 为了编制、组织和管理业务潜在客户的联系人,需要付出很多工作。Seamless.ai是一个免费应用程序,用于建立列表、营销和创建组织的数据库,非常适合从任何社交网络资料中提取电子邮件和其他联系信息。 Atomic AI Atomic AI是一个程序,可以为您的论文、社交媒体帖子和邮件提供改动和评论的绝佳建议,以将您的书面材料转变为独特的内容。用户只需开始输入简短的短语,扩展将建议构建它们的最佳方法。 Jasper…

Leave a Comment

来自苏黎世联邦理工学院和微软的研究人员提出了X-Avatar:一种可以捕捉人体姿势和面部表情的可动态变换的隐式人类化身模型

姿势、眼神、面部表情、手势等,统称为“肢体语言”,一直是许多学术研究的课题。准确记录、解读和创建非言语信号可以极大地增强遥感、增强现实(AR)和虚拟现实(VR)环境中人物形象的逼真程度。 现有的最先进的人物形象模型,如SMPL系列中的模型,可以正确地描绘出逼真姿势中不同的人体形态。然而,它们受到其使用的基于网格的表示和3D网格质量的限制。此外,这类模型通常只模拟裸体,不包含服装和头发,从而降低了结果的逼真度。 他们介绍了X-Avatar,这是一种创新模型,可以在数字化人物形象中捕捉到人类表情的完整范围,以创建逼真的遥感、增强现实和虚拟现实环境。X-Avatar是由瑞士苏黎世联邦理工学院(ETH Zurich)和微软(Microsoft)研究人员开发的一种富有表现力的隐式人类人物模型。它可以捕捉高保真度的人体和手部动作、面部情绪和其他外貌特征。该技术可以从完整的3D扫描或RGB-D数据中学习,生成身体、手部、面部情绪和外貌的综合模型。 研究人员提出了一种部位感知的学习前向蒙皮模块,可以通过SMPL-X参数空间控制,实现X-Avatar的富有表现力的动画。研究人员提出了独特的部位感知采样和初始化算法,以有效地训练神经形状和变形场。研究人员通过一个纹理网络,根据位置、面部表情、几何形状和变形表面的法线来增强几何和变形场,以捕捉具有高频细节的人物外貌。这样可以提高细小身体部位的保真度,同时在关节骨骼数量增加的情况下保持训练的有效性。研究人员凭经验证明,该方法在动画任务上相对于强基线模型在数据领域和质量方面取得了更优秀的定量和定性结果。 研究人员提出了一个名为X-Humans的新数据集,其中包含来自20个受试者的233个高质量纹理扫描序列,共计35,500个数据帧,以促进对表达人物形象的研究。X-Avatar提供了一种以关节神经隐式表面为特征的人体模型,适应着穿着衣物的个体的多样拓扑结构,并实现了更好的几何分辨率和整体外貌的保真度。研究的作者定义了三个不同的神经场:一个用于使用隐式占据网络建模几何形状,另一个用于使用学习的前向线性混合蒙皮(LBS)建模变形,具有连续的蒙皮权重,第三个用于使用RGB颜色值建模外貌。 X-Avatar模型可以接受3D姿势扫描或RGB-D图像进行处理。其设计的一部分包括一个用于在规范空间中建模几何形状的塑形网络,以及一个使用学习的线性混合蒙皮(LBS)建立规范和变形区域之间对应关系的变形网络。 研究人员从SMPL-X的参数空间开始,这是一种捕捉全身人物形状、外貌和变形的SMPL扩展,特别关注手部位置和面部情绪,以生成富有表现力和可控的人类人物形象。以关节神经隐式表面来描述人体模型,代表着穿着衣物的个体的各种拓扑结构。同时,一种独特的部位感知初始化方法通过提高对细小身体部位的采样率,极大地增强了结果的逼真度。 结果表明,X-Avatar可以准确记录人体和手部姿势,以及面部情绪和外貌,从而可以创造出更具表现力和逼真的人物形象。这个倡议的团队衷心希望他们的方法可以激发更多的研究,赋予人工智能更多的个性。 使用的数据集 高质量纹理扫描和SMPL[-X]注册;20个受试者;233个序列;35,427个帧;身体姿势+手势+面部表情;各种服装和发型选择;各个年龄段 特点 有几种方法可以教授X-Avatars。 训练中使用的3D扫描图像,右上方。底部:测试姿势驱动的人物形象。 教学目的使用的RGB-D信息,顶部。测试姿势的人物形象表现较差。 该方法在动画测试中恢复了更好的手部灵活性和面部表情,超过了其他基线模型。这导致使用PyMAF-X从单眼RGB影片中恢复的运动进行动画化的X-Avatars。 限制 X-Avatar在模拟露肩上衣或裤子(例如,裙子)时存在困难。然而,研究人员通常只对每个主题训练一个模型,因此他们在单个个体之外的泛化能力仍然需要扩展。 贡献 X-Avatar是第一个全面捕捉身体姿势、手势、面部情绪和外观的富有表现力的隐式人类化身模型。 考虑底层结构的初始化和采样过程提高了输出质量并保持了训练效率。 X-Humans是一个全新的数据集,包含20个人的233个序列,总共有35,500帧高质量纹理扫描,显示了各种身体、手势和面部情绪。 X-Avatar在捕捉身体姿势,手势,面部情绪和整体外观方面无与伦比。研究人员使用最近发布的X-Humans数据集展示了该方法的效果。

Leave a Comment

谷歌DeepMind推出了NaViT:一种新的ViT模型,在训练过程中使用序列打包来处理任意分辨率和宽高比的输入

视觉变压器(ViT)因其简单性、灵活性和可扩展性而快速取代基于卷积的神经网络。图片被分割成补丁,并且每个补丁被线性投影到一个令牌上,构成了这个模型的基础。输入照片通常被划分为一组固定数量的补丁,然后再使用。 最近的研究发表了对这个模型的潜在改进:FlexiViT允许连续的序列长度范围,因此通过在单个设计中适应不同的补丁尺寸来计算成本。这是通过在每次训练迭代中随机选择补丁尺寸,并使用缩放技术来适应初始卷积嵌入中的多个补丁尺寸来实现的。Pix2Struct的替代补丁方法,保持了纵横比,对于图表和文档理解等任务非常有价值。 NaViT是谷歌研究人员开发的一种替代方法。Patch n’ Pack是一种技术,它允许在保持纵横比的同时改变分辨率,通过将来自不同图像的许多补丁打包到一个序列中。这个想法基于“示例打包”,这是一种在自然语言处理中使用的技术,通过将多个实例合并成一个序列来高效训练具有不同长度输入的模型。科学家们发现,随机采样分辨率可以显著减少训练时间。NaViT在广泛的解决方案范围内实现了出色的性能,便于在推理时平滑地权衡成本和性能,并且可以以较低的成本轻松适应新的任务。 从示例打包所实现的固定批次形状中出现了像保持纵横比的解析率采样、可变的令牌丢弃率和自适应计算等研究思路。 NaViT在预训练期间的计算效率尤为令人印象深刻,并在微调过程中持续存在。成功地将单个NaViT应用于不同的分辨率,可以在性能和推理成本之间实现平滑的权衡。 在训练和操作过程中将数据输入深度神经网络是常见的实践。因此,计算机视觉应用必须使用预定的批次大小和几何形状,以确保在现有硬件上获得最佳性能。由于这个原因和卷积神经网络固有的架构限制,将图像调整大小或填充到预定大小已经成为常见的做法。 虽然NaViT基于原始的ViT,但理论上可以使用任何可以处理补丁序列的ViT变种。研究人员对ViT进行了以下结构性改变以支持Patch n’ Pack。Patch n’ Pack是一种将序列打包应用于视觉变换器的简单方法,它显著提高了训练效率,这已经被研究界证明过。由此产生的NaViT模型具有灵活性,易于适应新的任务,而不会造成巨大的成本开销。自适应计算和提高训练和推理效率的新算法的研究只是Patch n’ Pack所带来的可能性的两个例子,而这些以前因需要固定的批次形式而受到限制。他们还认为NaViT对ViT来说是朝着正确方向迈出的一步,因为它代表了大多数计算机视觉模型的传统CNN设计输入和建模流程的改变。

Leave a Comment

DeepMind的一项新的人工智能研究提出了两种针对有向图的方向和结构感知的位置编码

Transformer模型最近越来越受欢迎。这些神经网络模型遵循顺序输入中的关系,比如句子中的单词,以学习上下文和含义。随着OpenAI提出的GPT 3.5和GPT 4等模型的引入,人工智能领域,特别是深度学习领域取得了巨大的进步,成为了热门话题。竞技编程、对话式问题回答、组合优化问题和图学习任务都将Transformer作为关键组件。 Transformer模型在竞技编程中用于根据文本描述生成解决方案。ChatGPT是一个著名的基于GPT的聊天机器人模型,也是一个备受喜爱的对话式问答模型,是Transformer模型的最佳例子。Transformer模型还被用于解决组合优化问题,如旅行推销员问题,并且在图学习任务中取得了成功,特别是在预测分子特性方面。 Transformer模型在图像、音频、视频和无向图等多种形式的模态中表现出了极高的灵活性,但是对于有向图的Transformer仍然缺乏关注。为了填补这一空白,一组研究人员提出了两种专门针对有向图设计的方向和结构感知的位置编码。磁性拉普拉斯是组合拉普拉斯的方向感知扩展,为第一个提出的位置编码提供了基础。所提供的特征向量捕捉了关键的结构信息,同时考虑了图中边的方向性。通过在位置编码方法中包含这些特征向量,Transformer模型更加关注图的方向性,从而成功地表示了有向图中的语义和依赖关系。 方向随机游走编码是第二种提出的位置编码技术。随机游走是一种探索和分析图的流行方法,模型通过在图中进行随机游走,并将游走信息融入到位置编码中,更多地了解有向图的方向结构。由于它有助于模型理解图内链接和信息流动,这种知识在多种下游任务中被使用。 研究团队表示,经验分析表明,方向和结构感知的位置编码在许多下游任务中表现良好。其中之一是排序网络的正确性测试,即确定一组操作是否真正构成排序网络。所提出的模型在排序网络的图表示中利用图的方向性信息,相对于Open Graph Benchmark Code2的先前最先进方法提高了14.7%。 研究团队总结了以下贡献: 建立了常用于Transformer的正弦位置编码与拉普拉斯特征向量之间的明确联系。 研究团队提出了扩展到有向图的谱位置编码,为位置编码中加入方向性信息提供了一种方式。 将随机游走位置编码扩展到有向图,使得模型能够捕捉到图的方向结构。 研究团队评估了结构感知位置编码在各种图距离预测中的预测能力,展示了其有效性。他们引入了预测排序网络正确性的任务,展示了方向性在该应用中的重要性。 研究团队量化了将程序语句序列表示为有向图的好处,并提出了一种新的源代码图构建方法,提高了预测性能和鲁棒性。 在OGB Code2数据集上取得了新的最先进性能,特别是在函数名预测方面,F1分数提高了2.85%,相对改进率为14.7%。

Leave a Comment

“见面语义-SAM:基于用户输入,在任何所需的粒度上对图像进行分割并识别对象的通用图像分割模型”

人工智能近年来取得了巨大的进步。其中,大型语言模型的引入引起了广泛关注,因为它具有令人难以置信的模仿人类能力。这些模型不仅在语言处理方面取得了成功,还在计算机视觉领域取得了成就。尽管AI系统在自然语言处理和可控图像生成方面取得了显著成就,但包括通用图像分割在内的像素级图像理解领域仍存在一定的局限性。 图像分割是将图像分割为不同部分的技术,取得了很大的改进,但要创建一个能处理不同粒度的各种图像的通用图像分割模型仍在讨论中。在该领域取得进展的两个主要挑战是充足的训练数据的可用性和模型设计的灵活性限制。现有方法通常使用单输入、单输出的流水线,无法预测不同粒度的分割掩码并处理不同的细节级别。此外,扩展既具有语义知识又具有粒度知识的分割数据集是昂贵的。 为了解决这些限制,一个研究团队提出了Semantic-SAM,一种基于用户输入的通用图像分割模型,可以在任意所需的粒度上对对象进行分割和识别。该模型能够为对象和部分提供语义标签,并根据用户的点击预测不同粒度的掩码。Semantic-SAM的解码器架构采用了多选择学习策略,使模型具备处理多个粒度的能力。每个点击由多个查询表示,每个查询具有不同的嵌入级别。这些查询通过与不同粒度的真实掩码学习。 该团队分享了Semantic-SAM如何通过使用解耦的部件和对象分类策略来解决语义意识问题。该模型使用共享的文本编码器分别对对象和部件进行编码,从而实现不同的分割过程,并根据输入类型调整损失函数。这种策略确保了模型能够处理来自SAM数据集(该数据集缺少一些分类标签)以及来自通用分割数据的数据。 该团队结合了七个代表不同粒度的数据集,以增强语义和粒度,包括SA-1B数据集、部分分割数据集如PASCAL Part、PACO和PartImagenet,以及通用分割数据集如MSCOCO和Objects365。数据格式已重新调整以符合Semantic-SAM的训练目标。 经过评估和测试,Semantic-SAM表现出比现有模型更优异的性能。当与交互式分割技术(如SA-1B可提示分割和COCO全景分割)结合使用时,性能显著提高。该模型实现了惊人的2.3个框AP增益和1.2个掩码AP增益。在粒度完整性方面,它比SAM表现更好,超过3.4个1-IoU。 Semantic-SAM绝对是图像分割领域的创新进展。该模型通过融合通用表示、语义意识和粒度丰富性,为像素级图像分析创造了新的机会。

Leave a Comment

遇见DISCO:一种新颖的人类舞蹈生成的AI技术

生成式人工智能在计算机视觉领域引起了广泛的关注。最近在文本驱动的图像和视频合成方面取得的进展,例如文本到图像(T2I)和文本到视频(T2V),借助扩散模型的出现,展示了卓越的保真度和生成质量。这些进展展示了相当大的图像和视频合成、编辑和动画潜力。然而,合成的图像/视频与完美仍有很大差距,特别是对于人类中心的应用,如人类舞蹈合成。尽管人类舞蹈合成有着悠久的历史,但现有方法在合成内容与真实舞蹈场景之间存在很大的差距。 从生成对抗网络(GANs)时代开始,研究人员尝试扩展视频到视频的风格转移,将舞蹈动作从源视频转移到目标个体,这通常需要对目标人员进行人员特定的微调。 最近的一系列工作利用预先训练的基于扩散的T2I/T2V模型,根据文本提示生成舞蹈图像/视频。这种粗粒度的条件极大地限制了可控性的程度,使用户几乎不可能精确指定预期的主题,即人类外观,以及舞蹈动作,即人类姿势。 虽然引入了ControlNet部分缓解了这个问题,通过将几何人体关键点的姿势控制与之结合,但由于其依赖于文本提示,ControlNet如何确保参考图像中丰富的语义一致性,如人类外观,仍然不清楚。此外,几乎所有现有方法都是在有限的舞蹈视频数据集上进行训练,要么具有有限的主题属性,要么具有过于简单的场景和背景。这导致对未见过的人物主题、姿势和背景组合的零样本泛化能力较差。 为了支持用户特定的短视频内容生成等实际应用,人类舞蹈生成必须符合真实舞蹈场景。因此,期望生成模型能够根据以下属性合成人类舞蹈图像/视频:保真度、泛化能力和组合性。 生成的图像/视频应通过保留与参考图像一致的人类主题和背景外观,同时准确遵循提供的姿势来展现保真度。该模型还应展示泛化能力,即在不需要人员特定微调的情况下处理未见过的人类主题、背景和姿势。最后,生成的图像/视频应展示组合性,允许从不同的图像/视频中选择任意组合的人类主题、背景和姿势。 在这方面,提出了一种新颖的名为DISCO的方法,用于在真实场景中生成人类舞蹈。该方法的概述如下图所示。 https://arxiv.org/abs/2307.00040 DISCO采用两个关键设计:一种具有分离控制的新颖模型架构,用于提高保真度和组合性,以及一种名为人类属性预训练的预训练策略,用于提高泛化能力。DISCO的新颖模型架构确保生成的舞蹈图像/视频能够忠实地捕捉所需的人类主题、背景和姿势,同时允许这些元素的灵活组合。此外,分离控制增强了模型维持忠实表示和适应多样组合的能力。此外,DISCO采用人类属性预训练策略增强模型的泛化能力。这种预训练技术赋予模型处理未见过的人类属性的能力,使其能够生成超越训练数据限制的高质量舞蹈内容。总体而言,DISCO提供了一个综合的解决方案,将复杂的模型架构与创新的预训练策略结合起来,有效解决了真实场景中人类舞蹈生成的挑战。 以下展示了生成的图像/视频以及与人类舞蹈生成的最先进技术的比较。 https://arxiv.org/abs/2307.00040 这是关于DISCO的摘要,一种生成人类舞蹈的新型人工智能技术。如果您感兴趣并想了解更多关于这项工作的信息,可以通过下面的链接找到更多信息。

Leave a Comment

40+ 你应该查看的酷炫人工智能工具(2023年7月)

DeepSwap DeepSwap是一个基于人工智能的工具,适用于任何想要创建令人信服的深度伪造视频和图像的人。通过重新面向视频、图片、表情包、旧电影、GIF等方式,创建您的内容非常简单。该应用程序没有内容限制,因此用户可以上传任何内容的材料。此外,您还可以首次成为产品的订阅用户,享受50%的折扣。 Docktopus AI Docktopus是一种由AI驱动的演示工具,通过100多个可自定义的模板简化在线内容的创建,让用户能够在几秒钟内创建专业演示文稿。 Promptpal AI Promptpal AI帮助用户发现获取AI模型(如ChatGPT)最大利益的最佳提示。 Quinvio AI Quinvio是一种AI视频制作工具,可以通过直观的编辑器、AI辅助写作和选择AI发言人的选项快速制作视频演示。 Ask your PDF AskYourPdf是一种AI聊天机器人,可帮助用户轻松与PDF文档进行交互并提取洞见。 Supernormal AI Supernormal是一种AI工具,可以自动创建会议记录,每次会议可节省5-10分钟。 Suggesty Suggesty由GPT-3驱动,为Google搜索提供类似人类的答案。 ChatGPT Sidebar ChatGPT Sidebar是一款ChatGPT…

Leave a Comment

“Skoltech和AIRI的研究人员开发了一种新的算法,利用神经网络在不同领域之间进行最优数据传输”

自从大规模的OT和Wasserstein GANs出现以来,机器学习越来越倾向于使用神经网络来解决最优传输(OT)问题。最近,OT计划被证明可作为具有可比实际任务性能的生成模型使用。OT成本通常被计算并用作生成模型中生成器更新的损失函数。 人工智能研究所(AIRI)和斯科尔科技学院合作开发了一种利用神经网络优化跨学科信息共享的新算法。该算法的理论基础使其输出更易于理解,而不像竞争方法那样需要耦合训练数据集,如输入-输出示例,这种新方法可以在输入和输出领域的不同数据集上进行训练。 大规模训练数据集很难获得,但对于面部或语音识别以及医学图像分析等应用构建的现代机器学习模型来说是必要的。这就是为什么科学家和工程师经常通过人工手段模拟真实世界数据集的原因。生成模型的最新进展大大提高了生成文本和图像的质量,因此这项工作变得更加容易。 神经网络被教导从配对的训练样本和输入-输出图像集泛化和扩展到新的输入图像;这对于需要处理许多质量不同的相同照片的工作非常有用。换句话说,生成模型通过合成来自不同数据的数据,促进了从一个领域到另一个领域的过渡。例如,神经网络可以将手绘图转换为数字图像,或者改善卫星照片的清晰度。 将概率分布与确定性和随机传输映射对齐是该技术的独特应用,它是一种通用工具。该方法将增强非配对翻译(图像恢复,域适应性等)以外的现有模型。与基于GAN或扩散模型的常见方法相比,该方法允许更好地控制生成样本的多样性水平,并提高了学习映射的可解释性。研究人员可能需要修改所获得的OT映射以适应非配对活动。研究人员强调了某些任务的运输成本设计作为一个潜在的研究领域。 最优传输和生成学习的交集是所选择方法的核心。娱乐、设计、计算机图形学、渲染等领域广泛使用生成模型和高效的传输。上述领域中的几个问题可能适用于该方法。可能的缺点是,一些图形业务中的职业可能会受到先前工具的使用的影响,这些工具使图像处理技术公开可用。 由于成本过高或获取困难,研究人员通常不得不使用不相关的数据集,而不是理想的匹配数据集。团队回顾了苏联数学家和经济学家列昂尼德·坎托罗维奇的著作,借鉴了他关于有效货物运输(最优传输理论)的思想,以开发一种在领域之间规划最优数据传输的新方法。神经最优传输是一种使用深度神经网络和分开的数据集的新方法。 在非配对领域转换评估中,该算法在图片风格化和其他任务上实现了比现有方法更好的结果。此外,它需要较少的超参数,通常很难调整,具有更可解释的结果,并且基于坚实的数学基础而不是竞争方法。

Leave a Comment

认识ImpressionGPT:基于ChatGPT的放射学报告摘要的迭代优化框架

随着数字文本信息在一般和医疗领域中的数量急剧增加,对有效和准确的文本摘要模型的需求也在增加。文本摘要涉及将一篇冗长的写作压缩成简明的概述,同时保留材料的意义和价值。这已经成为自然语言处理(NLP)研究的重点已经很长时间了。 引入神经网络和深度学习技术,特别是使用编码器-解码器结构的序列到序列模型进行摘要生成,已经传达出积极的结果。与基于规则和统计的方法相比,这些方法生成的摘要更加自然和上下文适用。由于需要保留这些结果的上下文和关联特征以及在治疗环境中精确度的要求,这一努力变得更加困难。 研究人员使用ChatGPT来总结放射学报告,并对其进行了改进。为了充分利用ChatGPT的上下文学习能力,并通过交互不断改进它,研究人员开发并实施了一种新颖的迭代优化方法,使用快速工程学。更准确地说,我们采用相似性搜索算法来构建一个动态提示,其中包含语义上和临床上可比较的现有报告。ChatGPT通过这些并行报告进行训练,以理解类似成像表现的文本描述和摘要。 主要贡献 相似性搜索使得能够使用稀疏数据对语言模型(LLM)进行上下文学习。通过识别语料库中最可比较的案例,开发了一个包含LLM最相关数据的动态提示。 我们为迭代优化技术创建了一个动态提示系统。迭代提示首先评估LLM生成的回复,然后在后续迭代中提供更多指导。 一种利用领域特定信息的新方法来调整LLM。建议的方法可以在需要快速和有效地从现有LLM开发领域特定模型时使用。 方法 变量提示 动态样本使用语义搜索来获取与输入放射学报告相似的报告语料库中的示例;最终查询由相同的预定义查询与测试报告的“发现”部分组成,任务描述描述了角色。 迭代优化 通过迭代优化组件可以完成一些很酷的事情。这种方法的目标是通过使用迭代提示使ChatGPT逐步改进其答案。对于放射学报告摘要等重要应用来说,这也需要一种响应审查过程来检查回复的质量。 通过基于少量训练样本和迭代方法改进输入提示来研究使用大型语言模型(LLMs)进行放射学报告摘要的可行性。通过挖掘语料库中的合适实例,以在上下文中学习LLMs,然后用于提供交互提示。为了进一步提高输出,使用了一种迭代优化技术。该过程包括根据自动评估反馈教授LLM什么是好的和负面的回复。与使用大量医学文本数据进行预训练的其他方法相比,我们的策略已经证明更优越。在现代通用人工智能中,这项工作也为构建更多领域特定语言模型奠定了基础。 在研究ImpressionGPT的迭代框架时,我们意识到评估模型输出回复的质量是一项重要但困难的任务。研究人员假设,用于训练LLMs的领域特定和通用领域文本之间的巨大差异导致了观察到的评分差异。因此,通过使用细粒度的评估指标来检查获得的结果的具体细节。 为了更好地包含来自公共和本地数据源的领域特定数据,我们将在未来继续优化快速设计,同时解决数据隐私和安全问题,尤其是在处理许多组织时。我们还考虑使用知识图谱来使提示设计适应当前的领域知识。最后,我们计划将医学专家(如放射科医生)纳入到优化提示和对系统提供的结果提供客观反馈的迭代过程中。通过结合人类专家在开发LLMs过程中的判断和观点,我们可以得到更精确的结果。

Leave a Comment

牛津研究人员提出Farm3D:一种能够通过提炼2D扩散来学习关节3D动物的AI框架,用于实时应用如视频游戏

生成式人工智能的惊人增长引发了图片生成方面的令人着迷的进展,利用DALL-E、Imagen和Stable Diffusion等技术,可以根据文本提示创建出色的图像。这一成就可能不仅局限于2D数据。最近DreamFusion展示了文本到图像生成器可以用于创建高质量的3D模型,尽管生成器缺乏3D训练,但有足够的数据来重建3D形状。本文阐述了如何通过文本到图像生成器获得更多,并获得多个3D物体类型的关节模型。 也就是说,他们不是试图创建单个3D资产(DreamFusion),而是希望创建整个类别的关节3D物体的统计模型(如牛、羊和马),该模型可以用于从单个图像(无论是真实的还是数字化的)创建可用于增强现实/虚拟现实、游戏和内容创作的动画化的3D资产。他们通过训练一个可以根据物体的单张照片预测关节3D模型的网络来解决这个问题。为了引入这样的重建网络,先前的工作一直依赖于真实数据。然而,他们提出使用使用2D扩散模型(如Stable Diffusion)生成的合成数据。 牛津大学视觉几何组的研究人员提出了Farm3D,它是DreamFusion、RealFusion和Make-a-video-3D等3D生成器的一个补充,这些生成器可以通过测试时间优化从文本或图像开始创建单个的3D静态或动态资产,需要数小时。这提供了几个优点。首先,2D图像生成器倾向于生成准确和完好的物体类别示例,从而隐式地筛选训练数据并简化学习过程。其次,通过2D生成器隐含地提供了每个给定物体实例的虚拟视图,进一步提供了对理解的澄清。第三,它通过消除收集(可能还需要审查)真实数据的要求,增加了方法的适应性。 在测试时,他们的网络以前馈方式从单张图像中进行重建,仅需几秒钟即可生成可操作的关节3D模型(例如,可以进行动画化、重新照明),而不是固定的3D或4D工件。他们的方法适用于合成和分析,因为重建网络仅在虚拟输入上进行训练,但能够推广到实际照片。可以将该方法应用于动物行为的研究和保护。Farm3D基于两个重要的技术创新。首先,他们展示了如何通过快速工程使Stable Diffusion产生大量通常干净的物体类别图片,以学习关节3D模型。其次,他们展示了如何将得分蒸馏采样(SDS)损失扩展到合成多视图监督,以训练照片几何自编码器,即MagicPony。为了创建同一物体的新人工视图,照片几何自编码器将物体分成多个方面,这些方面有助于图像形成(例如物体的关节形状、外观、相机视点和照明)。 这些合成视图被输入到SDS损失中,以获得渐变更新和反向传播到自编码器的可学习参数。他们对Farm3D进行了基于3D生成和修复能力的定性评估。由于Farm3D能够进行重建和创建,因此可以在语义关键点传输等分析任务上进行定量评估。尽管该模型不使用任何真实图像进行训练,从而节省了耗时的数据收集和筛选过程,但他们展示了与各种基准相当甚至更好的性能。

Leave a Comment

通过优化减少人工智能训练中的碳足迹

密歇根大学的研究人员开发了一个名为Zeus的开源优化框架,用于解决深度学习模型的能源消耗问题。随着使用更大模型和更多参数的趋势增长,训练这些模型所需的能量需求也在增加。Zeus通过在训练过程中识别能源消耗和训练速度之间的最佳平衡来解决此问题,而无需进行任何硬件更改或新基础设施。 Zeus通过使用两个软件开关实现这一目标:GPU功率限制和深度学习模型的批大小参数。GPU功率限制控制GPU消耗的电量,批大小参数控制在更新模型对数据关系的表示之前处理多少个样本。通过实时调整这些参数,Zeus旨在最小化能源消耗,同时尽可能少地对训练时间产生影响。 Zeus设计用于与各种机器学习任务和GPU配合使用,并且可以在不更改硬件或基础设施的情况下使用。此外,研究团队还开发了名为Chase的补充软件,该软件可以通过在低碳能源可用时优先考虑速度,在高峰时段优先考虑效率来降低DNN训练的碳足迹。 研究团队的目标是开发出符合实际情况、能够减少DNN训练的碳足迹并不与大型数据集大小或数据规定等约束冲突的解决方案。虽然由于需要使用最新数据而不总是可以将训练工作推迟到更绿色的时间范围内,但Zeus和Chase仍然可以在不牺牲准确性的情况下提供显著的能源节约。 通过减少深度学习模型的能源需求,Zeus和Chase的开发是解决深度学习模型能源消耗问题的关键一步。研究人员可以在不影响训练时间的情况下展示出显著的能源节约,从而减轻人工智能对环境的影响并促进可持续实践。 总之,Zeus是一个开源优化框架,旨在通过识别能源消耗和训练速度之间的最佳平衡来减少深度学习模型的能源消耗。通过调整GPU功率限制和批大小参数,Zeus最小化能源使用,同时不影响准确性。Zeus可以与各种机器学习任务和GPU配合使用,而补充软件Chase可以降低DNN训练的碳足迹。Zeus和Chase的开发促进了人工智能领域的可持续实践,并减轻了其对环境的影响。

Leave a Comment

最佳AI图像增强和放大工具(2023年)

以下是一些顶级的人工智能图片放大和增强工具: HitPaw 图片增强器 (编辑推荐) 您可以使用 HitPaw 来编辑视频/图片,转换/下载 YouTube 视频,录制屏幕/摄像头,去除水印,压缩和提升图像质量。它是最佳的人工智能图像增强器之一,可以减少模糊并扩大照片而不损失质量。这款专业级的照片编辑程序能够完美地解决模糊的图片问题,并且其人工智能模型可以用于改善任何情况下的图片质量。该网站还提供技术来修复过时的照片。例如,AI 人脸增强器可以创建一个人脸模型,使您的脸无瑕疵,并将黑白照片着色以立即恢复过时的照片。 通过先进的AI降噪技术,降噪模型可以自动消除高ISO和光线不足的照片中的噪点,并提高卡通图片的清晰度。最简单的方法是将通用模型应用于增强实际场景的图片,例如建筑和风景。 立即查看 Icons8 Icons8 是一款由人工智能(AI)驱动的图片放大器。在线图片放大器 Icons8 是免费使用的。多亏了该工具的机器学习功能,您可以将图片放大两倍或四倍而不损失质量。 Icons8 是一款非常好的工具,可以自动修复图片缺陷并提高图像质量。Icons8 提供了完全自动化的过程,可以集成锐化、降噪和放大。只需将图片拖放到网站上,它就会自动放大,等待几秒钟,然后下载生成的图片。 AI Deep Image (编辑推荐) Deep…

Leave a Comment

这篇人工智能论文介绍了一种新颖的无需模拟的目标函数,用于学习通用源分布和目标分布之间的连续时间随机生成模型

一种能够描述高维空间中复杂分布的强大生成模型是基于得分的生成模型(SBGMs),其中包括扩散模型。通常使用随机微分方程(SDE)模拟基于几乎总是高斯的源密度来产生样本。尽管基于模拟的去噪目标优化需要高斯源的假设,但SBGMs受其对高斯源的假设的限制,尽管其经验成功。由于物理或生物系统的时间发展中经常违背这一假设,如单细胞基因表达数据的情况,因此无法使用SBGMs来理解潜在动力学。 连续正则化流(CNFs),也称为流式生成模型,已成为解决这些问题的选择方法。通过普通微分方程(ODE)将源密度转换为目标密度,该ODE在流式模型中假设了确定性连续时间生成过程。以往的研究引入了无需模拟的训练目标,使得在假设高斯源的情况下,CNFs可以与SBGMs竞争,并且这些目标已扩展到任意源分布的情况。流式模型以前受到基于模拟的训练目标的限制,这些目标在训练时要求对ODE进行昂贵的积分。 然而,这些目标仍然需要涵盖学习随机动力学,这对于生成建模和恢复真实系统的动力学可能是有用的。薛定谔桥问题(SB)考虑了在某个参考过程下,源概率分布与目标概率分布之间的最可能演化。它是两个任意分布之间的随机映射的基本概率形式。建模自然随机动力学系统、平均场博弈和生成建模等问题都是使用SB问题的几个应用。SB问题通常缺乏封闭形式的解,除了几种特殊情况(如高斯)。但是,可以使用需要复制已学习的随机过程的迭代技术来近似它。 尽管在理论上有效,但这些方法存在数值和实际问题,仅允许高维缩放。魁北克Mila AI研究所、蒙特利尔大学、麦吉尔大学、多伦多大学和Vector研究机构的研究人员研究了薛定谔桥问题的无模拟得分和流匹配(2M)目标。 2M通过SB问题与熵最优传输(OT)之间的关系,将CNFs的无模拟目标和扩散模型的去噪训练目标同时推广到随机动力学和任意源分布上。 2M可以从源分布和目标分布之间的静态熵最优传输映射中受益,这些映射通过Sinkhorn方法或随机算法有效地近似,而不是需要在每次迭代中模拟SDE的动态SB方法。他们使用模拟和真实数据集展示了2M的实用性。在人工数据上,他们证明了2M在生成建模度量方面优于先前的类似工作,并发现了对真实薛定谔桥的更准确近似。他们通过将一系列薛定谔桥作为交叉测量序列(即不配对的时间序列观测)的建模来应用到实际数据中。 尽管先前已经有几种在静态或低维动态设置中使用薛定谔桥对细胞进行建模的方法,但2M是首个可以扩展到数千个基因维度的方法,因为它的训练不需要模拟。他们还提供了一个静态流形测地线映射,展示了薛定谔桥近似在非欧几里德成本下的最早的实际应用之一,从而增强了动态环境中的细胞插值。最后,他们证明,与静态最优传输示例相比,他们可以直接建模和重构控制细胞动力学的基因-基因相互作用网络。代码和示例可在GitHub上获取。

Leave a Comment

2023年最佳开源情报(OSINT)工具

“OSINT” 是指开源情报软件,用于从公开来源收集数据的程序。OSINT工具主要用于对目标进行情报收集,无论是个人还是公司。 以下是一些最常见的OSINT工具(无特定顺序): Maltego Maltego是一个灵活的开源情报平台,可以缩短和加速查询。它提供对58个数据源的访问,允许您手动添加数据,并具有最多100万个实体的数据库。其强大的可视化功能还允许您选择各种格式,如块状、分层或圆形图,并添加权重和注释,以进行更细致的分析。 Maltego的能力可以为信任和安全团队、执法部门和网络安全专家提供令人信服的调查结果和易于理解的洞察力。 Intel 471 Intel 471是一个免费的开源OSINT侦察工具,可以收集和分析各种信息,如IP地址、CIDR范围、域名和子域名、AS号码、电子邮件地址、电话号码、姓名和用户名,甚至比特币地址。 Intel 471拥有超过200个模块,可以执行最广泛的操作,并揭示有关任何目标的重要事实。它提供命令行界面和内置的Web服务器,配备用户友好的GUI界面,两者都可以在GitHub上找到。 您可以使用它来查看您的公司是否存在由于数据暴露而导致的安全漏洞。总体而言,它是一个强大的网络情报工具,可以揭示有关潜在危险的互联网组织的以前未知的信息。 OSINT Framework 开源情报(OSINT)框架是一个很好的工具。它比独立调查每个应用程序和工具更方便,因为它包含了从数据源到有用连接到成功工具的一切。 这个列表不仅限于Linux,还提供了其他操作系统的替代方案,使其成为一个通用资源。事实上,拥有如此组织良好的资源比以往任何时候都更有益处;唯一的困难在于制定一种有效的搜索技术,缩小结果范围,如车辆注册或电子邮件地址。开源情报(OSINT)框架正成为收集情报和组织数据的首选工具。 SEON 在当今数字经济中,使用一个人的社交媒体和其他在线账户来证明他们的身份变得越来越普遍。SEON已经在验证数字身份方面处于领先地位。 您的公司可以通过其电子邮件和电话号码系统访问超过50个社交信号,这些信号组合形成全面的风险评估。这些信号不仅可以验证客户的电子邮件地址或电话号码,还可以获取有关客户在线行为的其他信息。 除了易于使用和访问之外,SEON还允许组织直接通过API或甚至通过Google Chrome插件进行查询。 Lampyre Lampyre是一款以OSINT为重点的高级软件,可以有效地进行尽职调查、网络威胁情报、刑事调查和金融分析。您可以通过单击一次安装在计算机上,也可以在浏览器中使用。 Lampyre可以自动分析100多个经常更新的数据源,从一个单一的数据点(如公司注册号、完整名称或电话号码)开始。…

Leave a Comment

机器学习(ML)实验追踪和管理的顶级工具(2023)

在机器学习项目中,获得单个模型训练运行的良好结果是一回事,但保持机器学习试验的良好组织并从中得出可靠结论是另一回事。 实验跟踪为这些问题提供了解决方案。机器学习中的实验跟踪是保留每个实验的所有相关数据的实践。 实验跟踪由机器学习团队以多种方式实施,包括使用电子表格、GitHub或内部平台。然而,使用专门用于管理和跟踪机器学习实验的工具是最高效的选择。 以下是机器学习实验跟踪和管理的顶级工具 Weight & Biases Weight & Biases是一个用于模型管理、数据集版本控制和实验监控的机器学习框架。实验跟踪组件的主要目标是帮助数据科学家记录模型训练过程的每个步骤,可视化模型并比较试验。 Weight & Biases可以在本地和云端使用。Weights & Biases在集成方面支持多种不同的框架和库,包括Keras、PyTorch环境、TensorFlow、Fastai、Scikit-learn等。 Comet 数据科学家可以使用Comet ML平台跟踪、比较、解释和优化实验和模型,从训练到生产的整个模型生命周期。对于实验跟踪,数据科学家可以记录数据集、代码更改、实验历史和模型。 Comet提供给团队、个人、学术机构和企业使用,适用于希望进行实验、促进工作并快速可视化结果的所有人。它可以在本地安装或用作托管平台。 Sacred + Omniboard 机器学习研究人员可以使用开源程序Sacred配置、安排、记录和复制实验。尽管Sacred缺乏出色的用户界面,但您可以将其与一些仪表盘工具(如Omniboard,还可以使用其他集成,如Sacredboard或Neptune)进行链接。 尽管Sacred缺乏其他工具的可扩展性,并且没有为团队协作而设计(除非与其他工具结合使用),但它对于独立研究有很多可能性。 MLflow…

Leave a Comment