Press "Enter" to skip to content

Tag: Technology

这篇人工智能AI研究提出了SAM-Med2D:关于将SAM应用于医学2D图像的最全面的研究

通过识别和分离不同的组织、器官或感兴趣区域,医学图像分割对于研究医学图片至关重要。临床医生可以使用准确的分割来帮助他们定位和准确确定疾病区域,以获得更精确的诊断和治疗。此外,通过对医学图片进行定量和定性分析,提供了对各种组织或器官的形态、结构和功能的全面洞察,从而实现了对疾病的研究。由于医学成像的特殊性,例如各种模态的广泛应用、复杂的组织和器官结构以及缺乏注释数据,目前大多数现有方法都局限于特定的模态、器官或病理。  由于这种限制,算法很难推广和修改以在不同的临床环境中使用。最近,朝着大规模模型的推进在人工智能社区中引起了激动。像ChatGPT2、ERNIE Bot 3、DINO、SegGPT和SAM这样的通用AI模型的发展使得可以使用单一模型进行各种任务。使用SAM,这个最新的大规模视觉模型,用户可以通过交互式点击、绘制边界框或使用口头提示来创建特定感兴趣区域的遮罩。人们对它在各个领域的零样本和小样本能力已经付出了相当多的关注。  一些工作也集中在将SAM的零样本能力应用于医学成像领域。然而,SAM难以推广到多模态和多对象的医学数据集,导致不同数据集之间的分割性能不稳定。这是因为自然图像和医学图像之间存在相当大的领域差距。这种差距可以归因于获取数据的方法:由于其特定的临床目的,医学图片是使用特定的协议和扫描仪获取的,并以各种模态(电子、激光、X射线、超声、核物理和磁共振)显示。因此,这些图像与真实图像有很大的偏差,因为它们依赖于各种基于物理学特征和能源源的特性。  如图1所示,自然图像和医学图像在像素强度、颜色、纹理和其他分布特征方面有明显的差异。由于SAM仅在自然图片上进行训练,它需要更多关于医学成像的专业信息,因此不能立即应用于医疗领域。由于高昂的注释成本和不一致的注释质量,向SAM提供医学信息是具有挑战性的。医学数据的准备需要专业知识,而这些数据的质量在机构和临床试验之间存在很大差异。由于这些困难,医学和自然图像的数量差异很大。  图1中的条形图比较了公开可用的自然图像数据集和医学图像数据集的数据量。例如,作为医学领域最大的公共分割数据集,Totalsegmentor与Open Image v6和SA-1B相比也存在显著差距。在本研究中,四川大学和上海人工智能实验室的研究人员提出了SAM-Med2D,这是关于将SAM应用于医学2D图像的最全面的研究,旨在将SAM从自然图像转移到医学图像领域。这将为医学图像分析领域的研究人员提供基准模型和评估框架,以进行探索和改进。 

Leave a Comment

微软对其新的人工智能驱动智能背包进行了专利申请,该背包不仅可以听到你说的话,还能看到你所看到的东西

在一个越来越被智能设备和人工智能主导的世界中,微软于2023年5月提交的一项新专利引起了人们的关注和好奇。这家科技巨头正在未来发展中将目光聚焦于开发支持人工智能的微软智能背包。这一非传统的发明承诺通过利用人工智能识别物体、执行上下文任务、访问基于云的信息并与其他设备无缝交互来彻底改变日常生活。 虽然可穿戴技术的概念并不全新,但现有的解决方案只是勾勒出了可能性的一部分。像Targus和Intel这样的品牌推出了自己的智能背包版本,每个版本都提供了独特的功能,如集成可充电电池和面向视障人士的GPS单元。然而,微软的创新似乎准备将这一概念提升到一个全新的层次。 根据该专利,微软的智能背包配备了相机、麦克风、扬声器、网络接口、处理器和存储器。它充当了一个无需使用手部操作的数字助手,具备上下文感知功能,能够理解并响应用户基于周围环境的命令。这一突破性技术通过六个步骤的过程运作,从用户输入开始,最终得出全面由人工智能驱动的响应。 评估微软智能背包成功的潜在指标是广泛的。从准确识别物体并提供上下文信息、到与其他设备和基于云的服务无缝集成,该背包的性能将通过其便利性、高效性和增强日常任务能力来衡量。指标还可能包括用户满意度和采用率,以及设备在各种环境中对生产力和便利性的影响。 总而言之,微软进军支持人工智能的智能背包领域代表了可穿戴技术的重要进步。通过提供实时信息和帮助来增强日常体验的能力,这一创新有潜力重新塑造我们与周围环境互动的方式。虽然现有的解决方案已经铺平了道路,但微软的智能背包似乎即将成为可穿戴人工智能领域的改变者,为用户展示了一种曾经被限制在科幻领域的未来前景。

Leave a Comment

“弗拉明戈和DALL-E互相理解吗?探索图像描述和文本到图像生成模型之间的共生关系”

多模态研究近来在文本和视觉的计算机理解方面取得了重大进展。通过像DALL-E和稳定扩散(SD)这样的文本到图像生成模型,可以将现实世界环境中的复杂语言描述转化为高保真度的视觉图像。另一方面,像Flamingo和BLIP这样的图像到文本生成模型展示了理解图片中复杂语义的能力,并提供连贯的描述。尽管文本到图像生成和图片描述任务非常相关,但它们通常被独立研究,这意味着这些模型之间的交互需要被探索。文本到图像生成模型和图像到文本生成模型能否相互理解是一个有趣的话题。 为了解决这个问题,他们使用了一个称为BLIP的图像到文本模型为特定图像创建文本描述。然后,将这个文本描述输入到一个名为SD的文本到图像模型中,生成一个新的图像。他们认为,如果生成的图片与源图片相似,BLIP和SD可以相互交流。通过共同的理解,每一方对潜在理念的理解能力可以得到提高,从而实现更好的描述和图像合成。这个概念在图1中得到了展示,顶部标题导致了对原始图片更准确的重建,并且比底部标题更好地代表了输入图片。 https://arxiv.org/abs/2212.12249 来自慕尼黑大学,西门子公司和牛津大学的研究人员开发了一个重建任务,其中DALL-E使用Flamingo为给定的图像生成描述,从而合成一张新的图片。他们创建了两个重建任务,文本-图像-文本和图像-文本-图像,来测试这个假设(见图1)。对于第一个重建任务,他们计算使用预训练的CLIP图像编码器提取的图像特征之间的距离,以确定重建的图片和输入图片的语义相似度。然后,将生成的文本的质量与人工标注的标题进行比较。他们的研究表明,生成的文本的质量影响重建的表现。这导致他们的第一个发现:能够重建原始图片的描述是图片的最佳描述。 类似地,他们创建了相反的任务,SD从文本输入创建一张图片,然后BLIP从创建的图片创建文本。他们发现,产生原始文本的图片是最好的文本插图。他们假设在重建过程中,输入图片的信息在文本描述中被准确地保留下来。这个有意义的描述导致了对成像模态的忠实恢复。他们的研究为细调提供了一个独特的框架,使文本到图像和图像到文本模型更容易相互交流。 具体来说,在他们的范式中,生成模型从重建损失和人工标签中获得训练信号。一个模型首先为另一种模态的特定图片或文本创建一个表示,然后不同的模型将这个表示翻译回输入模态。重建组件创建一个正则化损失,来引导初始模型的细调。他们以这种方式得到了自我监督和人类监督,增加了生成会导致更准确的重建的可能性。例如,图像字幕模型需要偏好不仅与标记的图像-文本配对相对应的标题,还需要偏好那些可以产生可靠重建的标题。 相互代理通信与他们的工作密切相关。代理之间的主要信息交流方式是语言。但是,他们如何确保第一个和第二个代理对猫或狗的定义是一样的呢?在这项研究中,他们要求第一个代理检查一张图片并生成描述它的句子。在获得文本后,第二个代理根据它来模拟一张图片。后一阶段是一种具体化过程。根据他们的假设,如果第二个代理对输入图片的模拟接近第一个代理接收到的输入图片,那么通信就是有效的。从根本上说,他们评估了语言的有用性,语言作为人类的主要交流方式。特别是,他们的研究中使用了新建立的大规模预训练图片字幕模型和图像生成模型。多项研究证明了他们提出的框架在无需训练和细调情况下对各种生成模型的好处。特别是,在无需训练的范式中,他们显著提高了字幕和图片的生成,而在细调中,两种生成模型都取得了更好的结果。 以下是他们的关键贡献的概要: • 框架:据他们所知,他们是第一个研究如何通过易于理解的文本和图片表示来传达传统的图像到文本和文本到图像生成模型的人。相比之下,类似的工作通过嵌入空间隐式地集成了文本和图片的创建。 • 发现:他们发现评估文本到图像模型创建的图片重建可以帮助确定字幕的写作质量。能够最准确重建原始图片的字幕应该用于该图片。类似地,最佳的字幕图像是能够最准确重建原始文本的图像。 • 增强:根据他们的研究,他们提出了一个全面的框架来改进文本到图像和图像到文本模型。文本到图像模型计算的重建损失将用作细调图像到文本模型的正则化,图像到文本模型计算的重建损失将用于细调文本到图像模型。他们研究并确认了他们方法的可行性。

Leave a Comment

UCSC 和 TU Munich 的研究人员提出了 RECAST:一种基于深度学习的新模型,用于预测余震

人工智能几乎渗透到了几乎所有可能的领域中。在这个领域进行了大量的研究工作。我们还有很多待发现的地方。人工智能和深度学习模型在地震学中也扮演着重要的角色,它们用于预测地震。在过去的多年里,地震余震预测模型一直保持不变。这些旧模型在处理较小数据集时效果不错,但在处理较大数据集时效果不佳。 为了解决这个问题,加州大学圣塔克鲁兹分校和慕尼黑工业大学的研究人员开发了一种名为RECAST的新模型,该模型使用了深度学习。他们选择使用深度学习是因为它对处理更大的数据集很有用。与旧模型相比,这个新模型效果更好,它在各个方面都击败了旧模型。旧的地震预测模型ETAS是几年前这些研究人员在数据有限的情况下创建的。但是现在,我们有了庞大的数据集,旧模型无法处理这些数据。旧的ETAS模型非常脆弱且难以使用。为了改进基于深度学习的地震预测,我们需要一种更好的比较模型的方法。RECAST模型在南加州的合成和真实地震数据上进行了测试。它的表现略优于ETAS模型,尤其是在有更多数据的情况下,而且速度更快。 研究人员之前尝试过使用机器学习和深度学习模型来预测地震,但技术还不够成熟。RECAST模型更准确,并且可以轻松处理不同的地震数据集。这种灵活性可能彻底改变地震预测。通过深度学习,模型可以处理大量新数据,甚至可以将来自不同地区的信息结合起来,以预测在研究较少的地区的地震。这些关于深度学习模型的信息非常有用,并一直在进行研究。研究人员还发现,使用新西兰、日本和加利福尼亚的数据训练的模型可以用于预测数据较少的地方的地震。 这些深度学习模型还将帮助研究人员访问不同类型的地震预测数据。他们现在可以使用连续的地面运动数据,而不仅仅是关注被正式归类为地震的事件。这是一个分类任务。这个模型在处理较大数据集时的准确性和F1分数都很好。研究人员仍在继续研究这个新模型,它将鼓励和推动关于所有可能性的讨论,因为它有很大的潜力。

Leave a Comment

揭示解剖分割的秘密:HybridGNet——用于合理解码解剖结构的AI编码器-解码器

深度神经网络的最新进展使得解剖分割有了新的方法。例如,利用深度卷积神经网络(CNN)在生物医学图像的解剖分割方面取得了最先进的性能。传统的策略采用标准的编码器-解码器CNN架构,使用带注释的数据集来预测像素级分割。虽然这种方法适用于拓扑在个体间不保持一致的场景,如病变分割,但对于具有规则拓扑结构的解剖结构来说可能不是理想的。深度分割网络通常被训练来最小化像素级损失函数,但这可能不保证解剖合理性,因为它对全局形状和拓扑不敏感。这可能导致出现碎片化结构和拓扑不一致等伪影。 为了缓解这些问题,结合先验知识和形状约束变得至关重要,特别是对于疾病诊断和治疗规划等下游任务。与密集的像素级遮罩相比,统计形状模型或基于图的表示等替代方法提供了一种更自然的方式来包含拓扑约束。图,特别是提供了一种表示标志点、轮廓和表面的方法,可以实现拓扑的正确性。几何深度学习将CNN扩展到非欧几里德域,促进了图数据的判别和生成模型的发展。这些进展使得能够进行准确的预测,并生成与特定分布对齐的真实图结构。 根据上述考虑,引入了新的HybridGNet架构,以在图像特征编码中利用基于标志点的分割的优势。 架构概述如下图所示。 HybridGNet结合了基于图神经网络(GCNN)的生成模型,以创建解剖学上准确的分割结构。它通过标准卷积处理输入图像,并通过对“瓶颈潜在分布”进行采样来生成基于标志点的分割,这是一个包含图像关键信息的紧凑编码表示。从该分布中进行采样使得模型能够根据编码的图像特征创建多样且合理的分割输出。采样后,进行了重塑和图域卷积。 此外,根据局部图像特征可能有助于产生更准确的标志点位置估计的假设,提出了一种名为Image-to-Graph Skip Connection (IGSC)模块。类似于UNet的跳跃连接,IGSC模块结合了图解缩操作,允许特征图从编码器流向解码器,从而增强了模型恢复细节的能力。 下图显示了从研究中选择的样本结果。这些可视化结果提供了HybridGNet和最先进方法之间的比较概览。 这就是HybridGNet的摘要,一种新颖的AI编码器-解码器神经架构,利用标准卷积进行图像特征编码,并利用图卷积神经网络(GCNN)解码解剖结构的合理表示。如果您感兴趣并想更多了解,请随时参考下面引用的链接。

Leave a Comment

亚马逊研究人员推出了一种名为“HandsOff”的方法,可以消除手动注释合成图像数据的需求

使用机器学习(ML)模型进行计算机视觉任务通常严重依赖于标记的训练数据。然而,收集和注释这些数据可能需要时间和精力。合成数据已经成为解决这个问题的可行方法,但是即使生成合成数据也经常需要人工分析员费力地手动注释。 现有的解决此问题的方法通常涉及使用生成对抗网络(GAN)创建合成图像。GAN由一个鉴别器和一个生成器组成,其中生成器学习生成能够欺骗鉴别器认为它们是真实的图像。虽然GAN在生成合成数据方面显示出了潜力,但它们仍然需要大量标记数据进行训练,限制了它们在有限注释数据的情况下的有效性。 亚马逊研究人员提出了一种名为“HandsOff”的创新解决方案,该解决方案在计算机视觉和模式识别会议(CVPR)上进行了演示。HandsOff通过利用一小组标记图像和GAN,消除了对合成图像数据的手动注释的需求。 HandsOff采用了一种称为GAN反演的新颖方法。研究人员不是修改GAN本身的参数,而是训练一个单独的GAN反演模型,将真实图像映射到GAN的潜在空间中的点。这使得他们能够基于标记图像创建一个小的点和标签数据集,可以用来训练第三个能够标记GAN潜在空间中的点的模型。 HandsOff的关键创新在于使用学习感知图像块相似性(LPIPS)损失来微调GAN反演模型。LPIPS通过比较计算机视觉模型(如目标检测器)在每个模型层的输出来衡量图像之间的相似性。通过优化GAN反演模型,以最小化真实潜在向量与输入图像的估计潜在向量之间的LPIPS差异,研究人员确保了即使对于不完全重构的想法,也能够保证标签的准确性。 HandsOff在语义分割、关键点检测和深度估计等重要的计算机视觉任务上展示了最先进的性能。值得注意的是,这是在少于50个现有标记图像的情况下实现的,突显了该框架在最小手动注释的情况下生成高质量合成数据的能力。 总之,HandsOff框架在计算机视觉和机器学习领域取得了令人振奋的突破。消除对合成数据大量手动注释的需求显著减少了训练ML模型所需的资源和时间。GAN反演与LPIPS优化的使用展示了该方法在确保生成数据的标签准确性方面的有效性。虽然文章没有详细探讨具体的定量指标,但实现最先进性能的声明是有希望的,值得进一步研究。 总体而言,HandsOff通过使高质量标记数据更易获取和更适用于各个领域和行业,有望推动计算机视觉研究和应用的发展。

Leave a Comment

该AI研究提出了使用OpenAI嵌入向量进行强大的Lucene集成搜索

最近,在机器学习的搜索领域中,应用深度神经网络取得了重大进展,特别强调了双编码器架构中的表示学习。在这个框架中,各种类型的内容,包括查询、段落,甚至包括图像等,被转化为紧凑且有意义的“嵌入”,表示为密集向量。基于这种架构构建的密集检索模型成为增强大型语言模型(LLMs)中检索过程的基石。这种方法在当今生成式人工智能的更广泛领域中已经广受欢迎,并被证明在增强LLMs的整体能力方面非常有效。 叙述表明,由于需要处理大量的密集向量,企业应该将专用的“向量存储”或“向量数据库”纳入到他们的“AI堆栈”中。一些初创公司积极推动这些向量存储作为创新和现代企业架构的重要组成部分。其中一些显著的例子包括Pinecone、Weaviate、Chroma、Milvus和Qdrant等。一些支持者甚至已经提出这些向量数据库最终可能取代长期存在的关系数据库。 本文提出了与这种叙述相对立的观点。这些论点围绕着一个简单的成本效益分析,考虑到搜索在许多组织中代表着一个现有且已经建立的应用,从而导致在这些能力上进行了重大的先前投资。生产基础设施主要由以开源Lucene搜索库为中心的广泛生态系统主导,尤其是由Elasticsearch、OpenSearch和Solr等平台推动。 https://arxiv.org/abs/2308.14963 上面的图片展示了一个标准的双编码器架构,其中编码器从查询和文档(段落)生成密集向量表示(嵌入)。检索被构建为向量空间中的k最近邻搜索。实验集中在MS MARCO段落排序测试集上进行,该集合由大约880万个从网络中提取的段落组成。用于评估的是标准开发查询和来自TREC 2019和TREC 2020深度学习跟踪的查询。 研究结果表明,今天可以使用Lucene直接构建一个使用OpenAI嵌入的向量搜索原型。嵌入API的日益普及支持了我们的论点。这些API简化了从内容中生成密集向量的复杂过程,使其更易于从业者使用。确实,当您构建搜索生态系统时,只需要Lucene就足够了。但正如事实所证明的那样,只有时间会告诉我们是否正确。最后,这提醒我们,在快速发展的人工智能世界中,权衡成本与收益仍将是一种主要思维方式。

Leave a Comment

让ChatGPT成为更好的软件开发人员:SoTaNa是一个面向软件开发的开源AI助手

我们做事的方式在最近几年发生了快速变化。我们已经开始使用虚拟助手来完成我们大部分的任务,并发现自己处于一种需要将任务委派给AI代理的位置。 有一把钥匙可以解锁推动所有这些进步的力量:软件。在一个日益技术驱动的世界中,软件开发是创新的关键,涵盖了从医疗保健到娱乐等各个领域。然而,软件开发的过程往往充满了复杂性和挑战,要求开发人员快速解决问题和创造性思考。 这就是为什么AI应用程序在软件开发领域迅速找到了自己的位置。它们简化了这个过程,为开发人员提供了及时的编码查询答案,并在他们的努力中支持他们。我的意思是,你可能也在使用它。你上次去StackOverflow而不是ChatGPT是什么时候?或者当你安装了GitHub协作者时,你按Tab键的次数有多少? ChatGPT和Copilot都不错,但它们在软件开发中仍然需要有良好的指导才能发挥更好的作用。今天,我们见到了一个新的参与者;SoTaNa。 SoTaNa是一个利用LLM的能力来提高软件开发效率的软件开发助手。像ChatGPT和GPT4这样的LLM已经展示了它们在理解人类意图和生成类似人类的回应方面的能力。它们在包括文本摘要和代码生成在内的各个领域都变得有价值。然而,由于某些限制,它们的可用性受到了限制,而SoTaNa旨在解决这些限制。 SoTaNa作为一个开源软件开发助手,致力于弥合开发者和LLM的巨大潜力之间的鸿沟。这个倡议的主要目标是使基础LLM能够在有限的计算资源下理解开发者的意图。这项研究采用了多步骤的方法来实现这一目标,利用ChatGPT来生成面向软件工程任务的高质量基于指令的数据。 SoTaNa概述。来源:https://arxiv.org/pdf/2308.13416.pdf 该过程通过引导ChatGPT进行具体提示,详细说明生成新实例的要求来开始。为了确保准确性和与期望输出的对齐,手动注释的软件工程相关实例的种子池作为参考。这个池子涵盖了各种软件工程任务,为生成新数据奠定了基础。通过巧妙的采样技术,这种方法有效地使演示实例多样化,并确保创建满足规定要求的高质量数据。 为了更好地提高模型对人类意图的理解,SoTaNa采用了Lora,一种参数高效的微调方法,使用有限的计算资源来增强开源基础模型,特别是LLaMA。这个微调过程使模型在软件工程领域内更好地理解人类意图。 生成数据使用的提示。来源:https://arxiv.org/pdf/2308.13416.pdf SoTaNa的能力是使用Stack Overflow问题回答数据集进行评估的,包括人工评估在内的结果强调了该模型在协助开发人员方面的有效性。 SoTaNa向世界介绍了一个基于LLMs构建的开源软件开发助手,能够理解开发人员的意图并生成相关的响应。此外,它通过发布模型权重和专为软件工程而设计的高质量基于指令的数据集,对社区做出了重要贡献。这些资源有望加速未来在该领域的研究和创新。

Leave a Comment

来自Inception、MBZUAI和Cerebras的研究人员开源了“Jais”:全球最先进的阿拉伯大型语言模型

大型语言模型如GPT-3及其对社会各个方面的影响是一个备受关注和争议的话题。大型语言模型显著推动了自然语言处理领域的发展。它们提高了各种与语言相关的任务的准确性,包括翻译、情感分析、摘要和问答。由大型语言模型驱动的聊天机器人和虚拟助手变得越来越复杂,能够处理复杂的对话。它们被用于客户支持、在线聊天服务,甚至成为某些用户的伴侣。 构建阿拉伯语大型语言模型(LLM)面临着由于阿拉伯语言的特性和其方言的多样性而产生的独特挑战。与其他语言的大型语言模型类似,阿拉伯语LLMs可能会继承训练数据中的偏见。解决这些偏见并确保在阿拉伯语境中负责任地使用人工智能是一个持续关注的问题。 Inception、Cerebras和阿布扎比人工智能大学(UAE)的研究人员推出了一种新的基于阿拉伯语的大型语言模型Jais和Jais-chat。他们的模型基于GPT-3生成式预训练架构,仅使用了130亿个参数。 他们面临的主要挑战是获取用于训练该模型的高质量阿拉伯语数据。与拥有高达2万亿个标记的英文数据相比,阿拉伯语语料库要小得多。语料库是用于语言学、自然语言处理(NLP)和文本分析的大型结构化文本集合,用于研究和语言模型训练。语料库是研究语言模式、语义、语法等方面的宝贵资源。 为了解决这个问题,他们训练了双语模型,通过增加有限的阿拉伯语预训练数据与丰富的英文预训练数据相结合。他们对Jais进行了预训练,包括72亿个阿拉伯语标记和2320亿个英文标记。他们开发了一种专门的阿拉伯文本处理流程,包括彻底的数据过滤和清理,以生成高质量的阿拉伯语数据。 他们表示,他们的模型的预训练和微调能力超越了所有已知的开源阿拉伯模型,并且与在更大数据集上训练的最先进的开源英文模型相当。考虑到大型语言模型的固有安全问题,他们通过安全导向的指令进一步微调了模型。他们通过安全提示、基于关键词的过滤和外部分类器添加了额外的安全防护。 他们表示,Jais代表了中东自然语言处理和人工智能领域的重要发展和扩展。它推进了阿拉伯语的理解和生成,为当地参与者提供了主权和私有部署选择,并培育了一个应用和创新的活跃生态系统;这项工作支持了数字和人工智能转型的更广泛战略计划,以迎接一个更开放、更具语言包容性和文化意识的时代。

Leave a Comment

Meta AI在计算机视觉公平性方面的两项新尝试:引入DINOv2许可证和发布FACET

在不断发展的计算机视觉领域中,一个紧迫的问题是确保公平性。这篇文章揭示了人工智能技术(尤其是计算机视觉)中潜在的巨大潜力,它是促成各个领域变革性突破的催化剂,从维护生态保护努力到推动开拓性的科学探索。然而,它对这项技术崛起所带来的固有风险保持了坦诚的态度。 Meta AI的研究人员强调必须达到的关键平衡,即快速创新的节奏与必要时出现的有意识的开发实践之间的和谐平衡。这些实践不仅仅是一种选择,而且是对这项技术可能无意中给历史上被边缘化社区带来的潜在伤害的重要防护。 Meta AI的研究人员针对这个多方面的挑战制定了一项全面的路线图。他们首先通过开源Apache 2.0许可证使DINOv2成为一种先进的计算机视觉模型,该模型通过自监督学习的锻炼器锻炼而成。DINOv2是Data-Efficient Image Neural Network Version 2的缩写,代表着计算机视觉模型的一次重要飞跃。它利用自监督学习技术创建通用特征,使其能够以高度灵活的方式理解和解释图像。 DINOv2的能力不仅限于传统的图像分类。它在许多任务中表现出色,包括语义图像分割,可以准确识别物体边界并将图像分割成有意义的区域,以及单目深度估计,使其能够感知图像中物体的空间深度。这种多功能性使DINOv2成为计算机视觉应用的强大工具。这种扩展的可访问性使开发人员和研究人员能够在广泛的应用领域中利用DINOv2强大的功能,进一步推动计算机视觉创新的前沿。 Meta对计算机视觉中公平性的承诺的核心在于引入FACET(计算机视觉评估中的公平性)。FACET是一个里程碑式的基准数据集,包含约32,000张图片,涵盖约50,000个个体。然而,FACET的独特之处在于专家人工标注者的细致注释。这些专家经过细心的注释工作,将数据集按多个维度进行分类。其中包括感知性别表达、年龄组别以及感知肤色和发型等身体属性。值得注意的是,FACET引入了与个人相关的类别,涵盖了像“篮球运动员”和“医生”这样多样化的职业。该数据集还通过包含69,000个口罩标签增强了其研究目的的重要性。 使用FACET进行的初步研究已经揭示了先进模型在不同人群中的性能差异。例如,这些模型在准确检测肤色较暗或头发卷曲的个体方面经常遇到挑战,揭示了潜在的偏见,值得仔细研究。 在使用FACET进行性能评估时,最先进的模型在不同人群之间展示出性能差异。例如,模型可能难以检测到肤色较暗的个体,对于头发卷曲的个体则更加困难。这些差异凸显了对计算机视觉模型中的偏见进行全面评估和缓解的必要性。 尽管主要用于研究评估而不是用于训练目的,但FACET有可能成为评估计算机视觉模型公平性的卓越标准。它为对人工智能中的公平性进行深入细致的检查奠定了基础,超越了传统的人口属性,包括了与个人相关的类别。 总之,Meta的文章放大了计算机视觉中的公平性问题,并揭示了FACET揭示的性能差异。Meta的方法包括扩大对DINOv2等先进模型的访问,并引入一种开创性的基准数据集。这种多方面的方法彰显了他们对促进创新、坚持道德标准和缓解公平问题的坚定承诺。它突显了他们对负责任的发展的不懈奉献,为实现一个公平的人工智能领域铺平了道路,即利用技术造福于所有人的领域。

Leave a Comment

顶级人工智能电子邮件助手(2023年9月)

人工智能邮件助手使编写电子邮件更快、更容易。自动任务完成、消息优先级和即时、有见地的答案只是人工智能邮件助手减轻管理收件箱负担的方式。因此,用户可以将注意力集中在最紧急的电子邮件上,并在更短的时间内完成更多工作。由人工智能驱动的自动电子邮件助手还可以代替您撰写和发送邮件。 许多不同行业的人们,从忙碌的办公室工作者和公司所有者到个体经营者和学生,都使用人工智能和电子邮件助手。对于时间安排紧张的专业人士来说,人工智能邮件助手是保持收件箱井井有条、避免错过重要消息的好方法。对于创业者和公司所有者来说,人工智能邮件助手是节省时间和劳动力的工具。使用人工智能邮件助手是学生保持组织和与教授保持联系的好方法。 在本文中,我们将对比一些流行的人工智能邮件助手。 SaneBox SaneBox的人工智能可以识别重要的电子邮件,并自动组织其余邮件,帮助您保持专注。SaneBox利用智能人工智能算法来分析您的电子邮件行为。它从您过去的互动中学习,识别重要的电子邮件,通过将不那么重要的邮件移动到一个单独的文件夹中来整理您的收件箱,并在另一个文件夹中汇总通讯和社交媒体通知。本质上,它将混乱变为有序,简化您的数字通信。 InboxPro 通过人工智能和强大的自动化工具提高Gmail的工作效率。InboxPro是一个全能解决方案,帮助您提高销售额和改善客户支持。 Lavender Lavender是一个由人工智能驱动的电子邮件助手,已经帮助全球数千家零售商通过电子邮件提高了响应速度和质量。Lavender不是一个公共广告公司,而是一个私人公司。它能够运行和改进网站是因为有了cookie。Cookie允许网站的基本功能,例如安全登录或自定义同意设置。像社交媒体分享、反馈收集和其他第三方集成等功能依赖于功能性cookie的正常运行。分析cookie收集有关访问次数、跳出率、流量来源等变量的数据,以深入了解网站用户的行为。 Missive Missive是一个智能电子邮件助手,具有多种有用的工具,可帮助团队保持井然有序。最近,它实现了包括OpenAI的GPT技术。这使得Missive能够在不离开应用程序的情况下翻译消息或修改电子邮件的语气,具体取决于互动环境。用户还可以使用提示来定制AI代码以满足其需求。改善与客户的联系质量是这种整合的主要目标之一,部分通过向AI提供公司特定数据来增强其提供适当回复的能力。 Superflows Superflows是一个由人工智能驱动的电子邮件助手,通过提供预先编写的、与上下文相关的响应,帮助客户更快地处理收件箱,只需单击即可访问。智能生成的对传入电子邮件的响应包括日历链接和其他相关信息,以进行个性化。这使用户可以快速回应电子邮件,而无需从其他来源复制和粘贴数据。 Superhuman Superhuman界面的直观和快速性主要归功于其多种节省时间的功能,如键盘快捷键和强大的搜索功能。Superhuman创新的由AI驱动的收件箱组织功能对于忙碌的专业人士来说是一个改变游戏规则的功能。其AI引擎学习了哪些消息对用户最重要,并优先显示它们在收件箱的前面。该公司还提供个人指导和培训,以确保每个用户能够充分利用他们与Superhuman的时间。 Scribbly 电子邮件可以以多种方式回复,使用户在做出最佳选择时有更多的灵活性。Scribbly是一个由人工智能驱动的电子邮件助手,通过根据电子邮件的上下文建议相关材料,帮助忙碌的专业人士节省时间并更有效地沟通。使用Scribbly的电子邮件起草功能,用户可以向电子邮件助手提供一些信息,以代表他们撰写电子邮件,或选择最能代表他们希望回复电子邮件方式的意图。 Tugan(图干) Tugan(图干)是一种基于人工智能的电子邮件助手,公司可以使用它来发送信息和促销邮件。根据提供的URL或主题,Tugan(图干)使用人工智能生成根据公司特定兴趣和需求定制的邮件。接收者可以选择并转发他们最喜欢的邮件。时间有限的专业人士、作者和内容制作人将从这个电子邮件助手中获益最多。与市场上其他同类产品相比,Tugan(图干)是一个还处于测试阶段的较新的电子邮件助手。计划中包括按照您最喜欢的商业大师的方式生成邮件,以及为Facebook和YouTube生成广告文本的功能。 AI Mailer(AI 邮件发送工具) AI Mailer(AI 邮件发送工具)使得公司和专业人士轻松发送高质量的定制邮件变得容易。它使用GPT和NLP技术生成定制的、及时的消费者邮件回复,并开发与其上下文相关的内容。它具有适应性接口和内置多种语言的兼容性,旨在提供使用便利。学生和专业人士可以使用它来提升他们的电子邮件沟通能力,客户服务团队可以使用它加快响应速度并定制客户互动。…

Leave a Comment

解锁神经网络中的多样性力量:自适应神经元在图像分类和非线性回归中胜过同质性

神经网络是人工智能中的一种方法,它教会计算机以类似于人脑的方式处理数据。它使用连接的节点或神经元构成的分层结构,类似于人脑。人工神经元被排列成层级结构形成神经网络,用于各种任务,如模式识别、分类、回归等。这些神经元通过在训练过程中改变数字权重和偏差来形成稳固的连接。 尽管这些神经网络取得了进展,但它们也有限制。它们由大量相似类型的神经元组成。这些相同神经元之间的连接数量和强度可以在网络学习过程中发生变化。然而,一旦网络被优化,这些固定的连接定义了其架构和功能,无法改变。 因此,研究人员开发了一种可以提升人工智能能力的方法。它允许人工智能内部审视其结构并微调其神经网络。研究表明,通过多样化激活函数可以克服限制,并使模型能够高效工作。 他们在多样性上对人工智能进行了测试。北卡罗来纳州立大学物理学教授、北卡罗来纳州立大学非线性人工智能实验室主任威廉·迪托表示,他们创建了一个测试系统,其中包含一种非人类智能,即人工智能(AI),以查看人工智能是否会选择多样性而不是缺乏多样性,并且其选择是否会提高人工智能的性能。此外,他表示关键在于允许人工智能内部审视并学习其学习方式。 允许神经元自主学习激活函数的神经网络往往表现出快速多样化,并在图像分类和非线性回归等任务中表现优于同质神经网络。另一方面,迪托的团队赋予了他们的人工智能在其神经网络中自主确定神经元数量、配置和连接强度的能力。这种方法允许创建由网络内的各种神经元类型和连接强度组成的子网络。 迪托表示,他们赋予了人工智能内部审视并决定是否需要修改其神经网络组成的能力。实质上,他们给了它大脑的控制旋钮。因此,它可以解决问题,查看结果,并改变人工神经元的类型和混合直到找到最有利的一种。他将其称为人工智能的元学习。他们的人工智能还可以在多样或同质神经元之间进行选择。他进一步表示,他们发现在每个实例中,人工智能都选择多样性以增强其性能。 研究人员在一个标准的数字分类任务上测试了该系统,并发现该系统的准确性随着神经元数量和多样性的增加而提高。研究人员表示,同质人工智能在数字识别方面的准确率为57%,而元学习的多样性人工智能则达到令人印象深刻的70%准确率。 研究人员表示,未来他们可能会通过调整超参数来优化学习到的多样性,以提高性能。此外,他们将在更广泛的回归和分类任务中应用获得的多样性,使神经网络多样化,并评估其在不同情景下的鲁棒性和性能。

Leave a Comment

微软研究员提出了具有两阶段干预框架的开放词汇负责任视觉综合(ORES)

视觉综合模型由于大规模模型训练的进展而能够产生越来越逼真的视觉效果。鉴于使用合成图片的潜在风险增加,负责任的人工智能变得更加重要,特别是在合成过程中消除特定的视觉元素,如种族主义、性别歧视和裸露。但是,负责任的视觉综合是一个非常困难的任务,原因有两个。首先,合成的图片必须符合管理员的标准,例如不应出现“比尔·盖茨”和“微软创始人”等词语。其次,用户查询的非禁止部分应准确合成,以满足用户的要求。 现有的负责任的视觉综合技术可以分为三个主要类别来解决上述问题:改进输入、改进输出和改进模型。第一种策略是改进输入,集中在对用户查询进行预处理,以符合管理员的要求,例如构建黑名单来过滤不良内容。在开放词汇表的环境中,黑名单很难确保完全消除所有不良内容。第二种方法是改进输出,包括对生成的影片进行后处理,以符合管理员的规则,例如通过识别和删除不适宜的内容来保证输出的适用性。 这种技术很难识别开放词汇的视觉概念,它依赖于在特定概念上进行预训练的过滤模型。第三种策略是改进模型,尝试对整个模型或特定组件进行微调,以理解和满足管理员的要求,提高模型遵循预期准则并提供与指定规则和法规一致的材料的能力。然而,微调数据中的偏见常常对这些技术施加限制,使其难以达到开放词汇表的能力。这就引出了以下问题:管理员如何通过实现开放词汇负责任的视觉综合来有效地禁止创建任意的视觉概念?例如,用户可能要求在图1中生成“微软创始人在酒吧喝酒”的图片。 图1. 开放词汇负责任的视觉综合 根据地理、上下文和使用情况的不同,必须避免使用不适合的视觉概念进行适当的视觉综合。 当管理员将“比尔·盖茨”或“酒精”等概念禁止时,负责任的输出应以类似日常语言表达的方式澄清概念。微软的研究人员基于上述观察提出了一项名为开放词汇负责任的视觉综合(ORES)的新任务,其中视觉综合模型可以避免不明确表示的任意视觉元素,并允许用户输入所需的信息。然后引入了两阶段干预(TIN)结构。它可以通过使用大规模语言模型(LLM)进行可学习的指令重写和通过扩散综合模型进行快速干预来成功合成图片。 在可学习查询的指导下,TIN将特定应用于使用CHATGPT将用户的问题重写为降低风险的查询。在中间综合阶段,TIN通过用降低风险的查询替换用户的查询来干预合成。他们开发了一个基准测试,相关的基线模型,黑名单和负面提示,并提供了一个可公开访问的数据集。他们结合了大规模语言模型和视觉综合模型。据他们所知,他们是首次在开放词汇场景下研究负责任的视觉综合。 在附录中,他们的代码和数据集对所有人都是可访问的。他们作出了以下贡献: • 他们提出了开放词汇负责任的视觉综合(ORES)的可行性,并开发了一个带有适当基线模型的基准测试,建立了一个可公开访问的数据集。 • 作为ORES的成功解决方案,他们提供了两阶段干预(TIN)框架,其中包括 1)通过大规模语言模型(LLM)进行可学习教学的重写 2)通过扩散合成模型进行快速干预的合成 • 研究表明,他们的方法显著降低了不适当模型开发的机会。他们展示了LLM在负责任的视觉合成方面的能力。

Leave a Comment

Google AI推出WeatherBench 2:用于评估和比较各种天气预报模型的机器学习框架

近年来,机器学习(ML)在天气预报中的应用越来越多。现在,ML模型在准确性方面可以与基于物理的运算模型相媲美,有希望这一进展很快能够提高全球天气预报的精度。采用客观和确定的评估指标对新方法进行开放和可重现的评估对实现这一目标至关重要。 Google、Deepmind和欧洲中心VoAGI-Range Weather Forecasts最近的研究提出了WeatherBench 2,这是一种用于天气预测模型的基准和比较框架。除了对用于训练大多数ML模型的ERA5数据集进行彻底复制外,WeatherBench 2还具有开源的评估代码和公开可用的云优化的基准和基线数据集。 目前,WeatherBench 2针对全球VoAGI范围(1-15天)的预测进行了优化。研究人员计划在不久的将来考虑将评估和基线纳入更多工作,例如现在预报和短期(0-24小时)和长期(15+天)预测。 天气预报的准确性很难用简单的得分来评估。对于某个用户来说,平均温度可能比风阵的频率和严重程度更重要。因此,WeatherBench 2包括了许多指标。为了与气象机构和世界气象组织进行标准评估一致,定义了几个重要的标准指标来总结该研究。 WeatherBench 2.0(WB2)是基于数据驱动的全球天气预报的黄金标准。它受到了自第一个WeatherBench基准发布以来出现的所有新AI技术的启发。WB2的构建目标是尽可能接近许多气象中心使用的操作预报评估。它还为将实验方法与这些操作标准进行比较提供了坚实的基础。 通过公开提供评估代码和数据,目标是促进高效的机器学习操作并确保可重现的研究结果。研究人员相信,根据社区的需求,可以在WB2中增加更多的指标和基线。该论文已经暗示了几个潜在的扩展,包括更多关注在细尺度上评估极端事件和影响变量,也许通过站点观测。

Leave a Comment

这篇人工智能论文通过各种深度学习和机器学习算法,识别了行为和生理智能手机认证中的流行动态及其性能

多年来,移动设备在功能和受欢迎程度方面取得了显著进展,而安全措施却没有跟上。智能手机现在储存了大量敏感信息,安全问题成为了一个紧迫的关注点。研究人员一直在探索行为和生理生物特征识别技术以增强移动设备的安全性。这些方法利用了唯一的用户特征,如打字模式和面部特征。结合机器学习和深度学习算法已经显示出增强安全性的潜力。继续研究这些方法以增强移动设备在实际情境中的安全性非常重要。 在这个背景下,一支来自美国的研究团队发表了一篇新文章,以解决移动设备安全领域日益增长的差距。该论文旨在全面评估基于行为和生理生物特征的身份认证方法在增强智能手机安全性方面的表现。它基于该领域的先前研究,并确定了身份认证动态的趋势。此外,该研究强调,将深度学习特征与深度学习/机器学习分类相结合的混合方案可以显著提高身份认证性能。 随着该研究深入探讨移动设备安全的这些关键方面,它将其调查集中在以下主要问题上:“对于移动设备来说,最有效的生物特征身份认证方法是什么?哪些机器学习和深度学习算法与这些生物特征方法最搭配?”作者得出结论,他们对深度学习(DL)和机器学习(ML)算法在生物特征身份认证领域的广泛研究产生了重要的见解。他们发现仔细选择算法显著影响身份认证性能,卷积神经网络(CNN)和循环神经网络(RNN)在处理生理和行为动力学方面表现出色。CNN在处理生理数据(如面部和指纹身份认证)方面表现优异,而RNN在处理击键动力学方面发挥了重要作用。支持向量机(SVM)是行为生物特征分类的一个强有力的选择,尤其是在触摸、运动和击键动力学方面。该研究还注意到了混合身份认证系统的不断采用,其中算法如CNN用于特征提取。这些混合方法,如CNN + LSTM用于步态动力学和CNN + SVM用于面部认证,在各种情境下显示出提高身份认证性能的潜力。 最后,该论文还强调了所审查的研究中的一些局限性: 1. 小数据集:许多研究使用小数据集,这可能影响生物特征身份认证模型的质量和普适性,特别是对于需要更大数据量的深度学习模型来说。 2. 缺乏安全测试:许多研究没有对其模型进行各种安全攻击的测试,这可能使身份认证方法易受攻击。 3. 受限情境:一些研究在用户遵循严格指示的受限情境下收集和测试数据。这可能限制模型的实际应用性,因为它没有考虑到人们使用设备的变化性。 解决这些局限性对于推进生物特征移动身份认证方法的实用性和安全性至关重要。 总之,这项调查提供了对移动生物特征身份认证的全面了解。它突出了深度学习算法的有效性,尤其是CNN和RNN在行为和生理身份认证中的应用。混合模型,如CNN + SVM,展示了提高性能的潜力。根据论文的作者,未来的研究应该专注于DL算法,扩展高质量的数据集,并确保现实测试情境,以充分发挥移动生物特征身份认证的潜力。

Leave a Comment

解锁黑盒子:理解深度神经网络中数据处理的定量法则

人工智能一直以来都笼罩在神秘的色彩中,特别是在深度学习的神秘领域。这些复杂的神经网络,以其复杂的过程和隐藏的层次,吸引了研究人员和实践者的注意,同时也掩盖了它们的内部工作原理。然而,最近的一项突破现在承诺照亮这种朦胧的路径。 由何航峰和苏伟捷领导的研究团队揭示了一项具有开创性意义的经验法则——“等分法则”,它揭示了深度神经网络训练过程中所发生的有序混乱。这一发现揭开了训练过程的神秘面纱,并提供了对架构设计、模型鲁棒性和预测解释的洞察。 挑战的关键在于深度神经网络固有的复杂性。这些模型具有众多的层次和相互连接的节点,进行着看似混乱和难以预测的复杂数据转换。这种复杂性导致了对其内部操作的更深入理解的需求,阻碍了架构设计和决策解释的进展,特别是在关键应用中。 等分法则穿透了表面上的混乱,揭示了深度神经网络内部的潜在秩序。在其核心,该法则量化了这些网络基于类别成员在各层之间进行数据分类的方式。这个法则揭示了一个一致的模式:数据在每一层内的分离以恒定的速度几何级别地改善。这挑战了混乱训练的概念,展示了网络层内的一个结构化和可预见的过程。 这个经验法则建立了一个定量的关系:每一层的分离模糊度以恒定的速率以几何级别改善。随着数据穿过每一层,该法则确保不同类别的分离逐渐增强。这个法则在各种网络架构和数据集上都成立,为我们对深度学习行为的理解提供了一个基础框架。规定分离模糊度的公式如下: D(l​)=ρ^l * D(0​) 在这里,D(l​)表示第l层的分离模糊度,ρ代表衰减比率,D(0)​代表初始层的分离模糊度。 在Fashion-MNIST上训练了一个20层的前馈神经网络。从第100轮开始观察到“等分法则”的出现。x轴表示层的索引,y轴表示分离模糊度。 这一发现具有深远的影响。传统的深度学习通常依赖于启发式和技巧,有时导致次优的结果或资源密集的计算。等分法则为架构设计提供了指导原则,暗示网络应该具有深度以实现最佳性能。然而,它也暗示着过于深的网络可能会带来递减的回报。 此外,该法则的影响还延伸到训练策略和模型鲁棒性。它在训练过程中的出现与模型性能和鲁棒性的提高相关。遵循该法则的网络表现出更强的抗扰动能力,增强了其在现实场景中的可靠性。这种鲁棒性直接来源于法则揭示的有序数据分离过程,使网络在超出训练数据范围的泛化能力得到增强。 解释深度学习模型一直是一个挑战,因为它们的黑盒性质限制了它们在关键决策环境中的可用性。等分法则引入了一种新的解释视角。每个网络层都充当一个模块,均匀地为分类过程做出贡献。这个观点挑战了传统的逐层分析,强调了考虑网络内所有层的集体行为的重要性。 与冻结的右侧网络不同,左侧网络显示出等间隔定律。尽管训练性能相似,左侧网络具有更高的测试准确率(23.85%对比右侧网络的19.67%)。 总之,等间隔经验定律是深度学习中的一项革命性发现。它重新塑造了我们对深度神经网络的认识,从不透明的黑盒子变成了一个由可预测且具有几何结构的过程驱动的有组织系统。在研究人员和实践者努力应对架构复杂性、训练策略和模型解释时,这个定律将作为一盏指路明灯,为解锁深度学习在不同领域的全部潜力提供指引。在一个追求透明度和对人工智能洞察力的世界中,等间隔定律成为了一盏指引错综复杂的深度神经网络的明灯。

Leave a Comment

理解大型语言模型的黑暗面:安全威胁和漏洞的综合指南

近年来,LLM在自然语言处理(NLP)领域越来越受欢迎。基于神经网络的机器学习模型的扩展使得最近取得了一些进展,产生的自然语言几乎和人类产生的语言难以区分。 LLM可以提高人类的生产力,从代码生成到辅助写邮件和共同撰写大学作业,都有很好的效果,并在法律、数学、心理学和医学等领域展现出了惊人的成果。尽管取得了这些进展,学术界对其文本生成技能的有害使用问题提出了许多问题。 因此,蒂尔堡大学和伦敦大学学院的研究人员对LLM的安全研究现状进行了调查,并根据危险、预防措施和安全漏洞对现有技术进行了分类。LLM复杂的生成能力使其成为制造网络钓鱼邮件、恶意软件和虚假信息等威胁的天然滋生地。 包括内容过滤、从人类反馈中强化学习和红队测试在内的现有努力都旨在减少这些能力带来的风险。然而,由于不足的防范措施和遮掩技术(如越狱和即时注入),漏洞会出现,之前被禁用的威胁重新出现。研究人员澄清了关键术语,并针对每个广泛领域提供了学术和现实示例的全面参考文献。 该论文解释了为何任何不能完全消除LLM不良行为的技术都会使模型容易受到快速对抗的攻击。研究也提出了类似的观点,认为大型人工智能模型(LAIMs),包括语言领域以及超越语言的基础模型,由于其训练数据所具有的三个特征,本质上是不安全和脆弱的。他们还指出,如果我们要增加模型的安全性,那么与基准模型相比,准确性将显著下降。这种论点进一步质疑了LLM的安全和可靠程度。鉴于LLM的实用性和安全性之间的紧张关系,LLM的提供者和用户都应该仔细考虑这种权衡。

Leave a Comment

来自弗吉尼亚理工大学和微软的研究人员介绍了思维算法:一种增强大型语言模型(LLMs)中思想探索和推理能力的人工智能方法

大型语言模型(LLMs)最近取得了进展,这引起了人们对它们在各种问题解决活动中的有用性的关注。这些模型在各种问题解决的背景下都证明了它们的能力,包括代码生成、指令跟随和一般问题解决。当代研究已经转向更复杂的方法,包括线性推理路径,与使用直接答案策略的第一批模型相比。在更近期的方法中,复杂的问题被划分为较小的任务,以便于系统性的解决方案搜索。此外,外部过程正在被整合进来,通过修改上下文来改变令牌的生成。 当前的研究主要使用了一个外部的操作机制,它会停止、修改,然后再恢复生成过程,以试图超越当前的思维链方法。这样做是为了提高LLMs的推理能力,但它带来的缺点是它会生成更多的查询请求,因此会有更多的开销、更高的内存需求和更多的计算开销。 为了克服这些挑战,弗吉尼亚理工学院微软的研究团队引入了一种独特的方法,称为思维算法(Algorithm of Thoughts)。通过这种策略,LLMs沿着算法推理的路径前进,有效地创造了一种在上下文中学习的新方法。利用算法示例,LLMs中固有的循环动力学被用来扩展概念的探索,而只需要很少的查询。 AoT的主要目标是通过算法的例子来教导LLMs,这些例子完美地体现了探索的精神。该技术减少了所需的查询数量,同时扩展了LLMs对概念的研究。AoT击败了旧的单查询技术,并与使用复杂树搜索算法的当代多查询策略相媲美。 这种方法可以超越只使用一个查询的旧技术,这使得这种方法独特。此外,这种方法的性能与最近使用复杂树搜索算法的多查询方法相当。结果表明,当LLMs使用这种方法进行训练时,它有可能胜过算法。这一发现表明,LLMs有将直觉融入增强搜索过程的内在能力。 总而言之,AoT的用例非常广泛。AoT能够彻底改变LLMs处理推理问题的方式,从一般问题解决到复杂的编程困难。算法路径的引入使LLMs能够考虑各种解决方案,模拟回溯技术,并评估各种子问题的潜力。AoT通过弥合LLMs和算法思维之间的差距,为上下文学习提供了一种新的范式。

Leave a Comment

从零开始构建一个模型,用于根据提示生成文本

介绍 在迅速发展的生成式人工智能领域,一个新纪元已经到来。这场变革性的转变为AI应用带来了前所未有的进步,其中聊天机器人处于前沿。这些由AI驱动的对话代理模拟了人类般的互动,为企业和个人重新塑造了沟通方式。术语“Gen AI Era”强调了先进AI在塑造未来方面的作用。“解锁潜力”意味着聊天机器人驱动个性化体验、高效解决问题和创造力的转变阶段。标题提示了如何通过由Gen AI驱动的聊天机器人从头开始构建模型,从提示中生成文本,引领对话新时代的发现。 本文深入探讨了聊天机器人和Gen AI的交叉领域,通过从提示生成文本,揭示了它们的深远影响。它探讨了聊天机器人如何增强沟通、简化流程并提升用户体验。这一旅程揭示了聊天机器人在Gen AI时代的潜力,探索了它们在不同行业中的演变、应用和变革力量。通过前沿的AI创新,我们揭示了聊天机器人如何在这个充满活力的人工智能时代重新定义互动、工作和联系。 学习目标 Gen AI Era概述:解释Generation AI(Gen AI)的概念及其在人工智能不断发展的背景下的重要性。 强调聊天机器人的作用:强调聊天机器人在Gen AI范式中的关键作用,展示其对沟通和互动的变革性影响。 探索LangChain的见解:深入研究LangChain博客文章“LangChain DemoGPT:迎接Generation AI应用的新时代”,提取有关整合聊天机器人和Gen AI的关键见解和启示。 预测未来趋势:预测聊天机器人技术在Gen AI时代的未来发展轨迹,概述可能塑造人工智能领域的趋势、创新和可能性。 提供实用见解:为对在自己的背景中利用聊天机器人感兴趣的读者提供实用建议和推荐,指导他们有效地应用这种技术。 本文作为数据科学博客马拉松的一部分发表。 从脚本化回应到类人交互的旅程…

Leave a Comment

学生最佳人工智能工具(2023年9月)

人工智能(AI)在教育领域有多个应用,包括开发交互式虚拟教室、生成“智能内容”、消除语言障碍、弥补知识差距以及为每个学生制定个性化的教学计划。学校中的人工智能市场预计在未来几年将达到数十亿美元。它在革命化教育体验的潜力方面的贡献导致了其迅猛崛起。 为此,一些具有前瞻性的企业正在开发人工智能技术。让我们探索学习环境中一些最有用的人工智能应用: Gradescope Gradescope是一个能够通过让学生相互评估并提供评论来节省时间的人工智能程序。机器学习(ML)和人工智能(AI)是Gradescope的核心,简化了评分过程,节省了时间和精力。教育工作者可以将Gradescope用作集中评分传统和数字评估、作业和项目的中心枢纽。通过外包,教育工作者可以将精力集中在更重要的工作上。 无法检测的人工智能 无法检测的人工智能是一种尖端工具,能够将被标记的人工智能内容转化为优质的、高质量的写作,与人类写作的内容无法区分。您是否担心人工智能检测器会标记您的内容?无法检测的人工智能是您的新秘密武器。有了这个工具,您可以轻松地将人工智能生成的文本转化为逼真、自然的内容,即使是最先进的人工智能检测器也会被愚弄。无法检测的人工智能不仅是一个内容创作工具,它还是市场上最先进的人工智能检测移除工具。它独特的算法旨在从您的文本中去除所有可识别的人工智能特征,确保它在每次人工智能检测检查中都能通过。忘记了内容创作的限制。通过无法检测的人工智能,您不仅仅获得了一个工具,还能在创造性之旅中享受完全自由。这个工具让您可以绕过人工智能内容检测器,消除了担心您的内容被标记或被识别为人工智能生成的内容的忧虑。 Quizgecko Quizgecko是一个由人工智能驱动的在线测试和测验制作工具,旨在满足企业、教育工作者和个人学习者的需求。它能够使用任何语言工作,将现有内容轻松转化为可定制的评估。从多项选择到填空题,用户可以轻松创建、共享和嵌入测验。无论是用于员工培训、课堂教学还是个性化学习,Quizgecko简化了流程,节省了时间并增强了参与度。 Aragon AI 利用Aragon轻松获得令人惊叹的专业头像。利用最新的A.I.技术,快速创建高质量的头像照片!无需预约摄影工作室或穿戴整齐。快速编辑和修饰您的照片,不用等上几天。收到40张高清照片,能够让您在找到下一份工作时获得优势。 Notion Notion通过利用其先进的人工智能技术来增加用户群体。他们的最新功能Notion AI是一个强大的生成式人工智能工具,可帮助用户完成诸如笔记摘要、会议中的行动项识别和创建和修改文本等任务。Notion AI通过自动化繁琐的任务、提供建议和模板来简化工作流程,最终简化和改善用户体验。 Hostinger AI网站生成器 Hostinger AI网站生成器提供直观的界面和先进的人工智能功能,旨在为任何目的创建网站。这个全面的平台简化了整个过程:只需注册、描述您的品牌,然后观看人工智能在几分钟内为您创建一个个性化的网站模板。作为学生,您可以使用这个平台创建项目网站、个人资料和作品集。 Nuance的Dragon语音识别 Nuance为教育机构开发和销售语音识别软件。对于写作或打字有困难的学生来说,该公司的Dragon语音识别工具可能会有所帮助,它可以每分钟转录160个单词。该程序可供特殊需求的儿童使用,可以使用语音命令进行文档导航。比打字速度快三倍以上,Dragon可以让您口述从课程计划和教学大纲到工作表和阅读清单的所有内容,成功率达到99%。 Grammarly 使用Grammarly来提升你的写作!它使用先进的人工智能技术,在包括Gmail、Facebook、Twitter、LinkedIn和短信在内的各个平台上帮助你准确地写作。无论是学生还是专业人士,Grammarly都是提高写作能力的有效解决方案。 Ivy Chatbot…

Leave a Comment

新加坡国立大学研究人员提出了IT3D:一种新的即插即用的文本到3D生成的改进AI方法

在文本到图像领域取得了显著的进展,引发了研究界对扩展到3D生成的热情。这种兴奋主要是由于出现了利用预训练的2D文本到图像扩散模型的方法。 在这个领域的一个重要发展是由Dreamfusion完成的创造性工作。他们引入了一种名为Score Distillation Sampling (SDS)算法的新方法,这种方法的差异很大,因为它可以从文本指令中创建许多不同的3D对象。尽管它革命性的方法,但它也存在一些挑战。一个重要的限制是其对生成模型的几何和纹理的控制,往往导致过饱和和模型的多面外观等问题。 此外,研究人员还注意到,仅仅通过加强文本指令来改善模型并不能提高效果。 为了应对这些挑战,研究人员提出了一种增强的3D生成方法。这种方法的核心是通过从所需的3D模型的不同角度创建多个图像,并使用这些图像重建3D对象。这个过程首先使用现有的文本到3D生成模型,如DreamFusion,创建对象的基本表示。通过制作这些初始模型,我们对对象的形状以及它在空间中的排列有一个基本的了解。然后,该方法使用图像到图像(I2I)生成过程来改进视图的图像。 IT3D为不同的3D输出表示提供了支持,例如网格和NeRFs,并且其额外的优势在于其能够使用文本输入改变3D模型的外观。上面的图像展示了IT3D的流程。从粗糙的3D模型开始,IT3D首先使用图像到图像的流程生成一个小的姿势数据集,该数据集的条件是基于粗糙的3D模型的渲染。然后,它结合一个随机初始化的鉴别器来从生成的数据集中提取知识,并使用鉴别损失和SDS损失更新3D模型。 此外,分析显示,这种方法可以加快训练过程,减少必要的训练步骤和可比较的总训练时间。从上面的图像我们可以看到,这种方法可以容忍高方差的数据集。最后,实证结果证明,所提出的方法在纹理细节、几何形状和文本提示与生成的3D对象之间的逼真度方面显著改善了基线模型。 这种技术确实为我们提供了一个对文本到3D生成的新视角,并成为改进文本到3D任务的GAN和扩散先验的第一个研究工作。

Leave a Comment

谷歌研究员推出𝗦𝘆𝗻𝘁𝗵𝗜𝗗:一种数字工具,用于给AI生成的图像添加水印和识别

在人工智能(AI)快速发展的领域中,生成模型正在创建几乎无法与传统手段捕捉到的照片逼真的图像。尽管这项技术释放出巨大的创造潜力,但也引发了对于虚假信息传播的担忧,以及区分AI生成内容和真实图像的需求。挑战在于识别这些AI生成的图像,因为它们可以用于传播准确和错误的信息,模糊了现实和模拟之间的界限。 目前,识别AI生成内容是一个重大挑战。传统的水印方法,如图章或半透明文本覆盖,可以很容易地被操纵或去除。元数据虽然有用,但在编辑过程中可以被篡改或丢失。现有的解决方案缺乏保证媒体完整性所需的强大性,在内容操纵变得越来越复杂的时代尤为如此。 欢迎使用SynthID,这是由Google DeepMind和Google Research共同开发的开创性工具,旨在为AI生成的图像添加水印并进行识别。这项革命性技术将一个不可见的数字水印直接嵌入图像的像素中,以便进行识别。SynthID的使命是使用户能够负责任地与AI生成的内容进行交互,并增强对数字媒体的信任。 SynthID利用了两个深度学习模型的力量,一个用于水印,另一个用于识别,两者都是在各种各样的图像上进行了训练。集成模型优化了多个目标,包括准确的水印识别和与原始图像的微妙水印对齐。这种嵌入式水印技术即使在像JPEG这样的格式中常见的颜色变化、滤镜或有损压缩等修改后,也能保持图像质量。 SynthID为解释水印识别结果提供了三个置信度级别。如果检测到数字水印,它表明图像的一部分很可能由Imagen生成。内部测试已经证明了SynthID在常见图像处理操作中的有效性,提高了它在现实场景中的鲁棒性和可靠性。 在一个AI生成内容与现实无缝融合的世界中,像SynthID这样的工具是促进信任和责任的重要一步。虽然不是对极端篡改的绝对解决方案,但SynthID的水印和识别方法是向识别AI生成图像迈出的有希望的步伐。Google对负责任的AI开发的承诺突显了该工具在超越图像以外的新兴AI模型和媒体模态方面的潜力。

Leave a Comment

OpenAI发布了ChatGPT Enterprise,搭载GPT-4的强大功能

OpenAI,先驱性的人工智能研究组织,刚刚在人工智能领域引入了一个令人兴奋的新篇章 – ChatGPT Enterprise。在其前身病毒性成功的基础上,这个尖端人工智能聊天机器人承诺将彻底改变企业与技术互动的方式。以增强的隐私、前所未有的速度和先进的功能为重点,ChatGPT Enterprise将重新定义企业人工智能解决方案的格局。 另请阅读:Microsoft Azure推出面向企业人工智能的ChatGPT 企业人工智能的新曙光 为了满足对复杂人工智能解决方案不断增长的需求,OpenAI推出了ChatGPT Enterprise。他们广受欢迎的AI聊天机器人的这个版本经过精心设计,以满足渴望隐私和性能完美融合的企业的独特需求。与其前身不同,ChatGPT Enterprise不仅仅是兑现了其承诺 – 它更进了一步。 另请阅读:VMware和NVIDIA合作革新企业生成型人工智能 ChatGPT Enterprise的威力 加固的安全和隐私:在数据隐私的关注下,ChatGPT Enterprise大步迈进,提供企业级安全和隐私功能。企业现在可以利用人工智能技术,同时保护其敏感信息免受窥视。 高速GPT-4访问:速度对于企业界至关重要。ChatGPT Enterprise秉承这一理念,提供闪电般快速的GPT-4访问。这个强化版聊天机器人确保快速响应,让团队在更短的时间内取得更多成果。 扩展上下文窗口:复杂的输入需要全面的上下文。ChatGPT Enterprise拥有扩展的上下文窗口,使其能够处理更长的输入。告别内容截断,迎接无缝交互。 高级数据分析能力:理解数据是决策的基石。ChatGPT Enterprise赋予企业先进的数据分析能力。从生成图表到解决复杂数学问题,这个功能对于数据驱动的组织来说是一个改变游戏规则的因素。 定制个性化:每个企业都有其独特的需求。OpenAI认识到这一点,并为ChatGPT…

Leave a Comment

S-Lab和NTU研究人员提出了Scenimefy:一种新颖的半监督图像到图像翻译框架,用于从现实世界图像生成高质量动漫场景渲染,填补了自动化方面的差距

动漫场景需要大量的创造才能和时间来创作。因此,基于学习的自动场景风格化方法的发展具有不可否认的实际和经济意义。由于生成对抗网络(GANs)的最新进展,自动风格化已经显著改善,但大部分研究仍主要集中在人脸上。尽管其巨大的研究价值,但从复杂的现实世界场景照片中创建高质量的动漫场景的过程仍然需要研究。由于几个因素,将现实世界的场景照片转换为动漫风格需要大量的工作。 1)场景的构图:图1说明了场景中前景和背景部分之间的层次关系,这些场景通常由几个以复杂方式连接的物品组成。 2)动漫的特点:图1显示了如何在草地、树木和云等自然环境中使用预设计的笔触来创建独特的纹理和精确的细节,这些纹理的有机和手绘特性使它们比之前的实验中的清晰边缘和均匀色块更具挑战性。 3)数据短缺和领域差距:高质量的动漫场景数据集对于弥合现实和动漫场景之间的差距至关重要。由于人脸和其他前景物品的大量存在,现有数据集质量较低,其美学与背景景观不同。 图1:动漫场景特点。在新海诚的2011年电影《追逐失落的声音的孩子们》中,可以看到草地和石头(前景)以及树木和云(背景)的手绘笔触,与清晰的边缘和平面表面形成鲜明对比。 无监督的图像转换方法是一种用于复杂场景风格化的流行方法,不需要配对的训练数据。尽管显示出有希望的结果,但现有的专注于动漫风格的技术在几个方面仍需改进。首先,复杂场景中缺乏像素级的相关性使得现有方法难以执行明显的纹理风格化同时保持语义含义,可能导致输出结果异常并包含明显的伪影。其次,某些方法无法产生动漫场景的精细细节。这是由于它们构建的动漫特定损失或预提取的表示,这些损失强制执行边缘和表面的平滑性。 为解决上述问题,南洋理工大学的S-Lab研究人员提出了Scenimefy,这是一种用于创建高质量动漫风格场景图片的独特的半监督图像转换流程。他们的主要建议是使用生成的伪配对数据将新的监督训练分支引入无监督框架,以解决无监督训练的缺点。他们利用StyleGAN的优势特性,通过对其进行微调,提供了真实和动漫之间的粗略配对数据或伪配对数据。 图2显示了Scenimefy生成的动漫场景渲染。上排:翻译后的图片;下排:翻译结果。 他们提供了一种全新的语义约束微调方法,利用了CLIP和VGG等丰富的预训练模型先验知识,指导StyleGAN捕捉复杂场景细节并减少过拟合。为了过滤低质量的数据,他们还提供了一种基于分割的数据选择技术。通过使用伪配对数据和独特的基于补丁的对比风格损失,Scenimefy在两个领域之间创建了细节,并学习了有效的像素级对应关系。他们的半监督框架在场景风格化的忠实性和保真度以及无监督训练分支之间寻求了一种理想的平衡。 他们还收集了一组高质量的纯动漫场景数据集来辅助训练。他们进行了大量测试,展示了Scenimefy的有效性,超越了行业对感知质量和定量评估的基准。以下是他们的主要贡献概述: • 他们提供了一个全新的、半监督的场景风格化框架,将实际照片转换为优质的动漫场景图像。他们的系统添加了独特的分块对比风格损失,以增强风格化和细节。 • 通过丰富的预训练先验指导,结合分割引导的数据选择方案,他们开发了一个新的语义约束的StyleGAN微调技术,产生了结构一致的伪配对数据,作为训练监督的基础。 • 他们收集了一组高分辨率的动漫场景,以辅助未来对场景风格化的研究。

Leave a Comment

遇见DevOpsGPT:一种将LLM与DevOps工具结合起来,将自然语言需求转化为可工作软件的多智能体系统

DevOpsGPT将大型语言模型(LLM)和DevOps工具结合起来,为软件开发提供了一个以人工智能驱动的自动化解决方案。DevOpsGPT可以将自然语言表达的需求转化为功能软件,从而提高效率,减少周期时间和降低沟通成本。 DevOpsGPT的工作原理 DevOpsGPT开始处理自然语言描述的用户需求。可以通过文本、语音和代码等多种方式输入这些规格。DevOpsGPT利用其LLM,在消费了这些规格后生成符合规格的代码。然后使用DevOps技术检查所创建的代码是否有错误,并确保满足用户的需求。有关详细信息,请访问GitHub页面。 主要特点 DevOpsGPT不仅提供以下优点,还提供以下优势和功能: DevOpsGPT支持多种编程语言,可以创建Python、Java、C++等代码。 DevOpsGPT具有适应性,可以根据任何企业的独特需求进行定制。 DevOpsGPT的可扩展性意味着它可以用于自动化大型公司的软件开发。 DevOps-GPT的好处 DevOpsGPT能够自动化多个软件开发过程,包括需求收集、文档编制和代码生成,从而提高生产力。这可以极大地提高开发生产力,并为开发人员提供更具创造性和战略性的工作机会。 通过自动化许多通常会减慢开发进程的流程,DevOpsGPT可以帮助缩短开发周期。因此,新的软件功能和产品可以更快地面向消费者。 DevOpsGPT能够将自然语言需求转化为代码的自动化过程,减少沟通成本。因此,在开发过程中更容易避免混淆和误解。 DevOpsGPT的自动代码检查功能有助于整个软件交付过程的质量。这有助于在开发的早期阶段发现和修复缺陷,从而得到更高质量的软件,并降低在生产环境中出现故障的风险。 限制 虽然DevOpsGPT提供了许多优势,但也有一些缺点。 DevOpsGPT仍在不断发展中,因此其正确性会随着需求的变化而改变。 DevOpsGPT可能不像人类开发人员那样具有创造力,因此可能需要帮助解决新问题。 DevOpsGPT应谨慎使用,因为它可能被滥用用于创建恶意代码。 DevOpsGPT是一种前沿的新解决方案,可以帮助企业提高开发生产力,缩短迭代时间,并减少沟通成本。通过自动化重复的操作,DevOpsGPT使程序员能够更多地投入战略性和创造性的工作中。这可以提高软件交付质量,并缩短推出新功能和产品的时间。

Leave a Comment

“遇见DenseDiffusion:一种无需训练的人工智能技术,用于解决文本到图像生成中的密集描述和布局操作问题”

最近,文本到图像模型的进展使得能够根据简短的场景描述生成高质量图像的复杂系统成为可能。然而,这些模型在面对复杂的标题时遇到困难,通常导致不同对象的视觉属性的遗漏或混合。在这一背景下,“密集”一词源于密集字幕的概念,其中利用单独的短语来描述图像中的特定区域。此外,用户在仅使用文本提示的情况下,在生成的图像中精确指定元素的排列也面临挑战。 最近的几项研究提出了通过训练或改进基于布局的文本到图像模型的解决方案,以赋予用户空间控制能力。虽然像“Make-aScene”和“Latent Diffusion Models”这样的特定方法从头开始构建具有文本和布局条件的模型,但其他同时进行的方法,如“SpaText”和“ControlNet”,通过微调将附加的空间控制引入现有的文本到图像模型。不幸的是,训练或微调模型可能需要大量计算资源。此外,模型需要为每个新颖的用户条件、领域或基本文本到图像模型重新训练。 基于上述问题,提出了一种名为DenseDiffusion的新型无训练技术,以适应密集字幕并提供布局操作。 在介绍主要思想之前,让我简要回顾扩散模型的工作原理。扩散模型通过顺序去噪步骤生成图像,从随机噪声开始。噪声预测网络估计添加的噪声并尝试在每个步骤中呈现更清晰的图像。最近的模型通过减少去噪步骤的数量,以更快的速度生成结果,而不会显著损害生成的图像。 最先进的扩散模型中有两个重要的模块,即自注意力和交叉注意力层。 在自注意力层中,中间特征还可以作为上下文特征。这通过在不同区域涵盖图像令牌之间建立连接来实现全局一致的结构的创建。同时,交叉注意力层根据从输入文本标题中获取的文本特征进行自适应,使用CLIP文本编码器进行编码。 回到主题上,DenseDiffusion的主要思想是修订的注意力调节过程,如下图所示。 首先,对预训练的文本到图像扩散模型的中间特征进行审查,以揭示生成图像的布局与自注意力和交叉注意力图之间的显著相关性。根据这一见解,基于布局条件动态调整中间注意力图。此外,该方法还考虑了原始注意力评分范围,并根据每个区域的面积微调调节程度。在展示的工作中,作者展示了DenseDiffusion提高了“稳定扩散”模型的性能,并在密集字幕、文本和布局条件以及图像质量方面超过多个组合扩散模型。 以下图片显示了从研究中选择的样本结果。这些视觉效果提供了DenseDiffusion和最先进方法之间的比较概述。 这是DenseDiffusion的概要,这是一种新的无训练的AI技术,用于适应密集字幕并在文本到图像合成中提供布局操作。

Leave a Comment

谷歌研究人员介绍了RO-ViT:一种简单的人工智能方法,以区域感知的方式预训练视觉变换器,以提高开放词汇检测能力

近年来的进步使计算机能够像人类视觉一样解释和理解来自世界的视觉信息。它涉及处理、分析和从图像和视频中提取有意义的信息。计算机视觉使需要视觉解释的任务自动化,减少了手动干预的需要。目标检测是一项计算机视觉任务,涉及在图像或视频帧中识别和定位多个感兴趣的对象。 目标检测的目标是确定场景中存在哪些对象,并提供关于它们在图像中的位置的信息。大多数现代目标检测器依赖于区域和类别标签的手动注释,这限制了它们的词汇量大小,并使进一步扩展变得昂贵。 与此相反,可以使用视觉语言模型(VLM)来填补图像级预训练和对象级微调之间的差距。然而,在这些模型的预训练过程中,需要充分利用对象/区域的概念。 Google Brain的研究人员提出了一种简单的模型来填补图像级预训练和对象级微调之间的差距。他们提出了区域感知开放词汇视觉变换器(RO-ViT)来完成这个任务。 RO-ViT是一种简单的方式,以区域感知的方式预训练视觉变换器,用于开放词汇对象检测。标准的预训练需要完整的图像位置嵌入。相反,研究人员随机裁剪和调整位置嵌入的区域,而不是使用整个图像的位置嵌入。他们称这种方法为“裁剪位置嵌入”。 团队展示了使用聚焦损失的图像-文本预训练比现有的softmax CE损失更有效。他们还提出了各种新颖的目标检测技术。他们认为,现有方法在对象提议阶段经常会错过新颖的对象,因为这些提议通常需要更加平衡。 该团队表示,他们的模型RO-ViT在LVIS开放词汇检测基准测试中达到了最先进的水平。他们的统计数据显示,在12个图像-文本检索基准测试指标中,它在9个指标上取得了最好的成绩。这反映出在区域级别上学到的表示对开放词汇检测非常有益且高效。 随着目标检测技术的不断发展,负责任的开发、部署和监管将至关重要,以确保其积极影响的最大化,同时减轻潜在风险。总体而言,目标检测技术的持续进步有望通过革新产业、提高安全和生活质量,并实现曾被视为科幻的创新,为更加光明的未来做出贡献。 查看论文和Google博客。该研究的所有荣誉归于该项目的研究人员。还请不要忘记加入我们的29k+ ML SubReddit、40k+ Facebook社群、Discord频道和邮件订阅,我们会分享最新的人工智能研究新闻、有趣的人工智能项目等。 如果你喜欢我们的工作,你会喜欢我们的新闻通讯.. 这篇文章最初发表于MarkTechPost。

Leave a Comment

威斯康星大学麦迪逊分校的研究人员提出了Eventful Transformers:一种成本效益高、准确度损失最小的视频识别方法

最初用于语言建模的Transformer最近被研究人员作为一种可能的视觉相关任务架构来进行研究。视觉Transformer在目标识别、图片分类和视频分类等应用中具有最先进的性能,在各种视觉识别问题上表现出色。视觉Transformer的高计算成本是其主要缺点之一。与标准卷积网络(CNN)相比,视觉Transformer有时需要更高的计算量,每张图片高达数百GFlops。视频处理中涉及的大量数据进一步增加了这些开销。这种有趣的技术的潜力受到了高计算需求的限制,这些需求阻止了视觉Transformer在资源有限或需要低延迟的设备上的使用。 这项工作由威斯康星大学麦迪逊分校的研究人员提出,旨在利用连续输入之间的时间冗余来降低视觉Transformer在处理视频数据时的成本。想象一下将视觉Transformer逐帧或逐段应用于视频序列。这个Transformer可能是一个简单的逐帧模型(如目标检测器)或者是一个时空模型中的过渡阶段(如初始分解模型)。与语言处理不同,他们将Transformer视为应用于时间上的几个不同输入(帧或片段),而不是代表整个序列的一个Transformer输入。自然电影具有很高的时间冗余度和帧间变化很小的特点。然而,尽管如此,深度网络(如Transformer)在每一帧上都经常被“从头开始”计算。 这种方法是低效的,因为它丢弃了先前结论中任何可能有用的数据。他们的主要观点是,他们可以通过重复使用先前时间步骤的中间计算来更好地利用冗余序列。智能推理。视觉Transformer(和深度网络一般)的推理成本通常由设计确定。然而,现实世界应用中可用的资源可能随着时间的推移而发生变化(例如,由于竞争进程或电源供应的变化)。因此,需要能够实时修改计算成本的模型。适应性是这项研究的主要设计目标之一,该方法旨在提供对计算成本的实时控制。有关他们如何在电影中更改计算预算的示例,请参见图1(下部分)。 图1:该策略利用了连续模型输入之间的时间重叠。 (上)他们仅检测和更新在每个Transformer块中随时间发生重大变化的令牌。 (下)他们的解决方案在提高效率的同时提供了对运行时计算成本的精细控制。 以前的研究已经研究了CNN的时间冗余和适应性。然而,由于Transformer和CNN之间存在重大的架构差异,这些方法通常与Transformer的视觉不兼容。尤其是,Transformer引入了一种新的原语——自注意力,这与多个基于CNN的方法有所不同。尽管存在这些障碍,视觉Transformer提供了巨大的可能性。将CNN的稀疏性增益(特别是通过考虑时间冗余所获得的稀疏性)转化为明显的加速是具有挑战性的。要做到这一点,必须对稀疏结构设置大约束条件,或者使用特殊的计算核心。相比之下,由于Transformer操作的本质是围绕令牌向量的操作,因此将稀疏性转化为更短的运行时间使用传统操作符更简单。具有事件的Transformer。 为了促进有效的自适应推理,他们提出了一种称为Eventful Transformers的新型Transformer,该Transformer利用输入之间的时间冗余。 “Eventful”一词是为了描述被称为事件相机的传感器,它们在响应场景变化时创建稀疏输出。Eventful Transformers选择性地在每个时间步更新令牌表示和自注意力图,以跟踪令牌级别的变化。门控模块是Eventful Transformer中的块,允许对更新的令牌数量进行运行时控制。他们的方法适用于各种视频处理应用,并可以用于预先构建的模型(通常无需重新训练)。他们的研究表明,基于当前最先进模型创建的Eventful Transformers可以大大降低计算成本,同时基本保持原始模型的准确性。 他们的源代码包含了用于创建Eventful Transformers的PyTorch模块,并向公众开放。Wisionlab的项目页面位于wisionlab.com/project/eventful-transformers。他们在CPU和GPU上展示了加速的实际时间。从技术角度来看,他们基于标准PyTorch操作符的方法可能不是最佳选择。他们确信通过进一步减少开销(例如构建用于门控逻辑的融合CUDA内核)可以进一步提高加速比。此外,他们的方法会导致一定的内存开销。毫不奇怪,保留某些张量在内存中是必要的,以便重用之前时间步骤的计算。 查看论文。本研究的所有功劳归功于该项目的研究人员。此外,别忘了加入我们的29k+机器学习SubReddit,40k+ Facebook社区,Discord频道和电子邮件通讯,我们在那里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 如果你喜欢我们的工作,你会喜欢我们的通讯。 这篇文章来自威斯康星大学麦迪逊分校的研究人员,提出了Eventful Transformers:一种在视频识别中成本效益高且准确度损失最小的方法。该文章最初发表于MarkTechPost。

Leave a Comment

LLM会取代知识图谱吗?元研究人员提出“头对尾”:一种衡量大型语言模型事实知识的新基准

大型语言模型因其超强的能力而受到了很多赞赏。它们能够模仿人类并生成与人类类似的内容。预训练的大型语言模型(LLMs),例如ChatGPT和LLaMA,展示了惊人的理解材料和回答常见问题的能力。一些研究已经证明了它们吸纳知识和回答问题的能力。尽管LLMs取得了显著进展,但它们经常缺乏对特定领域细微差别的复杂理解,并容易产生错误信息,即幻觉。这突显了提高LLM准确性和减少幻觉回答发生率的重大障碍。 与LLMs相关的讨论主要集中在三个主要领域,即减少LLM生成的幻觉回答、提高LLMs的事实准确性以及推测LLMs是否最终可能取代知识图谱(KGs)作为以符号格式存储世界知识的手段。最近,来自Meta Reality Labs的研究人员采用了一种新方法来回答这些问题,试图确定LLMs实际拥有多少信息。 在回答LLMs在知识方面掌握程度的问题时,团队讨论了两个方面。首先,直接问一个LLM所包含的知识可能是困难的。即使知识已经并入模型的参数中,幻觉可能是由于缺乏知识或发生故障的生成模型引起的。研究建议使用正确性作为评估LLM内知识程度的指标。这涉及评估模型回答清晰准确的问题的能力,例如“篮球运动员迈克尔·乔丹出生在哪里?”LLM还被要求提供简洁的回答,并在自信度较低时使用“unsure”一词表示不确定。 其次,没有一个能够准确反映用户兴趣多样性或世界信息广度的便利基准。即使是最全面的知识图谱在知识方面也存在空白,特别是在涉及较不知名的事实时。主要LLMs或搜索引擎的查询日志并不公开。 为了解决所有的限制,团队引入了一个他们创建的基准,名为“Head-to-Tail”。该基准包括18,000个问题-回答(QA)对,根据其各自主题的受欢迎程度被划分为头部、躯干和尾部事实。这些类别反映了不同的公众熟悉程度。团队创建了一种自动化评估方法和一组能够反映LLM已经有效吸收的知识广度的度量标准,以评估LLMs所保持的知识。 研究的核心是评估对公众可用的14个LLMs。结果显示,现有的LLMs在完善其对事实数据的理解方面仍需要显著改进。这尤其适用于属于躯干到尾部区域并涉及较不知名组织的信息。 总之,这项研究使用最近提出的基准和尖端评估技术考察了LLMs的事实知识。该研究通过解决重要的研究问题和概述具体发现,对于关于大型语言模型在整合事实信息方面的可靠性和未来发展的持续讨论做出了重大贡献。

Leave a Comment