Press "Enter" to skip to content

Tag: Technology

彻底改变癌症检测:萨里大学在机器学习中推出具有革命性意义的基于草图的物体检测工具

自史前时代以来,人们一直使用素描进行交流和记录。在过去的十年中,研究人员在理解如何使用分类和合成的素描方面取得了巨大的进展,以及更新颖的应用,如建模视觉抽象、样式转移和连续笔画拟合。然而,只有基于素描的图像检索(SBIR)及其细粒度对应物(FGSBIR)研究了素描的表现潜力。最近的系统已经成熟,可用于商业应用,这是素描表现力可能产生重大影响的极好证明。 素描非常引人入胜,因为它们自动捕捉微妙和个人的视觉线索。然而,对人类素描的这些内在特质的研究一直局限于图像检索领域。科学家们首次训练系统使用素描的表现力来完成视觉中最基本的任务:检测场景中的物体。最终产品是一个基于素描检测物体的框架,因此可以将注意力集中在一群斑马中的特定“斑马”(例如吃草的斑马)。此外,研究人员要求模型在以下情况下成功: 在没有预期结果的情况下进入测试(零射击)。 不需要额外的边界框或类标签(如完全监督)。 研究人员进一步规定,基于素描的检测器也以零射击的方式运作,增加了系统的新颖性。在接下来的部分中,他们详细介绍了如何将物体检测从封闭集转换为开放词汇配置。例如,物体检测器使用原型学习而不是分类头,编码查询素描特征作为支持集。然后,在弱监督物体检测(WSOD)环境中,通过所有可想象的类别或实例的原型之间的多类交叉熵损失进行模型训练。物体检测在图像级别上操作,而SBIR是通过对单个对象的素描和照片进行配对训练的。因此,SBIR对象检测器训练需要在对象级别和图像级别特征之间建立桥梁。 研究人员的贡献是: 培养人类素描表现力对物体检测的影响。 基于素描构建的物体检测器可以理解试图传达的信息。 用于传统类别级别和实例级别检测的物体检测器。 一种新的提示学习配置,将CLIP和SBIR结合起来生成一个素描感知的检测器,可以在没有边界框注释或类标签的情况下以零射击方式运行。 结果优于零射击设置中的SOD和WSOD。 研究人员没有从头开始,而是展示了基础模型(如CLIP)和为基于素描的图像检索(SBIR)构建的现有素描模型之间的直观协同作用,它们已经可以优雅地解决该任务。特别是,他们首先在SBIR模型的素描和照片分支上分别进行单独的提示,然后使用CLIP的泛化能力构建高度可泛化的素描和照片编码器。为了确保检测到的框的区域嵌入与SBIR素描和照片的嵌入匹配,他们设计了一种训练范式来调整学习的编码器以进行项目检测。在工业标准物体检测数据集(包括PASCAL-VOC和MS-COCO)上进行测试时,该框架在零射击设置中的表现优于监督(SOD)和弱监督(WSOD)物体检测器。 总之 为了改进物体检测,研究人员积极倡导人类素描表现力。建议的素描启用物体识别框架是一个实例感知和部件感知的物体检测器,可以理解素描中试图表达的信息。因此,他们设计了一种创新的提示学习设置,将CLIP和SBIR结合起来,教育一个不需要边界框注释或类标签的素描奖励检测器。该检测器还被指定为可以在各种用途中以零射击方式运行。另一方面,SBIR是通过对单个物品的素描和照片进行配对训练的。他们使用数据增强方法来增加对破坏的抵抗力和对词汇外的泛化能力,以帮助弥合物体和图像级别之间的差距。在零射击设置中,所得框架的表现优于监督和弱监督物体检测器。

Leave a Comment

你口袋里的艺术家伙伴:SnapFusion 是一种人工智能方法,将扩散模型的能力带到移动设备上

扩散模型。如果您一直关注人工智能领域的进展,您一定经常听到这个术语。它们是使生成式人工智能方法革命成为可能的关键。我们现在有了可以在几秒钟内使用文本提示生成逼真图像的模型。它们已经革新了内容生成、图像编辑、超分辨率、视频合成和3D资产生成。 尽管这种印象深刻的性能并不便宜。扩散模型在计算要求方面非常苛刻。这意味着您需要真正高端的GPU才能充分利用它们。是的,也有尝试让它们在本地计算机上运行,但即使如此,您也需要高端计算机。另一方面,使用云提供商可能是一种替代方案,但在这种情况下,您可能会冒着隐私风险。 然后,我们还需要考虑到的是即时性。对于大多数人来说,他们花在手机上的时间比花在计算机上的时间更长。如果您想在移动设备上使用扩散模型,那么祝您好运,因为它对设备本身的有限硬件功率要求过高。 扩散模型是下一个大事,但在将它们应用于实际应用程序之前,我们需要解决它们的复杂性。已经有多次尝试专注于加速移动设备上的推理,但它们没有实现无缝的用户体验或定量评估生成质量。好吧,这是一个故事,直到现在,因为我们有一个新的玩家进入领域,它的名字叫做SnapFusion。 SnapFusion是首个在移动设备上生成图像的文本到图像扩散模型,时间不到2秒。它优化了UNet架构并减少了去噪步骤的数量,以提高推理速度。此外,它使用了不断发展的训练框架,引入了数据蒸馏管道,并在步骤蒸馏过程中增强了学习目标。 SnapFusion概览。来源: https://arxiv.org/pdf/2306.00980.pdf 在对结构进行任何更改之前,SnapFusion的作者首先研究了SD-v1.5的架构冗余性,以获得高效的神经网络。然而,由于高昂的培训成本,将传统剪枝或架构搜索技术应用于SD是具有挑战性的。架构的任何更改都可能导致性能下降,需要进行大量的微调和大量的计算资源。因此,这条路被堵住了,他们不得不开发替代解决方案,可以在逐渐提高其效率的同时保持预训练UNet模型的性能。 为了增加推理速度,SnapFusion专注于优化UNet架构,这是有条件扩散模型中的瓶颈。现有的作品主要关注后训练优化,但是SnapFusion确定了架构冗余并提出了一个不断发展的训练框架,其表现优于原始的稳定扩散模型,同时显著提高了速度。它还引入了一个数据蒸馏管道,以压缩和加速图像解码器。 SnapFusion包括一个强大的训练阶段,在该阶段应用随机前向传播以执行每个交叉关注和ResNet块,并具有一定的概率。这种强大的训练增强确保网络对架构排列具有容忍性,从而允许准确评估每个块和稳定的架构演变。 通过使用通过通道缩减获得的解码器的合成数据来训练解码器,可以实现高效的图像解码器。该压缩解码器具有显著较少的参数,并且比SD-v1.5的解码器更快。蒸馏过程涉及使用文本提示生成两个图像,一个来自高效解码器,另一个来自SD-v1.5,以获得从SD-v1.5的UNet中获得的潜在表示。 提出的阶段蒸馏方法包括一个香草蒸馏损失目标,旨在最小化学生UNet的预测和教师UNet的嘈杂潜在表示之间的差异。此外,引入了CFG感知蒸馏损失目标,以提高CLIP分数。CFG引导预测在教师和学生模型中使用,其中CFG比例是随机抽样的,以在训练期间在FID和CLIP分数之间提供权衡。 SnapFusion生成的样本图像。来源:https://arxiv.org/pdf/2306.00980.pdf 由于改进的阶段蒸馏和网络架构开发,SnapFusion可以在移动设备上不到2秒的时间内从文本提示生成512×512像素的图像。生成的图像展示了与最先进的稳定扩散模型相似的质量。

Leave a Comment

认识 MeLoDy:一种高效的文本到音频扩散模型,用于音乐合成

音乐是由和谐、旋律和节奏组成的艺术,渗透到人类生活的各个方面。随着深度生成模型的蓬勃发展,音乐生成近年来受到了广泛关注。作为一类重要的生成模型,语言模型(LMs)在建模复杂的长期上下文关系方面表现出了非凡的建模能力。基于此,AudioLM和许多后续工作成功地将LMs应用于音频合成。与基于LM的方法相似,扩散概率模型(DPMs)作为另一类竞争性的生成模型,也表现出了合成语音、声音和音乐的卓越能力。 然而,从自由形式文本生成音乐仍然具有挑战性,因为允许的音乐描述可以是多种多样的,与流派、乐器、节奏、情境,甚至一些主观感受有关。 传统的文本到音乐生成模型通常关注于特定的属性,如音频延续或快速采样,而有些模型则优先考虑稳健的测试,这有时是由领域内的专家(例如音乐制作人)进行的。此外,大多数模型都是在大规模的音乐数据集上训练的,并且展示了最新的生成性能,具有高保真度和对文本提示各种方面的忠实度。 然而,这些方法的成功,如MusicLM或Noise2Music,带来了高计算成本,这将严重妨碍它们的实用性。相比之下,基于DPMs构建的其他方法使高质量音乐的有效采样成为可能。然而,他们所展示的案例相对较小,并且显示了有限的内部动态。为了实现可行的音乐创作工具,生成模型的高效性至关重要,因为它有助于与人类反馈进行交互式创作,正如先前的研究所述。 尽管LMs和DPMs都显示出了很好的结果,但相关问题并不是是否应该优先选择其中一种,而是是否可能同时利用两种方法的优势。 根据上述动机,提出了一种称为MeLoDy的方法。该策略的概述如下图所示。 在分析MusicLM的成功后,作者利用MusicLM中最高级别的LM,称为语义LM,来模拟音乐的语义结构,确定旋律、节奏、动态、音色和节奏的整体安排。在这种语义LM的条件下,他们利用DPMs的非自回归性质,借助成功的采样加速技术,高效有效地模拟声学。 此外,作者提出了所谓的双通道扩散(DPD)模型,而不是采用经典的扩散过程。事实上,对原始数据进行处理会指数增加计算费用。提出的解决方案是将原始数据降低到低维潜在表示。减少数据的维数会减少对操作的影响,从而减少模型运行时间。随后,原始数据可以通过预先训练的自编码器从潜在表示中重构出来。 模型产生的一些输出样本可在以下链接中获得:https://efficient-melody.github.io/。目前该代码尚未发布,这意味着目前无法在线或本地尝试它。 这就是MeLoDy的概述,这是一种生成最先进音质的高效LM引导扩散模型。如果您有兴趣,可以在下面的链接中了解更多关于这种技术的信息。

Leave a Comment

谷歌研究人员推出了AudioPaLM:一款改变语音技术的游戏规则——一种新的大型语言模型,具有史无前例的准确听、说和翻译能力

大型语言模型(LLMs)近几个月来备受瞩目。作为人工智能领域最好的进展之一,这些模型正在改变人类与机器交互的方式。由于每个行业都在采用这些模型,它们是人工智能接管世界的最佳例证。 LLM在生成文本方面表现出色,尤其是在涉及复杂交互和知识检索的任务中,最著名的例子是OpenAI开发的基于GPT 3.5和GPT 4转换器架构的ChatGPT聊天机器人。除了文本生成外,像CLIP(对比性语言-图像预训练)这样的模型也已经被开发出来,用于图像生成,可以根据图像内容创建文本。 为了在音频生成和理解方面取得进展,谷歌的研究人员介绍了AudioPaLM,这是一个大型语言模型,可以处理语音理解和生成任务。 AudioPaLM结合了两个现有模型的优点,即PaLM-2模型和AudioLM模型,以产生一个统一的多模态架构,可以处理和生成文本和语音。这使得AudioPaLM可以处理各种应用,从语音识别到语音转文本。 虽然AudioLM擅长维护诸如讲话者身份和语气之类的语言信息,但是PaLM-2,即基于文本的语言模型,专门处理文本特定的语言知识。通过结合这两个模型,AudioPaLM利用了PaLM-2的语言专业知识和AudioLM的语言信息保留,从而更全面地理解和创建文本和语音。 AudioPaLM利用联合词汇表,可以使用有限的离散标记表示语音和文本。将这个联合词汇表与标记任务描述相结合,可以在各种基于语音和文本的任务上训练单个仅解码器模型。传统上,语音识别,文本到语音合成和语音到语音翻译等任务是由分开的模型处理的,现在可以统一到单个架构和训练过程中。 在评估中,AudioPaLM在语音翻译方面的表现超过了现有系统。它展示了零-shot语音到文本翻译的能力,可以准确地将语音翻译为以前未遇到过的语言,从而为更广泛的语言支持开辟了可能性。AudioPaLM还可以基于简短的语音提示跨语言传递声音,并可以捕捉和复制不同语言中的不同声音,从而实现语音转换和适应。 该团队提到的关键贡献是: AudioPaLM利用了文本预训练中PaLM和PaLM-2s的能力。 它在自动语音翻译和语音到语音翻译基准方面取得了SOTA结果,并在自动语音识别基准方面表现出色。 该模型通过声音传递实现了声音到声音的翻译,超越了现有方法在语音质量和声音保留方面。 AudioPaLM通过执行未见过的语言组合的自动语音翻译来展示了零-shot能力。 总之,AudioPaLM是一个统一的LLM,通过利用基于文本的LLM的能力和结合音频提示技术来处理语音和文本,是LLM列表中值得期待的新成员。

Leave a Comment

塑造人工智能未来:视觉-语言预训练模型及其在单模态和多模态任务中的作用综述

在机器智能研究的最新发表论文中,一组研究人员深入探讨了视觉语言预训练(VLP)及其在多模态任务中的应用。该论文探讨了单模态训练的思想以及它与多模态适应性的不同之处。然后,该报告展示了VLP的五个重要领域:特征提取、模型架构、预训练目标、预训练数据集和下游任务。然后,研究人员回顾了现有的VLP模型以及它们如何在不同领域上进行适应和发展。 人工智能领域一直试图以与人类相同的方式对模型进行训练,让它们像人类一样感知、思考和理解模式和细微差别。各种尝试已经被做出来,以尽可能多地纳入数据输入领域,如视觉、音频或文本数据。但大多数这些方法都试图以单模态的方式解决“理解”的问题。 单模态方法是一种方法,在这种方法中,您只考虑一个方面来评估一种情况,例如在视频中,您只关注其音频或转录,而在多模态方法中,您尝试针对尽可能多的可用特征,并将它们纳入模型中。例如,在分析视频时,您会考虑音频、转录和说话者的面部表情,以真正“理解”上下文。 多模态方法本身具有挑战性,因为它需要大量的资源,并且需要大量的标记数据来训练能力强的模型。基于变压器结构的预训练模型通过利用自监督学习和附加任务从大规模无标记数据中学习通用表示来解决了这个问题。 以单模态方式预先训练模型,例如在NLP中的BERT,已经通过有限标记数据的微调表现出了显着的有效性。研究人员通过将相同的设计理念扩展到多模态领域来探索视觉语言预训练(VLP)的可行性。VLP使用预训练模型在大规模数据集上学习模态之间的语义对应关系。 研究人员回顾了VLP方法在五个主要领域中取得的进展。首先,他们讨论了VLP模型如何预处理和表示图像、视频和文本以获得相应的特征,并突出了使用的各种模型。其次,他们还探讨了单流和双流融合以及仅编码器与编码器-解码器设计的可用性和使用情况。 本文还更多地探讨了VLP模型的预训练,将其归类为完成、匹配和特定类型。这些目标很重要,因为它们有助于定义通用的视觉语言表示。研究人员还概述了预训练数据集的两个主要类别:图像语言模型和视频语言模型。该论文强调多模态方法如何帮助在理解上下文和生成更好映射内容方面实现更好的理解和准确性。最后,本文介绍了VLP中下游任务的目标和细节,强调它们在评估预先训练模型的有效性方面的重要性。 https://link.springer.com/content/pdf/10.1007/s11633-022-1369-5.pdf https://link.springer.com/content/pdf/10.1007/s11633-022-1369-5.pdf 本文提供了SOTA VLP模型的详细概述。它列出了这些模型并强调了它们的主要特点和性能。提及和覆盖的模型是前沿技术发展的坚实基础,也可作为未来发展的基准。 根据研究论文,VLP架构的未来看起来很有前途和可靠性。他们提出了各种改进领域,例如整合声学信息、知识和认知学习、快速调整、模型压缩和加速以及域外预训练。这些改进领域旨在激发新时代的研究人员在VLP领域取得突破性进展。

Leave a Comment

认识BITE:一种新的方法,可以从一张图像中重建3D狗的形状和姿势,即使是像坐着和躺着这样具有挑战性的姿势

许多领域,包括生物学和保护,以及娱乐和虚拟内容的开发,都可以从捕捉和建模三维动物形态和态度中受益。因为它们不需要动物保持静止,保持特定的姿势,与观察者进行身体接触或执行任何其他协作任务,相机是观察动物的自然传感器。利用照片研究动物已经有很长的历史,例如著名的“马在奔跑”动态摄影。然而,与早期的人体三维形状和姿态研究不同,最近开发了能够根据动物的独特形状和姿势进行改变的表现性三维模型。在这里,他们专注于从单张照片中重建三维狗的挑战。 他们将狗作为模型物种的原因是因为它们具有强烈的四足样的关节变形和品种之间广泛的形状变化。狗经常被相机捕捉到。因此,各种姿势,形状和设置都很容易获取。建模人和狗可能在外观上具有相似的困难,但它们呈现出非常不同的技术难题。人们已经可以获得大量的三维扫描和动作捕捉数据。由于数据涵盖了正确的姿势和形态变量,因此学习像SMPL或GHUM这样的鲁棒,关节模型已经成为可能。 相反,收集动物的三维观察数据是具有挑战性的,目前需要更多此类数据来训练同样具有表现力的三维统计模型,以考虑所有可能的形态和位置。现在,由于SMAL(从玩具模型中学习的参数化四足动物模型),已经可以从照片中重建动物的三维模型,包括狗。然而,SMAL是许多物种的通用模型,从猫到河马。虽然它可以描绘不同动物的许多体型,但它却不能描绘狗品种的独特和微小细节,例如巨大的耳朵范围。为了解决这个问题,ETH苏黎世联邦理工学院,德国智能系统Max Planck研究所和IMATI-CNR研究所的研究人员提供了第一个D-SMAL参数化模型,可以正确地表示狗。 另一个问题是,与人类相比,狗的动作捕捉数据相对较少,并且存在的数据中,坐姿和躺姿很少被捕捉到。因此,当前的算法很难推断狗的某些姿势。例如,从历史数据中学习三维姿势的先验知识将会偏向于站立和行走姿势。通过利用通用约束,可以减弱这个先验知识,但是姿势估计会变得严重不确定。为了解决这个问题,他们使用了物理接触的信息,这是建模动物(土地)时被忽视的信息,例如它们受重力影响,因此会站立,坐下或躺在地上。 在存在广泛自遮挡的情况下,他们展示了如何使用地面接触信息来估计复杂的狗的姿势。虽然地面平面限制已经用于人体姿势估计,但对于四足动物来说,潜在的优势更大。四条腿意味着更多的接触点,坐或躺下时更多的身体部位被遮挡,以及更大的非刚性变形。早期研究的另一个缺点是重建管道通常是在2D图片上进行训练的,因为收集配对的3D数据(带有匹配的2D图像)具有挑战性。因此,他们经常预测位置和形状,当重新投影时,与视觉证据非常相似,但沿着观察方向被扭曲。 由于缺乏配对数据,所以在从不同角度观察时,三维重建可能是错误的,因为没有足够的信息来确定在深度方向上放置更远或甚至被遮挡的身体部位的位置。再次,他们发现模拟地面接触是有益的。他们不再手动重建(或合成)配对的2D和3D数据,而是转向更宽松的三维监督方法,并获取地面接触标签。他们要求注释者指示狗下面的地表是否平坦,并在三维动物上注释地面接触点。他们通过向注释者呈现真实的照片来实现这一点。 图1 显示了BITE如何能够从单个输入图像中估计狗的三维形态和态度。该模型能够处理各种品种和类型,以及超出训练姿势范围的困难姿势,包括坐在地上或躺在地上。 他们发现,网络可以从单个图像中准确地学习分类表面和检测接触点,以便它们也可以在测试时使用。这些标签不仅用于训练。基于最新的前沿模型BARC,他们的重建系统称为BITE。他们使用新颖的D-SMAL狗模型作为初始粗配步骤重新训练BARC。随后,他们将结果预测发送到他们最近创建的精细化网络,使用接地损失进行训练,以改善相机的设置和狗的姿态。他们还可以在测试时使用接地损失,以完全自主地优化对测试图片的适配。 这大大提高了重建的质量。即使BARC姿势先验的训练集不包含这样的姿势,他们也可以使用BITE得到正确站在(局部平面)地面上或以坐姿和躺姿逼真重建的狗(见图1)。以往的3D狗重建工作要么是通过主观视觉评估,要么是通过反投影到图片并评估2D残差来评估,因此投影掉了与深度相关的不准确性。他们通过从不同的视角生成实际犬只的3D扫描,制作了一个独特的半合成数据集,以弥补客观3D评估的缺失。他们使用这个新数据集评估BITE及其主要竞争对手,证明BITE为该领域建立了新的标准。 他们的贡献总结如下: 1.他们提供了D-SMAL,这是一个从SMAL发展出来的全新的、针对犬只的3D姿势和形状模型。 2.他们创建了BITE,这是一个神经模型,旨在提高3D狗姿势的同时评估局部地面平面。BITE鼓励具有说服力的接地。 3.他们证明了在使用该模型之前,可以恢复与之编码非常不同的狗的位置(必须很小的先验)。 4.使用复杂的StanfordExtra数据集,他们改进了单目3D姿势估计的最新技术水平。 5.为了促进向真正的3D评估的过渡,他们提供了一个基于实际犬只扫描的新的半合成3D测试集合。

Leave a Comment

ChatGPT的大惊喜:OpenAI创建了一个人工智能市场

OpenAI推出人工智能市场 OpenAI是ChatGPT聊天机器人背后的聪明头脑,该公司再次成为头条新闻。根据The Information的独家报道,该公司计划通过推出创新的市场来彻底改变人工智能行业。这个新平台将赋予开发者展示并销售他们基于OpenAI先进技术构建的人工智能模型的能力。 还可阅读:OpenAI的突破性解决方案:确保AI模型的逻辑并消除幻觉 量身定制适用于现实世界的人工智能 使用ChatGPT的企业一直在对其转化业务的潜力感到惊叹。由于能够针对特定用例定制技术,企业一直在利用其力量来打击金融欺诈、提供市场洞察力等等。OpenAI认识到了这种需求,并计划通过创建一个平台,让开发者向其他企业提供他们定制的人工智能模型。 还可阅读:OpenAI为所有Plus用户推出ChatGPT插件|学习如何启用它们 OpenAI CEO公开雄心勃勃的计划 在最近在伦敦举行的开发者聚会上,OpenAI首席执行官Sam Altman公开了公司潜在市场概念,令与会者大为震惊。The Information的报告揭示了Altman的披露,引起了在场所有人的兴趣和兴奋。OpenAI有望通过这个大胆的冒险对人工智能领域产生重大影响。 还可阅读:Sam Altman与印度总理纳伦德拉·莫迪的关键会谈:规划印度的人工智能未来 挑战科技巨头应用商店的竞争者 如果OpenAI的计划得以实现,它可能对已经建立起来的科技巨头应用商店构成重大威胁。像Salesforce和Microsoft这样的行业领导者运行着自己的应用商店,为各种软件解决方案提供服务。然而,通过OpenAI的市场,开发者将有机会直接向客户展示他们的人工智能模型,从而可能扩展OpenAI革命性技术的影响范围。 还可阅读:Microsoft和OpenAI就AI集成发生冲突 知名企业关注OpenAI的市场 The Information还透露,一些有影响力的公司有兴趣参与OpenAI的市场。据报道,著名的制造商软件提供商Aquant正在考虑在平台上提供其ChatGPT驱动的人工智能模型。此外,流行的教育应用程序制造商Khan Academy正在探索利用市场来展示其尖端的人工智能模型。 ChatGPT的惊人崛起和对行业的影响 自去年发布以来,ChatGPT在各个行业的企业中见证了非凡的采用率。该软件迅速成为自动化任务和增强运营效率的首选解决方案。随着公司竞相利用人工智能的潜力,ChatGPT的先进大型语言模型(LLMs)已成为一个备受追捧的工具,使组织能够向客户提供卓越的新能力。 我们的看法 OpenAI计划推出人工智能市场,将重新定义行业,并彻底改变开发者展示和销售他们的人工智能模型的方式。这个新的冒险可能会挑战来自科技巨头现有应用商店的竞争者。此外,这对寻求创新人工智能解决方案的开发者和企业都有巨大的承诺。请继续关注OpenAI改变我们所知道的人工智能领域的旅程的更多更新。

Leave a Comment

认识 Paella:一种新的 AI 模型,类似于扩散,可以比使用稳定扩散更快地生成高质量图像

过去2-3年,使用人工智能(AI)从文本生成图像的研究质量和数量出现了惊人的增长。在这个领域里最具突破性和革命性的工作之一是指最先进的生成模型——扩散模型。这些模型通过利用深度学习算法的能力,完全改变了如何使用文本描述生成高质量图像的方法。此外,除了扩散模型,还存在一系列功能强大的其他技术,提供了一条生成接近照片般逼真的视觉内容的令人兴奋的路径。然而,这些最先进技术取得的杰出成果也有一定的局限性。许多新兴的生成AI技术依赖于扩散模型,这需要复杂的架构和大量的计算资源进行训练和图像生成。这些先进的方法还降低了推理速度,使它们在实时实现方面不切实际。此外,这些技术的复杂性直接与它们所实现的进步相关,这对公众掌握这些模型的内部工作方式构成了挑战,从而导致它们被视为黑匣子模型。 为了解决前面提到的问题,德国Technische Hochschule Ingolstadt和Wand Technologies的研究人员提出了一种新颖的文本条件图像生成技术。这种创新技术与扩散类似,但生成高质量图像的速度更快。这个基于卷积的模型的图像采样阶段可以仅使用12个步骤完成,同时仍能产生出色的图像质量。这种方法因其显著的简单性和降低的图像生成速度而脱颖而出,从而允许用户对模型进行条件设置,并享受现有最先进技术中缺乏的优势。所提出的技术的固有简单性已经显著提高了其可访问性,使来自不同背景的个人能够轻松掌握和实施这种文本到图像技术。为了通过实验评估验证他们的方法,研究人员还训练了一个名为“Paella”的文本条件模型,该模型具有惊人的10亿个参数。该团队还在MIT许可证下开源了其代码和模型权重,以鼓励围绕他们的工作进行研究。 扩散模型经历了一个学习过程,逐步从每个训练实例中消除不同程度的噪声。在推理过程中,当呈现出纯噪声时,模型通过逐步减少几百个步骤的噪声来生成图像。德国研究人员设计的技术在很大程度上借鉴了这些扩散模型的原理。像扩散模型一样,Paella从代表图像的标记中去除不同程度的噪声,并利用它们生成新图像。该模型在LAION-5B美学数据集的900 million个图像-文本对上进行了训练。Paella使用基于卷积神经网络的预训练编码器-解码器体系结构,能够使用来自预训练期间学习的8192个标记集的256个标记来表示256 x 256的图像。为了在训练阶段为其示例添加噪声,研究人员还在此列表中包括了一些随机选择的标记。 为了基于图像的文本描述生成文本嵌入,研究人员利用了CLIP(对比语言-图像预训练)模型,该模型建立了图像和文本描述之间的联系。然后,采用U-Net CNN体系结构来训练模型生成完整的原始标记,利用先前迭代中生成的文本嵌入和标记。这个迭代过程重复了12次,每次逐渐替换以前生成的标记的一小部分。在剩余生成的标记的指导下,U-Net逐步减少每个步骤的噪声。在推理过程中,CLIP基于给定的文本提示产生一个嵌入,U-Net为随机选择的256个标记的完整集合重构了所有标记12次。最后,解码器利用生成的标记生成图像。 为了评估他们的方法的有效性,研究人员采用了Fréchet inception距离(FID)指标来比较Paella模型和稳定扩散模型得到的结果。虽然结果略微偏向稳定扩散,但Paella在速度方面具有显著优势。这项研究突出了先前的努力,因为它专注于完全重新配置架构,这在以前并未考虑过。总之,与现有的模型相比,Paella可以使用更小的模型大小和更少的采样步骤生成高质量的图像,仍然可以实现可观的结果。研究团队强调了他们方法的易用性,该方法提供了一个简单的设置,可以被从不同背景中的个人轻松采用,包括非技术领域,因为随着时间的推移,生成AI领域越来越受到关注。

Leave a Comment

ChatGPT的哲学课程:这项AI研究探讨LLMs在对话代理中的行为

2023年是LLMs的年份。ChatGPT,GPT-4,LLaMA等新的LLM模型正在接连抢占聚光灯。这些模型已经彻底改变了自然语言处理领域,并越来越广泛地应用于各个领域。 LLMs具有展现广泛行为的显著能力,包括进行对话,这可以导致与类似人类的谈话者进行交谈的引人注目的幻觉。然而,重要的是要认识到,基于LLM的对话代理在几个方面与人类存在显着差异。 我们的语言技能是通过与世界的具体互动发展起来的。我们作为个体,通过社交化和沉浸在语言用户社区中获得认知能力和语言能力。这一过程在婴儿身上发生得更快,随着我们长大,我们的学习过程变慢,但基础仍然相同。 相比之下,LLMs是在大量人类生成的文本上进行训练的无体神经网络,其主要目标是基于给定的上下文预测下一个单词或标记。它们的训练围绕着从语言数据中学习统计模式,而不是通过直接体验物理世界。 尽管存在这些差异,但我们倾向于用LLMs来模仿人类。我们在聊天机器人、助手等方面使用这种方法。然而,这种方法带来了一个具有挑战性的困境。我们如何描述和理解LLMs的行为? 使用熟悉的民间心理学语言是很自然的,像使用“知道”、“理解”和“思考”这样的术语来描述对话代理,就像我们对待人类一样。然而,当这些语言被过分字面地理解时,这种语言会促进拟人化,夸大了AI系统和人类之间的相似之处,同时掩盖了它们的深刻差异。 那么我们如何应对这个困境?我们如何为AI模型描述“理解”和“知道”这些术语?让我们来看看“角色扮演”论文。 在这篇论文中,作者提出采用替代概念框架和隐喻来有效地思考和谈论基于LLM的对话代理。他们主张使用两个主要隐喻:将对话代理视为扮演单一角色或作为可能角色的多元超定位的模拟集合。这些隐喻提供了不同的角度来理解对话代理的行为,并具有其独特的优势。 自回归采样的示例。来源:https://arxiv.org/pdf/2305.16367.pdf 第一个隐喻将对话代理描述为扮演具体角色。当给定提示时,代理尝试以与分配的角色或人物相匹配的方式继续对话。它旨在根据与该角色相关联的期望进行回应。 第二个隐喻将对话代理视为来自各种来源的不同角色的集合。这些代理已经接受了广泛的材料培训,如书籍、脚本、采访和文章,这使它们对不同类型的角色和情节有很多了解。随着对话的进行,代理根据其训练数据调整其角色和人物,使其能够适应并以角色回应。 对话代理中的轮流发言的示例。来源:https://arxiv.org/pdf/2305.16367.pdf 通过采用这个框架,研究人员和用户可以探索对话代理人的重要方面,如欺骗和自我意识,而不会错误地将这些概念归因于人类。相反,重点转向理解对话代理人在角色扮演场景中的行为以及它们可以模仿的各种角色。 总之,基于LLM的对话代理人具有模拟人类对话的能力,但它们与实际人类语言用户有很大的不同。通过使用替代隐喻,比如将对话代理人视为角色扮演者或模拟的组合,我们可以更好地理解和讨论它们的行为。这些隐喻为基于LLM的对话系统的复杂动态提供了洞见,使我们能够欣赏它们的创造潜力,同时认识到它们与人类的根本区别。

Leave a Comment

红猫和雅典娜AI开发了具有夜视功能的智能军用无人机

领先的军事技术公司Red Cat Holdings, Inc.在与Athena AI的合作中实现了一个里程碑。合作带来了人工智能(AI)和计算机视觉技术在Teal 2军用无人机上的显著进展。利用最先进的技术,Red Cat和Athena AI赋予指挥官在战场上前所未有的决策支持,特别是在夜间。这一突破性发展承诺彻底改革军用无人机操作,确保增强态势感知并为战士提供不公平的优势。 另请参阅:Palantir推出军事决策人工智能平台 第二阶段成功:夜间目标识别和战斗跟踪 Red Cat最初于三月宣布与Athena AI的合作,专门针对Teal 2军用无人机。在最近完成的第二阶段中,Athena AI的先进技术已成功处理了Teal 2热成像传感器记录的夜间测试飞行视频。结果是一个出色的目标识别和战斗跟踪能力。在人工智能的帮助下,指挥官们现在可以在战斗的白热化阶段迅速做出明智决策,从而在战场上获得显著的优势。 另请参阅:战场革命:英美澳通过AI无人机试验推动界限 Teal 2的夜间计算机视觉能力:划时代的改变 Red Cat子公司Teal Drones的创始人兼首席执行官George Matus对支持夜间计算机视觉能力的新Teal 2附加组件表示热情洋溢。此功能专为需要在夜间任务期间获取关键数据的用户设计。Matus赞扬Athena AI的技术为提供出色的图像和洞察力。…

Leave a Comment

2023年最佳人工智能工具——产品经理必备

人工智能市场的快速扩张令人惊讶和惊叹。除了提高产品经理的生产力外,新开发的技术还可能促使完全新的职业的出现。然而,当有成千上万的工具可以使用,而每周还有更多的工具到来时,很容易感到不知所措。 ClickUp  ClickUp是一款全能的项目管理工具,可以促进各种规模和领域的团队之间更好的沟通。ClickUp是领先的产品管理解决方案,因为它的适应性和简单易用性,可以用于产品创建和规划等任务。它是一个高度灵活的平台,具有许多预制的产品团队模板,用于产品规划、路线图和新产品发布。ClickUp的适应性和有用的工具使得任何团队都可以将平台定制为自己的需求和工作流程的细微差别。 Jam  JamGPT是一款尖端的人工智能工具,帮助产品经理理解问题并找到潜在的解决方案,他们可以将其传达给工程团队。他们的生产力增加,他们对技术讨论的获取也扩展了。JamGPT提供上下文给非技术产品经理的能力,无论是通过深入的解释还是快速的TLDR,都有助于在各个级别推出功能。它通过将智能AI助手和主要错误报告功能收集的有价值的数据与项目管理工具(如ClickUp、Slack或Github)集成,简化了产品改进的共享和工作流程。 Motion Motion是一款聪明的工具,利用人工智能创建每日日程表,考虑到您的会议、任务和项目。告别计划的麻烦,迎接更加高效的生活。 ChatGPT  通过提供与大多数问题相关的答案,ChatGPT成为产品经理中最受欢迎的自然语言处理(NLP)工具之一,提供比搜索引擎查询更好的体验。由产品经理进行的测试表明,结果对他们提出的问题非常敏感。 ChatGPT的适应性是一个主要卖点。回答独特问题以增强产品增长、客户服务等。它对产品经理很有帮助,因为它可以分析提交的数据,识别客户痛点,提供下一个要开发的产品的想法,并进行情感分析。 Canva  Canva的免费图片生成器使得产品经理在日常工作中更容易看到它的用处。在与利益相关者的会议、产品发布等场合,寻找适当的视觉效果一直很困难。通常情况下,你有一个清晰的心理画面,但可用的库存照片需要进行修改。借助Canva的AI驱动编辑器,您可以进行主题头脑风暴并调整搜索结果,直到找到理想的视觉效果,所有这些都基于您的输入,以保持一致的高质量内容安排。 TLDV  说实话:作为一个产品经理,你的大部分时间都会花在会议中。无论是向利益相关者推销新的产品特性,还是试图向工程团队销售它,一个强有力的演示文稿都至关重要。TLDV是一个AI程序,通过将会议记录和摘要总结为要点,帮助您更加高效地工作。如果您想从用户的访谈中获得最大的收益,您需要能够专注于他们而不必担心做笔记。TLDV可以让你做到这一点。 Notion  最受欢迎的笔记应用程序之一Notion最近进行了升级,拥有了尖端的人工智能功能。这意味着产品经理可以通过利用能够提高沟通效率并减少在总结等重复性工作上花费的时间的能力,建立业务wiki和产品路线图来享受他们的日常工作流程。 Otter.AI Otter.ai是一个人工智能驱动的平台,可以促进会议和讨论的准确记录和转录。它利用人工智能即时转录对话,并创建可搜索、可访问和加密的笔记,可以轻松共享。Otter可以自动加入和记录Zoom、Microsoft Teams和Google Meet会议。重点突出,任务分配,生成可轻松共享和回忆的摘要。在iOS、Android和Chrome上使用Otter的用户都认为它是一个有用的时间节省器。许多用户赞扬它的准确性、多样性(它可以从不同的发言人转录)和节省时间的自动幻灯片捕获功能。 Collato 你的团队在大量纸质文件中无法追踪特定产品信息吗?Collato 是你的团队的人工智能助手,跟踪所有需要随时可用并仅需一键点击的信息。产品经理可以将各种技术同步和集成到单个可视化地图中,从而减少信息孤岛。与每次必要的产品路线图文档丢失浪费 30 分钟不同,你将在一个方便的位置访问到所需的一切。…

Leave a Comment

DeepMind研究人员开源TAPIR:一种新的人工智能模型,用于跟踪视频序列中的任何点(TAP),有效跟踪查询点

计算机视觉是人工智能领域中最受欢迎的领域之一。使用计算机视觉开发的模型能够从不同类型的媒体中提取有意义的信息,无论是数字图像、视频还是其他视觉输入。它教会了机器如何感知和理解视觉信息,然后根据细节采取行动。随着一种名为追踪任何点(TAPIR)的新模型的推出,计算机视觉取得了重大进步。TAPIR的目标是有效地跟踪视频序列中的特定兴趣点。 TAPIR模型由Google DeepMind、VGG、工程科学系和牛津大学的研究人员团队开发,其算法包括两个阶段——匹配阶段和精炼阶段。在匹配阶段,TAPIR模型单独分析每个视频序列帧,以寻找适合查询点的候选点匹配。这一步旨在确定查询点在每个帧中的最可能相关点,为了确保TAPIR模型能够跟踪查询点在视频中的运动,这个过程是逐帧进行的。 在确定候选点匹配的匹配阶段之后,TAPIR模型使用精炼阶段。在这个阶段中,TAPIR模型基于局部相关性更新轨迹(查询点所在路径)和查询特征,因此考虑到每个帧中的周围信息,以提高跟踪查询点的准确性和精度。通过集成局部相关性,精炼阶段提高了模型精确跟踪查询点的能力,并调整视频序列中的变化。 为了评估TAPIR模型,该团队使用了TAP-Vid基准测试数据集,它是用于视频跟踪任务的标准化评估数据集。结果显示,TAPIR模型的表现明显优于基线技术。使用称为平均Jaccard(AJ)的度量衡量的性能改进显示,TAPIR模型在DAVIS(密集注释视频分割)基准测试中的AJ相对于其他方法实现了约20%的绝对改进。 该模型旨在便于快速并行推理长视频序列,即它可以同时处理多个帧,提高跟踪任务的效率。该团队提到,该模型可以实时应用,使其能够处理和跟踪添加新视频帧的点。它可以在256×256视频上跟踪256个点,速度约为每秒40帧(fps),还可以扩展以处理更高分辨率的电影,使其具有处理各种大小和质量的视频的灵活性。 该团队为用户提供了两个在线Google Colab演示,以尝试TAPIR而无需安装。第一个Colab演示允许用户在自己的视频上运行模型,提供交互式体验以测试和观察模型的性能。第二个演示重点介绍如何在线运行TAPIR。此外,用户可以通过克隆提供的代码库,在现代GPU上跟踪自己的网络摄像头上的点并实时运行TAPIR。

Leave a Comment

50+全新前沿人工智能工具(2023年7月)

AI工具正在快速发展,新的工具不断推出。查看下面一些可以增强您日常工作的AI工具。 tl;dv 这个工具由GPT模型提供动力,是Zoom和Google Meet的会议记录器。 tl;dv 为用户转录和总结通话。 Otter AI Otter.AI使用人工智能,为用户提供实时会议笔记转录,这些笔记可共享、可搜索、易于访问和安全。 Taskade Taskade是一款AI生产力工具,可帮助用户高效地管理任务和项目。 Notion AI Notion AI是一款写作助手,可以帮助用户在Notion工作区内写作、头脑风暴、编辑和总结。 Bing 微软推出了AI驱动的Bing搜索引擎,就像在搜索网络时拥有研究助手、个人计划师和创意伙伴。 Bard Bard是由Google开发的聊天机器人,可帮助提高生产力并将想法变为现实。 Forefront Forefront AI是一个平台,提供GPT-4、图像生成、自定义角色和可共享聊天等免费访问,从而为企业提供了改进的效率和用户体验。 Merlin Merlin是一个ChatGPT扩展程序,可帮助用户在任何网站上完成任何任务,提供博客摘要和Gmail AI写手等功能。…

Leave a Comment

认识Seal:一种AI框架,通过利用2D视觉基础模型对大规模3D点云进行自监督学习,追求“分割任何点云序列”

大型语言模型(LLMs)已经成为了人工智能领域的热门话题。它们近期的影响和惊人的表现已经帮助医疗保健、金融、娱乐等各个行业做出了很大的贡献。像 GPT-3.5、GPT 4、DALLE 2 和 BERT 这样的知名 LLMs,也被称为基础模型,可以执行非凡的任务,通过提供一个简短的自然语言提示,为我们生活带来了独一无二的内容。 最近的视觉基础模型(VFMs)如 SAM、X-Decoder 和 SEEM 在计算机视觉方面取得了许多进展。虽然 VFMs 在 2D 感知任务方面取得了巨大的进步,但 3D VFM 研究仍需要改进。研究人员建议扩展当前的 2D VFMs 用于 3D 感知任务。一个关键的…

Leave a Comment

马克斯·普朗克研究所的研究人员提出了一种名为 MIME 的生成式 AI 模型,该模型采用 3D 人体动作捕捉数据,并生成与动作一致的可信 3D 场景

人类总是与周围环境互动。他们在空间中移动,触摸物品,坐在椅子上或睡在床上。这些互动详细说明了场景设置和物体位置。默剧演员利用他们对这种关系的理解,仅凭身体动作创造富有想象力的3D环境。他们能教计算机模仿人类动作并制作合适的3D场景吗?包括建筑、游戏、虚拟现实和合成合成数据的多个领域可能会从这种技术中受益。例如,有大量的3D人体运动数据集,例如AMASS,但这些数据集很少包含有关它们采集的3D设置的详细信息。 他们能够使用AMASS为所有动作创建可信的3D场景吗?如果可以,他们可以使用AMASS创建具有现实人类-场景互动的训练数据。他们开发了一种新颖的技术,称为MIME(挖掘互动和运动以推断3D环境),它基于3D人体运动创建可信的内部3D场景,以响应此类查询。它是如何实现的?以下是基本假设:(1)空间内的人体运动表示物品的缺失,从本质上定义了图片中没有家具的区域。此外,它在接触场景时限制了3D物体的种类和位置;例如,坐着的人必须坐在椅子、沙发、床等上。 图1:从人类运动中估计3D场景。他们使用3D人体运动(左侧)重新创建出现过的现实3D设置,例如从运动捕捉或身体穿戴传感器中获得的运动。他们的生成模型能够生成多种逼真的场景(右侧),其中考虑了人与场景的适当互动,包括人的位置和姿势。 德国智能系统Max Planck研究所和Adobe的研究人员创建了MIME,这是一种基于变压器的自回归3D场景生成技术,以将这些直觉转化为具体形式。给定一个空的平面图和一个人体运动序列,MIME预测人体将接触到的家具。此外,它预测不会与人接触但与其他物品相匹配并符合人体运动带来的自由空间限制的可信物品。他们将运动分为接触和非接触片段,以为人体运动条件3D场景创建。他们使用POSA估计可能的接触姿势。非接触姿势将脚的顶点投射到地面平面上,以建立房间的自由空间,并将其记录为2D地图。 POSA预测的接触顶点创建反映接触姿势和相关的3D人体模型的3D边界框。满足接触和自由空间标准的对象被期望自回归使用此数据作为变压器的输入;参见图1。他们扩展了大规模合成场景数据集3D-FRONT,创建了一个名为3D-FRONT HUMAN的新数据集,以训练MIME。他们自动向3D场景中添加人物,包括非接触人物(一系列步行动作和站立的人)和接触人物(坐、接触和躺着的人)。为此,他们使用RenderPeople扫描的静态接触姿势和AMASS的运动序列。 MIME在推理时间为输入运动创建逼真的3D场景布局,表示为3D边界框。他们从3D-FUTURE集合中选择3D模型,然后根据人的位置和场景之间的几何限制微调它们的3D位置。他们的方法在不进行任何调整的情况下适用于已记录的真实运动序列,例如PROX-D。 总之,它们提供以下内容: • 一款全新的运动条件生成模型,用于自动回归地创建与人接触但避免占据运动定义空位的物品的3D房间场景。 • 通过使用来自AMASS的运动数据和RenderPeople的静态接触/立姿姿势,创建了一个由互动人物和自由空间中的人物组成的全新3D场景数据集。 他们的代码和视频演示均可在GitHub上获得。他们还有一个视频解释他们的方法。

Leave a Comment

ChatGPT 像智能对话机器人智能助手一样,知道什么该说,什么不该说

生成人工智能(AI)已经成为科技界的中心,但在严格控制的互联网环境中的操作仍然笼罩在神秘之中。然而,一家中国科技公司360安全技术最近揭示了其ChatGPT-like服务“智能脑”(Zhinao)如何应对中国严格的审查制度。让我们深入探索这个揭开面纱的过程,了解生成AI如何适应审查制度。 另请阅读:中国提出的AI法规震动行业 介绍智能脑:中国的“智能大脑”ChatGPT-like技术 在北京的一场盛大仪式上,360安全技术推出了其开创性的AI聊天机器人Zhinao,也被称为“智能大脑”。创始人兼董事长周鸿祎揭示了技术的关键方面,强调了其嵌入式的“多级过滤和审核”系统。这个系统对确保符合中国严格的审查规定至关重要。 即时停止:精确处理敏感词汇 Zhinao一个引人注目的特点是,如果用户输入“敏感词汇”,它能够立即终止对话。该公司策划了一个全面的被禁止的词汇或短语列表,通过人工审核员的努力和公安部门的监管不断更新。这种严格的控制机制展示了生成AI如何适应中国审查制度的要求。 另请阅读: 仅邀请访问:加强内容安全性 360安全技术采用了中国科技巨头普遍的限制政策,通过邀请码提供对其聊天机器人的访问。通过采用这种方法,公司确保对使用其生成AI产品的人员拥有更大的控制权。内容安全被誉为Zhinao的一个重要优势,符合中国维护对在线内容严格监管的承诺。 另请阅读:中国对人工智能风险发出警报 遵守当地法律和道德准则 周鸿祎强调,在开发大型语言模型和生成AI时,遵守当地法律、法规、道德和传统的重要性。他强调,无论这些技术是在哪个国家开发的,遵守这些因素都是至关重要的。周的声明强调了将AI输出与本地规范和价值观保持一致的重要性。 另请阅读:美国国会采取行动:两项新法案提议对人工智能进行监管 中国的监管环境:控制生成AI的一步 4月,中国网络安全管理局(CAC)推出了管理生成AI的草案规则。这些规定要求在每个AI产品公开发布之前进行安全评估,禁止聊天机器人生成涉及政权颠覆、暴力、色情或破坏经济和社会秩序的内容。尽管这些规则尚未正式实施,但表明中国努力塑造其境内AI技术的发展和部署。 另请阅读:欧盟通过AI规则表态 战略回避:避免敏感问题 包括百度的Ernie Bot在内的中国ChatGPT风格的服务已经实现了特定的功能来回避回答敏感问题。当被问及中国的民主问题时,Ernie Bot机智地回避了这个话题,称它还没有学会如何回答这个问题。这种回避性的回答展示了遵守中国严格审查规则所需的小心翼翼的机动性。 另请阅读:Ernie Bot vs. ChatGPT:AI语言模型的比较分析 中国追赶的积极前景…

Leave a Comment

解决ChatGPT偏见的背包:背包语言模型是变压器的替代AI方法

AI语言模型正在成为我们生活中必不可少的一部分。几十年来,我们一直使用谷歌来获取信息,但现在,我们正慢慢地转向ChatGPT。它提供简洁的答案、清晰的解释,通常更快地找到我们所寻找的信息。 这些模型从我们多年来产生的数据中学习。因此,我们将我们的偏见传递给了AI模型,这是该领域的一个争议话题。一个特别引起关注的偏见是代词分布中的性别偏见,其中模型倾向于根据上下文喜欢使用带有性别色彩的代词,如“他”或“她”。 解决这种性别偏见对于确保公平和包容的语言生成至关重要。例如,如果你以“CEO认为…”开头的句子,模型会继续使用他,如果你用护士代替CEO,下一个标记就变成了她。这个例子是一个有趣的案例研究,可以研究偏见并探索缓解偏见的方法。 事实证明,上下文在塑造这些偏见方面起着至关重要的作用。通过用与不同性别相关联的职业代替CEO,实际上可以翻转观察到的偏见。但是,这里的挑战在于:实现在CEO出现的所有不同上下文中的一致去偏见并不容易。我们希望的是可靠和可预测的干预措施,无论特定情况如何,它们都能起作用。毕竟,在理解和改善语言模型方面,可解释性和控制性是关键。不幸的是,当前的Transformer模型虽然在性能方面令人印象深刻,但并不完全符合这些标准。他们的上下文表示引入了各种复杂和非线性的影响,这些影响取决于手头的上下文。 那么,我们该如何克服这些挑战?我们如何解决我们在大型语言模型中引入的偏见?我们应该改进Transformer,还是应该提出新的结构?答案是Backpack Language Models。 Backpack LM通过利用称为感觉向量的非上下文表示来解决去偏见代词分布的挑战。这些向量捕捉单词意义的不同方面以及其在不同上下文中的角色,使单词具有多种个性。 Backpack LM概述。来源:https://arxiv.org/pdf/2305.16765.pdf 在Backpack LMs中,预测是非上下文表示的对数线性组合,称为感觉向量。词汇表中的每个单词都由多个感觉向量表示,编码单词在不同上下文中的不同学习方面。这些感觉向量在特定上下文中具有特定的专业性,并且可以具有预测性。序列中单词的感觉向量的加权和形成每个单词的Backpack表示,权重由作用于整个序列的上下文化函数确定。通过利用这些感觉向量,Backpack模型实现了在所有上下文中表现出可预测干预的精度。 这意味着我们可以对模型进行非上下文的更改,以始终影响其行为。与Transformer模型相比,Backpack模型提供了一个更透明和可管理的接口。它们提供了更易于理解和控制的精确干预措施。此外,Backpack模型在性能方面也不会有所妥协。事实上,它们在提供增强可解释性的同时也能够达到与Transformers相当的结果。 感觉向量示例。来源:https://backpackmodels.science/ Backpack模型中的意义向量编码了丰富的词义概念,在词汇相似性任务上表现优于最先进的Transformer模型中的词嵌入。此外,对意义向量的干预,例如减少专业词汇中的性别偏见,展示了Backpack模型提供的控制机制。通过缩小与性别偏见相关联的意义向量,在有限的场景中可以实现显著降低上下文预测差异。

Leave a Comment

了解LLM-Blender:一种新的集成框架,通过利用多个开源大型语言模型(LLMs)的多样强项,实现持续优异的性能

大型语言模型在各种任务中表现出了卓越的性能。从生产独特且有创意的内容和提出问题答案,到翻译语言和概括文本段落,LLM在模拟人类方面非常成功。一些知名的LLM,如GPT、BERT和PaLM,因准确遵循指令和访问大量高质量数据而成为头条新闻。像GPT4和PaLM这样的模型不是开源的,这阻止了任何人了解其架构和训练数据。另一方面,像Pythia、LLaMA和Flan-T5这样的开源LLM提供了一个机会,让研究人员在自定义指令数据集上微调和改进模型。这使得像Alpaca、Vicuna、OpenAssistant和MPT这样的更小更高效的LLM得以开发。 市场上没有一个单一的开源LLM处于领先地位,而不同例子的最佳LLM可能会有很大的差异。因此,为了不断为每个输入产生改进的答案,动态整合这些LLM是必要的。通过整合各种LLM的独特贡献,可以减少偏见、误差和不确定性,从而产生更符合人类偏好的结果。为了解决这个问题,来自艾伦人工智能研究所、南加州大学和浙江大学的研究人员提出了LLM-BLENDER,这是一个集成框架,通过利用多个开源大型语言模型的许多优势,始终获得卓越的性能。 LLM-BLENDER由两个模块组成——PAIRRANKER和GENFUSER。这些模块表明,不同例子的最佳LLM可能会有很大的差异。第一个模块PAIRRANKER被开发出来,用于识别潜在输出之间微小的变化。它使用先进的成对比较技术,其中原始文本和来自各种LLM的两个候选输出作为输入。为了共同编码输入和候选对,它利用交叉注意力编码器,如RoBERTa,PAIRRANKER可以使用这种编码来确定两个候选的质量。 第二个模块GENFUSER专注于合并排名靠前的候选项以生成更好的输出。它最大程度地利用所选候选项的优点,同时最小化它们的缺点。GENFUSER旨在通过合并各种LLM的输出来开发优于任何一个LLM的输出。 为了评估,团队提供了一个称为MixInstruct的基准数据集,它结合了Oracle成对比较和各种指令数据集。该数据集使用11个流行的开源LLM为各种遵循指令的任务生成多个输入的候选项。它包括训练、验证和测试示例,具有自动评估的Oracle比较。这些Oracle比较已用于为候选输出排名,从而可以评估LLM-BLENDER和其他基准技术的性能。 实验结果表明,LLM-BLENDER在各种评估参数上的表现要比单独的LLM和基准技术好得多。它建立了一个相当大的性能差距,并表明采用LLM-BLENDER集成方法可以产生比单个LLM或基准方法更高质量的输出。PAIRRANKER的选择在基于参考的度量和GPT-Rank方面的表现优于单个LLM模型。通过高效的融合,GENFUSER通过利用PAIRRANKER的首选项显著提高了响应质量。 LLM-BLENDER还优于像Vicuna这样的单个LLM,因此展示了通过集成学习来改进LLM部署和研究的巨大潜力。

Leave a Comment

如何评估内容:最新更新

谷歌是世界领先的搜索引擎,已在理解和适应人工智能(AI)技术方面取得了重大进展。在最近的谷歌搜索中心直播东京2023活动中,Gary Illyes和其他专家分享了有关谷歌处理AI生成内容的方法的宝贵见解。在本文中,我们将深入探讨谷歌对AI内容的政策,并探讨内容评估中的E-E-A-T(体验、专业知识、权威性和可信度)概念。 谷歌搜索中心直播东京2023:AI内容见解 在谷歌搜索中心直播东京2023活动期间,包括Gary Illyes在内的业内专家揭示了谷歌最新的有关AI生成内容的观点和建议。该活动为内容创作者和发布者讨论AI的挑战和机遇提供了平台。 还阅读:Google I/O 2023发生了什么? 对于谷歌来说,内容质量优先,AI是否重要无关紧要 无论内容是由AI生成还是人类创造,谷歌都非常重视内容质量。谷歌专注于向用户提供相关、有价值且值得信赖的信息。因此,内容的质量比其创建方法更重要。 没有区别:谷歌不标记AI生成的内容 虽然有些人会想知道谷歌是否区分AI生成和人类创建的内容,但答案是否定的。谷歌不会明确标记AI生成的内容。这强调了谷歌评估内容的承诺,仅根据其价值和相关性进行评估,而不考虑其来源。 还阅读:AI检测器将美国宪法标记为AI生成 欧盟呼吁标记AI生成的内容 在打击假新闻的背景下,欧盟敦促社交媒体公司自愿标记AI生成的内容。然而,谷歌没有对发布者强制执行任何此类标记要求,选择将内容质量置于标记之上。 还阅读:欧盟呼吁采取措施识别Deepfakes和AI内容 谷歌建议标记AI生成的图像 谷歌建议出版商使用IPTC图像数据元数据标记AI生成的图像,尽管这不是强制性的。这种方法确保透明度并帮助用户识别AI生成的视觉内容。此外,图像AI公司正在开发自动添加元数据的方法,简化发布者的流程。 还阅读:Google推出StyleDrop:令人惊艳的视觉设计技巧 判断:出版商决定标记AI生成的文本 与图像不同,谷歌不要求出版商标记AI生成的文本内容。相反,谷歌将其留给出版商自行决定是否将文本内容标记为AI生成,以增强整体用户体验。这种灵活的方法认识到内容的不同性质,并尊重出版商的判断。 人类内容仍然在谷歌排名中占主导地位 强调人类生成内容的重要性,谷歌重申其算法和排名信号主要设计用于评估和优先考虑自然、人类创造的内容。这确保了在其各自领域具有经验、专业知识和权威性的个人创作的内容始终处于谷歌排名的前沿。 还阅读:格莱美奖禁用AI:人类创作者成为中心 理解E-E-A-T:内容评估的关键因素…

Leave a Comment

一组来自中国的研究人员开发了WebGLM:一种基于通用语言模型(GLM)的网络增强问答系统

大型语言模型(LLMs),包括GPT-3、PaLM、OPT、BLOOM和GLM-130B,极大地推动了计算机在语言理解和生成方面的可能性。其中最基本的语言应用之一,即问答,由于最近LLM的突破而得到了显着改进。根据现有研究,LLMs的闭书QA和上下文学习QA的表现与受监督模型相当,这有助于我们对LLMs的记忆能力的理解。但即使是LLMs也有限制,当面对需要大量特殊知识的问题时,它们无法达到人类的期望。因此,最近的尝试集中在构建增强了外部知识(包括检索和在线搜索)的LLMs上。 例如,WebGPT能够进行在线浏览,对复杂问题提供详细的答案和有用的参考。尽管它很受欢迎,但原始的WebGPT方法尚未被广泛采用。首先,它依赖于对浏览轨迹、精心撰写的响应和答案偏好标注的许多专家级注释,所有这些都需要昂贵的资源、大量的时间和广泛的培训。其次,通过告诉系统与Web浏览器交互,给出操作指令(如“搜索”、“阅读”和“引用”),然后从在线来源收集相关材料,行为克隆方法(即模仿学习)需要其基本模型GPT-3类似于人类专家。 最后,Web浏览的多轮结构需要大量的计算资源,并且对于用户体验来说可能过于缓慢,例如,WebGPT-13B需要大约31秒才能回答一个500个标记的查询。清华大学、北京航空航天大学和智普AI的研究人员在本研究中介绍了WebGLM,这是一个基于100亿参数的通用语言模型(GLM-10B)构建的稳健的Web增强质量保证系统。图1展示了其中的一个示例。它是有效、经济、对人类偏好敏感,最重要的是,它与WebGPT的水平相当。为了获得良好的性能,该系统使用了几种新颖的方法和设计,包括LLM增强检索器,一种将细粒度的LLM蒸馏检索与粗粒度的Web搜索相结合的两阶段检索器。 像GPT-3这样的LLMs自然接受正确的引用的能力是这种技术的灵感来源,这可以通过适当的基于引文的过滤来改进较小的密集检索器。基于LLM上下文学习引导并在引用的长形QA样本上进行训练的基于GLM-10B的响应生成器被称为引导生成器。LLMs可以通过足够的基于引文的过滤来提供高质量的数据,而不是依靠昂贵的人类专家在WebGPT中编写。一个得分器,通过在线QA论坛上的用户点赞信号进行教学,可以了解人类多数人对各种答复的偏好。 图1显示了WebGLM对样本查询的回答快照,附带了在线资源的链接。 他们展示了一种合适的数据集架构可以产生与WebGPT的专家标注相比的高质量评分器。他们的定量消融测试和深入的人类评估结果显示了WebGLM系统的高效和有效。特别是,WebGLM(10B)在他们的图灵测试中优于WebGPT(175B),并且优于大小相似的WebGPT(13B)。WebGLM是目前最好的公开可用的Web增强QA系统之一,得益于对唯一公开可用系统Perplexity.ai的改进。总之,在本文中,他们提供了以下内容:•他们建立了WebGLM,这是一个有效的带有人类偏好的Web增强质量保证系统。它的性能类似于WebGPT(175B),并且比类似大小的WebGPT(13B)要好得多。 它还超越了由LLMs和搜索引擎驱动的流行系统Perplexity.ai。•他们在现实世界的部署中确定了WebGPT的局限性。他们提出了一组新的设计和策略,以在实现基线系统的高准确性的同时实现高效和具有成本效益的优势。•他们制定了人类评估指标,用于评估Web增强型QA系统。广泛的人类评估和实验证明了WebGLM的强大能力,并为系统未来的发展产生了见解。代码实现可在GitHub上找到。

Leave a Comment

遇见Otter:一款尖端的AI模型,利用名为MIMIC-IT的大规模数据集,在感知和推理基准测试中实现最先进的表现

多方面的模型致力于整合来自不同来源的数据,包括书面语言、图片和视频,以执行各种功能。这些模型在理解和生成融合视觉和文本数据的内容方面展示了相当大的潜力。 多方面模型的一个关键组成部分是指令调整,它涉及基于自然语言指令对模型进行微调。这使得模型可以更好地理解用户的意图并生成精确而相关的响应。指令调整已经在大型语言模型(LLMs)如GPT-2和GPT-3中得到有效应用,使它们能够遵循指令以完成现实任务。 现有的多模态模型方法可以分为系统设计和端到端可训练模型两个方面。系统设计角度将不同的模型连接起来,使用类似ChatGPT的调度程序,但缺乏训练灵活性并可能成本高昂。端到端可训练模型角度将来自其他模态的模型集成在一起,但可能具有高训练成本或有限的灵活性。以前在多模态模型中的指令调整数据集缺乏上下文示例。最近,来自新加坡的一个研究团队提出了一种新方法,引入了上下文指令调整,并构建了具有上下文示例的数据集以填补这一空白。 本研究的主要贡献包括: 引入用于多模态模型中的指令调整的MIMIC-IT数据集。 开发具有改进指令跟踪和上下文学习能力的Otter模型。 优化OpenFlamingo实现,以便更易于访问。 这些贡献为研究人员提供了有价值的数据集、增强的模型和更加用户友好的框架,以推进多模态研究。 具体来说,作者介绍了MIMIC-IT数据集,旨在增强OpenFlamingo的指令理解能力,同时保留其上下文学习能力。该数据集由具有上下文关系的图像-文本对组成,而OpenFlamingo旨在基于上下文示例为查询的图像-文本对生成文本。MIMIC-IT数据集的介绍是为了增强OpenFlamingo的指令理解能力,同时保持其上下文学习。它包括图像-指令-答案三元组及其对应的上下文。OpenFlamingo是一个框架,使多模态模型能够根据图像和上下文示例生成文本。 在训练过程中,Otter模型遵循OpenFlamingo范例,冻结预训练的编码器并微调特定模块。训练数据遵循特定格式,包括图像、用户指令、“GPT”生成的答案和[endofchunk]令牌。该模型使用交叉熵损失进行训练,用Please view this post in your web browser to complete the quiz.令牌分隔预测目标的解决方案。 作者将Otter集成到Hugging Face Transformers中,以便轻松重用和集成到研究人员的流程中。他们针对4×RTX-3090 GPU进行了模型优化,并支持完全分片数据并行(FSDP)和DeepSpeed以提高效率。他们还提供了一个脚本,用于将原始OpenFlamingo检查点转换为Hugging…

Leave a Comment

UC圣地亚哥分校和高通公司研究人员推出自然程序:一种强大的工具,可轻松验证自然语言中严谨推理链条 – 人工智能的游戏规则改变者

人工智能领域最新和最令人难以置信的进展是大型语言模型(LLM)的发展。著名的ChatGPT由OpenAI开发,基于GPT 3.5和GPT 4架构,通常因其生成内容和回答问题的能力,就像人类一样,而受到广泛关注。它模仿人类生成创造性和精确内容的能力,使其能够在几乎所有行业中进行问题解决。通过添加Chain-of-Thought(CoT)提示,像GPT 3.5这样的LLM的影响得到了改进,从而导致信息处理行业的重大变化。CoT增强了LLM并帮助它们生成更全面和详细的推理过程,以一系列中间步骤进行。 虽然CoT提供了许多优势,但它对中间推理阶段的强调有时会导致幻觉和复合错误,这使得模型难以生成一致和准确的推理过程。为了解决这些挑战,一组研究人员引入了自然程序,这是一种自然语言基础的演绎推理格式,利用自然语言的内在力量来实现演绎推理。 该团队指出,这种方法将推理验证过程分解为一些顺序子过程。每个子过程仅提供特定步骤所需的上下文和前提条件,分解使验证过程更加可接近。作者使用了公开可访问的模型,例如OpenAI的GPT-3.5-turbo(175B),对算术和常识数据集进行了试验,以展示他们基于自然程序的验证技术的有效性。结果展示了他们的策略如何有效地增加大型语言模型生成的推理过程的可靠性。 自然程序格式使语言模型能够生成精确的推理步骤,确保后续步骤更加严格地基于前一步骤。通过使用这种结构,语言模型以逐步方式执行推理自我验证,由于验证程序集成到演绎推理的每个级别中,因此产生的推理阶段更加严格和可靠。 团队提到的一些关键贡献是: 引入自然程序格式,提出了一种适用于验证的严格演绎推理框架,可通过上下文学习简单制作。 通过实验,团队展示了提出的自然程序格式编写的长时间演绎推理过程可以通过使用仅涵盖先决上下文和前提条件的逐步子过程进行可靠的自我验证。 通过实验,团队展示了该框架如何有效提高LLM生成的推理阶段和解决方案的准确性、可靠性和可解释性。 总之,这个框架似乎有望提高语言模型的演绎推理能力。

Leave a Comment

革命性提高人工智能效率:加州大学伯克利分校的SqueezeLLM首次亮相,通过稠密和稀疏量化,将大型语言模型服务的质量和速度相结合

近期大型语言模型(LLMs)的发展已经在多个领域展示了它们令人印象深刻的问题解决能力。LLMs可以包含数百亿个参数,并且是在庞大的文本语料库上训练的。 研究表明,在LLM推理中,内存带宽而不是CPU是生成任务的关键性能限制。这表明,在内存受限情况下,参数可以被加载和存储的速率,而不是算术运算,成为关键延迟障碍。然而,内存带宽技术的进展远远落后于计算,从而导致了所谓的内存墙现象。 量化是一种有前途的方法,它涉及将模型参数存储在比训练中使用的通常的16或32位精度更低的精度下。尽管近来有了像LLaMA及其指令跟踪变体这样的进展,但是在低比特精度和相对较小的模型(例如50B参数)下实现良好的量化性能仍然很困难。 加州大学伯克利分校的一项新研究深入研究了低比特精度量化,揭示了当前方法的缺点。基于这些发现,研究人员引入了SqueezeLLM,这是一个后训练量化框架,它将密集和稀疏分解技术与独特的基于灵敏度的非均匀量化策略相结合。这些方法允许在超低比特精度下进行量化,同时保持竞争性的模型性能,大大减少了模型大小和推理时间成本。他们的方法将LLaMA-7B模型的困惑度从均匀量化的28.26降至3位精度下的7.75,这是一个相当大的改进。 通过在C4和WikiText2基准测试上进行全面测试,研究人员发现,在应用于语言建模任务的LLaMA-7B、13B和30B时,SqueezeLLM在不同比特精度下始终比现有的量化方法表现更好。 根据团队的说法,由于权重矩阵中存在大量的异常值,因此许多LLMs的低比特精度量化特别困难。这些异常值同样影响它们的非均匀量化方法,因为它们会将位的分配偏向极高或极低的值。为了消除异常值,他们提供了一种简单的方法,将模型权重分成密集和稀疏组件。通过隔离极端值,中心区域显示出更窄的范围,最高可达10,从而获得更好的量化精度。使用高效的稀疏存储方法,如压缩稀疏行(CSR),可以将稀疏数据保持完整精度。该方法使用高效的稀疏核心函数处理稀疏部分,并将计算并行化处理密集部分,从而产生低开销。 研究团队通过将SqueezeLLM应用于Vicuna-7B和13B模型,演示了他们框架对IF模型量化的潜在效果。在测试中,他们比较了两个系统。首先,他们使用MMLU数据集来衡量模型的知识和问题解决能力,以评估生成的输出的质量。他们还使用GPT-4来排名量化模型相对于FP16基线的生成质量,使用Vicuna中提出的评估方法。在两个基准测试中,SqueezeLLM始终优于GPTQ和AWQ这两种目前的最先进的方法。值得注意的是,在这两个评估中,4位量化模型的表现与基线相同。 该研究展示了他们的模型在A6000 GPU上运行时的显著延迟降低和量化性能的进展。研究人员展示了LLaMA-7B和13B相对于基线FP16推理的速度提升高达2.3倍。此外,所提出的方法实现了比GPTQ高达4倍的更快的延迟,展示了它在量化性能和推理效率方面的功效。

Leave a Comment

斯坦福大学和康奈尔大学的研究人员推出了Tart:一种创新的即插即用Transformer模块,以任务无关的方式增强人工智能推理能力

大型语言模型在不改变模型参数的情况下具有上下文学习技能,可以只给出少量实例就完成工作。由于具有任务不可知性,因此一个模型可以用于各种任务。相反,传统的任务适应技术,包括微调,会为每个任务修改模型参数。尽管如此,上下文学习很少是从业者的选择方法,因为它通常表现不如任务特定的适应技术。以前的大多数研究都将这种性能差异归咎于LLM的受限上下文窗口,该窗口只能容纳少量的任务案例。 然而,他们证明即使在给定相同任务示例的情况下,上下文学习和微调技术之间的差距仍然存在。这一发现引起了他们的关注:任务不可知适应策略的性能差异是一般性质限制还是只对上下文学习具有唯一性。他们能否特别创建符合以下要求的适应策略: • 任务不可知:同一模型适用于各种活动。 • 质量:在这些多个任务中,实现与任务特定方法竞争的准确性。 • 数据可扩展性:随着任务实例数量的增加,学习效率增加。他们首先研究质量差距的原因。 他们将LLM的上下文学习能力分为两个组成部分:有效任务表示的获取和这些表示上的概率推理或推理执行。差距是由表示中的信息缺失还是由LLM无法分析它们造成的?通过在多个二元分类任务中评估LLM家族的推理和表示差距,他们在经验上测试了这个概念。他们得出结论,LLM具有良好的表示形式,并且大部分质量差异是由他们的推理能力较弱造成的。 他们还发现微调在两个方面都可以增强基本模型,但主要是增强任务特定推理,占性能提升的72%。令人惊讶的是,大多数缩小性能差距的方法,例如提示工程和活动示例选择,只针对LLM的学习表示形式。相反,他们的研究探讨了一种增强LLM推理能力的替代策略。他们使用人工创建的概率推理挑战来改善LLM的推理能力。虽然这种方法提高了模型的基线上下文学习性能,但它也需要单独微调每个LLM。 他们更进一步,推测以一种与任务和模型无关的方式发展推理能力的前景。他们证明了可以采取完全不可知的方法来增强推理能力。在这项研究中,来自斯坦福大学和康奈尔大学的研究人员提出了Tart,它使用合成教授的推理模块来提高LLM的推理能力。Tart只使用合成的逻辑回归问题进行训练,而不管下游任务或基本LLM,以训练基于Transformer的推理模块。不需要进一步的训练,这个推理模块可以使用LLM的嵌入来构建,以增强其演绎能力。 特别是,Tart实现了必要的目标: • 任务中立:Tart的推理模块必须使用虚构数据进行一次训练。 • 质量:在各种NLP任务中,表现比基本LLM好,使用任务特定的微调技术缩小了差距。 • 数据可扩展性:处理比上下文学习多10倍的实例。 Tart与任务、模型和领域无关。他们证明,Tart在14个NLP分类任务上跨越三个模型系列,并在不同的领域中泛化,使用单个用合成数据训练的推理模块。他们证明,Tart的性能在质量方面优于上下文学习18.4%,任务特定适配器3.4%和完全任务特定微调3.1%。在RAFT基准测试中,Tart将GPT-Neo的性能提高到与GPT-3和Bloom相同的水平,同时超过后者4%。 Tart解决了上下文学习的不便的短期限制,并且具有数据可扩展性。在LLM中,每个示例可能占用多个标记,通常是数百个,而Tart的推理模块仅使用每个案例的两个标记 – 一个用于上下文,一个用于标签。这种数据可扩展性可能带来的好处可达6.8%。从理论上讲,他们证明了Tart的泛化能力主要取决于合成数据分布和自然文本嵌入分布之间的分布偏移,由Wasserstein-1指标评估。 以下是他们的主要贡献概述: • 使用表示推理分解,研究为什么针对特定任务的微调在访问相同信息的情况下优于上下文学习。…

Leave a Comment

Meta AI推出具有突破性的I-JEPA:一种具有革命性的计算机视觉技术,模拟人类和动物的学习和推理

人类通过观察世界学习了大量的背景信息。自去年以来,Meta团队一直在开发能够学习世界运作内部模型的计算机,使它们能够更快地学习,规划如何完成具有挑战性的工作,并快速适应新颖的条件。为了使系统有效,这些表征必须直接从未标记的输入(如图像或声音)中学习,而不是手动组装标记数据集。这个学习过程被称为自我监督学习。 生成式架构通过遮盖或删除用于训练模型的数据的部分来进行训练。这可以用图像或文本来完成。然后,它们会猜测缺少或失真的像素或单词。然而,生成式方法的一个主要缺点是,模型试图填补任何知识上的空白,尽管真实世界存在的不确定性。 Meta的研究人员刚刚推出了他们的第一个人工智能模型。通过比较图像的抽象表征(而不是比较像素本身),他们的图像联合嵌入预测架构(I-JEPA)可以学习和改进。 根据研究人员的说法,JEPA将摆脱固定性预训练所困扰的偏见和问题,因为它不涉及将图像的多个视图/增强的表征折叠成单个点。 I-JEPA的目标是使用更接近个体思维方式的表征来填补知识空白。所提出的多块遮罩方法是另一个重要的设计选项,它有助于将I-JEPA引向开发语义表征。 I-JEPA的预测器可以被认为是一个有限的、原始的世界模型,它可以基于有限的上下文信息描述静止图像中的空间不确定性。此外,这个世界模型的语义性质使得它能够推断出以前未知的图像部分,而不仅仅依赖于像素级别的信息。 为了查看模型在被要求预测蓝框内的输出时的结果,研究人员训练了一个随机解码器,将I-JEPA预测的表征转换回像素空间。这种定性分析证明了模型可以学习视觉对象的全局表征,而不会失去这些对象在框架中的位置。 使用I-JEPA进行预训练需要很少的计算资源。它不需要额外的复杂数据增强来提供不同的视角。研究结果表明,I-JEPA可以学习稳健的、预先构建的语义表征,而不需要自定义视角增强。在ImageNet-1K上进行的线性探测和半监督评估也超过了像素和令牌重构技术。 与其他语义任务的预训练方法相比,尽管依赖于手动制作的数据增强,I-JEPA仍然表现出色。I-JEPA在对象计数和深度预测等基本视觉任务上胜过这些方法。由于使用了更少复杂的模型和更灵活的归纳偏差,I-JEPA适用于更多的情况。 团队认为,JEPA模型在视频解释等领域的创造性应用前景非常广阔。使用和扩展这样的自我监督方法来开发广泛的世界模型是一个重大进步。

Leave a Comment

我们应该如何存储人工智能图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法

一年前,利用人工智能生成逼真的图像还只是一个梦想。我们对看到的生成人脸的相似度感到印象深刻,尽管大多数输出结果有三只眼睛,两个鼻子等等。然而,随着扩散模型的发布,事情迅速发生了变化。现在,很难区分由人工智能生成的图像和真实的图像。 生成高质量图像的能力只是方程式的一部分。如果我们能够适当地利用它们,高效压缩它们在内容生成、数据存储、传输和带宽优化等任务中扮演着至关重要的角色。然而,图像压缩主要依赖于传统的方法,如变换编码和量化技术,对生成模型的探索有限。 尽管扩散模型和基于分数的生成模型在图像生成方面取得了成功,但它们尚未成为图像压缩的主流方法,落后于基于GAN的方法。它们在高分辨率图像上表现得更差或与HiFiC等基于GAN的方法相当。即使试图将文本到图像模型重新用于图像压缩,也产生了令人不满意的结果,产生了偏离原始输入或包含不良工件的重建。 基于分数的生成模型在图像生成任务中的表现与它们在图像压缩方面的有限成功之间的差距引发了有趣的问题,促使进一步的研究。令人惊讶的是,能够生成高质量图像的模型尚未能够在图像压缩的特定任务中超越GAN。这种差异表明,在将基于分数的生成模型应用于压缩任务时可能存在独特的挑战和考虑因素,需要专门的方法来发挥它们的全部潜力。 因此,我们知道基于分数的生成模型在图像压缩方面有潜力。问题是,如何做到呢?让我们来看看答案。 谷歌研究人员提出了一种方法,将一个标准的自编码器,针对均方误差(MSE)进行了优化,与扩散过程相结合,以恢复并添加自编码器丢弃的细节。编码图像的比特率完全由自编码器确定,因为扩散过程不需要额外的比特。通过专门为图像压缩调整扩散模型,显示出它们可以在图像质量方面优于几种最新的生成方法。 所提出的方法可以较好地保留细节,相较于现有的方法。来源:https://arxiv.org/pdf/2305.18231.pdf 该方法探索了两种密切相关的方法:扩散模型表现出了令人印象深刻的性能,但需要大量采样步骤,而修正流在允许更少的采样步骤时表现更好。 这种两步方法首先使用MSE优化的自编码器对输入图像进行编码,然后应用扩散过程或修正流来增强重建的逼真度。扩散模型采用与文本到图像模型相反的噪声计划,优先考虑细节而不是全局结构。另一方面,修正流模型利用自编码器提供的配对将自编码器输出直接映射到未压缩的图像。 所提出的HFD模型概述。来源:https://arxiv.org/pdf/2305.18231.pdf 此外,该研究揭示了对未来研究有用的具体细节。例如,它表明噪声计划和图像生成过程中注入的噪声量显着影响结果。有趣的是,尽管文本到图像模型在高分辨率图像上训练时受益于增加噪声水平,但发现减少扩散过程的总体噪声对于压缩是有利的。这种调整使模型更专注于细节,因为自编码器重建已经足够捕捉了粗略的细节。

Leave a Comment