近期,著名的BERT模型一直是自然语言处理中领先的语言模型之一。该语言模型适用于多个NLP任务,这些任务将输入序列转换为输出序列。BERT(Bidirectional Encoder Representations from Transformers)使用了Transformer注意机制。注意机制学习文本语料库中单词或子词之间的上下文关系。BERT语言模型是自然语言处理进展的最重要例子之一,并使用了自监督学习技术。 在开发BERT模型之前,语言模型在训练时分析文本序列,要么从左到右,要么从左到右和从右到左结合。这种单向方法对于通过预测下一个单词来生成句子,并将其附加到序列中,然后预测下一个到下一个单词,直到获得完整的有意义的句子的工作效果很好。通过BERT,引入了双向训练,与以前的语言模型相比,它能更深入地理解语言上下文和流。 最初的BERT模型发布为英文。随后,开发了其他语言模型,如法文的CamemBERT和意大利文的GilBERTo。最近,苏黎世大学的研究人员开发了一种适用于瑞士的多语言模型。这个模型名为SwissBERT,它在瑞士标准德语、法语、意大利语和罗曼什语Grischun中训练了超过2100万篇瑞士新闻文章,总计120亿个标记。 SwissBERT的引入是为了克服瑞士研究人员在执行多语言任务时面临的挑战。瑞士主要有四种官方语言-德语、法语、意大利语和罗曼什语,对于每种特定语言,单独的语言模型很难进行组合以执行多语言任务。此外,第四种国家语言罗曼什语也没有单独的神经语言模型。由于在自然语言处理领域实现多语言任务有一定难度,瑞士国家语言在SwissBERT之前没有统一的模型。SwissBERT通过简单地结合这些语言的文章,并通过隐式利用新闻中的共同实体和事件来创建多语言表示,克服了这一挑战。 SwissBERT模型是由预先训练在81种语言中的跨语言模块(X-MOD)转换器重新建模而来。研究人员通过训练自定义语言适配器,将预先训练的X-MOD转换器适应到他们的语料库中。他们为SwissBERT创建了一个瑞士特定的子词汇表,得到的模型包含了1.53亿个参数。 研究团队在一些任务上评估了SwissBERT的性能,包括对当代新闻(SwissNER)中的命名实体进行识别和检测用户生成的对瑞士政治的立场。SwissBERT的表现优于常见的基准模型,并在检测立场方面优于XLM-R。在对罗曼什语的能力进行评估时,发现SwissBERT在零-shot跨语言转移和德语-罗曼什语单词和句子的对齐方面明显优于未经该语言训练的模型。然而,在识别历史上经过OCR处理的新闻中的命名实体方面,该模型表现不佳。 研究人员发布了带有用于下游任务微调的SwissBERT示例。这个模型在未来的研究甚至非商业目的上似乎很有前景。通过进一步的适应,下游任务可以从该模型的多语言能力中受益。
Leave a CommentTag: Technology
由于离散声学令牌建模的进展,自动回归语音和音乐的生成方面取得了显著进展。为了有效地进行图片生成,研究人员提出了非自回归并行迭代解码方法。与自回归方法相比,需要在过去和未来的序列组成部分上进行条件处理的填充工作更适合于并行迭代解码。在本研究中,他们利用声学令牌建模和同时迭代解码来进行音乐音频合成。据他们所知,这是首次将并行迭代解码应用于神经音频音乐合成。 他们使用基于令牌的提示来调整他们的模型,称为VampNet,以适应各种应用。通过故意隐藏的音乐令牌序列,他们展示了指导VampNet生成并填充空白的能力。这个过程的结果可以是高质量的音频压缩方法,也可以是与原始输入音乐在风格、流派、节奏和乐器方面非常相似,但在音色和节奏方面有一些细微差别的变体。与自回归音乐模型不同,他们的方法允许提示放置在任何位置,后者只能通过使用一些前缀音频作为提示,并由模型产生可能跟随其后的音乐。 图1:VampNet概述。首先,他们使用音频令牌化器将音频分解为一系列不同的令牌。令牌首先被屏蔽,然后被发送到一个屏蔽生成模型,该模型使用有效的迭代并行解码采样技术,在两个级别上为屏蔽令牌预测值。然后将输出解码为音频。 他们研究了各种提示设计,如周期性、压缩和受音乐启发的设计(如节拍掩蔽)。他们发现,当指示其创建循环和变化时,他们的模型表现出色,因此被命名为VampNet。他们提供了可以下载的代码,并强烈建议人们查看他们的音频样本。Descript Inc.和Northwestern University的研究人员介绍了一种使用屏蔽声学令牌建模生成音乐的方法,输入音频文件可以通过各种方式提示VampNet,因为它是双向的。VampNet是一个很好的工具,可以在音乐压缩和通过各种提示方法进行音乐生成之间连续运行。 音乐家可以使用VampNet录制一个简短的循环,将其输入系统,每次重复循环区域时,VampNet都会提供创意上的音乐变体。他们打算在进一步的工作中研究VampNet及其提示方法在交互式音乐共创方面的潜力,以及屏蔽声学令牌建模的表示学习能力。
Leave a Comment随着大型语言模型(LLM)的最近引入,其多样性和能力引起了人工智能领域的广泛关注。这些模型经过大量数据的训练,具备了在自然语言指令下理解、推理和生成文本的出色人类模仿能力。这些模型在零样本和少样本任务中表现良好,可以根据自然语言指令进行微调,以应对未预见的挑战。 当前的LLM及其开发主要集中在英语和资源丰富的语言上。大多数现有的LLM专门针对英语进行设计和训练,导致这些模型的研究和开发中存在英语的主导偏见。为了解决这个限制,来自DAMO Academy和阿里巴巴集团的研究人员提出了一种多语种LLM,称为POLYLM(多语种大型语言模型)。与现有的缺乏13B模型的多语种LLM不同,该团队发布了POLYLM-13B和POLYLM-1.7B以促进使用。 POLYLM是使用来自公开可访问的源(包括维基百科、mC4和CC-100)的640B标记的大规模数据集构建的。团队还提出了一种课程学习技术,以解决低资源语言的数据不足问题。该方法在训练过程中逐渐增加高质量的低资源语言比例,同时最初更加关注英语。重点是将通用知识从英语转移到其他语言。 该团队还开发了MULTIALPACA,一种多语种指令数据集,用于监督微调(SFT)阶段。现有的多语种SFT数据集要么通过手动注释获得(耗时且昂贵),要么通过机器翻译获得(可能导致翻译错误且缺乏文化细微差别)。这种多语种自我指导方法自动提供高质量的多语种指令数据,以克服这些限制,并利用英语种子、多语种翻译、指令生成和过滤系统。 为了评估和评估LLM的多语种能力,该团队开发了一个基准,该基准源于现有的多语种任务,包括问答、语言理解、文本生成和跨语言机器翻译。该基准通过精心设计的提示覆盖了15种语言的十个任务。通过大量实验,该团队证明了他们的预训练模型在非英语语言中的性能优于开源模型。所提出的课程训练策略在保持英语熟练度的同时提高了多语种性能。使用多语种指令数据还显著增强了POLYLM处理多语种零样本任务的能力。 该团队总结了以下贡献。 开发了一个熟练的13B规模模型,其在西班牙语、俄语、阿拉伯语、日语、韩语、泰语、印尼语和中文等主要非英语语言中表现良好。该模型补充了现有开源模型在这些语言中要么不熟练,要么具有较小版本且能力不同的不足之处。 提出了一种先进的课程学习方法,促进了从英语到多种非英语语言和特定自然语言处理任务(如机器翻译)的通用知识的传递。 提出了一个名为MULTIALPACA的数据集,它补充了现有的指令数据集,使LLM能够更好地遵循多语种指令,特别是来自非英语母语的指令。
Leave a Comment区块链是一种安全的、去中心化的、分布式的、具有时间戳的数据结构,为金融、数据安全和隐私、农业、供应链等各个领域的问题提供解决方案
Leave a Comment毫无疑问,AI机器人能够生成高质量和流畅的自然语言。长期以来,研究人员和从业者一直在思考构建一个充满具有人类行为的代理人的沙盒文明,以了解不同类型的互动、人际关系、社会理论等。可靠的人类行为替身可能会推动各种交互应用的发展,从虚拟现实到社交技能培训到原型程序。研究人员从斯坦福大学和谷歌研究中提出了一种利用生成模型模仿类人个体和紧急集体行为以响应其身份、变化经验和环境的代理人。 该小组的主要贡献可总结如下: 行为是合理的,因为它在代理人不断演化的经验和环境条件下进行动态调节,被称为生成代理人。 为实现生成代理人在快速变化的条件下具备长期记忆、检索、反思、社交互动和场景规划的能力而提出了革命性的框架。 使用两种类型的测试(控制试验和端到端测试)来确定架构的不同部分的价值,并发现类似故障记忆检索等问题。 讨论了应用生成代理人的交互系统对社会和伦理学带来的优势和潜在危险。 该小组的目标是创建一个虚拟开放世界框架,在这个框架中,智能代理人以自然语言安排日程、交换信息、建立友谊,并根据环境和历史线索协调团体活动。通过将大型语言模型(LLM)与基于LLM输出合成和提取数据的机制相结合,团队创建了一种新颖的代理人架构,使代理人能够从过去的错误中学习,并在保持长期角色连贯性的同时进行更精确的实时推理。 复杂行为可以通过代理人对录音进行递归合成来进行引导。代理人的内存流是一个数据库,包含代理人先前经历的完整记录。为了适应不断变化的环境,代理人可以从其内存流中获取相关数据,处理这些知识,并制定行动计划。 研究人员招募了人类评分员,并让他们建议的25个生成代理人在使用Phaser在线游戏开发框架开发的Smallville沙盒环境中作为非玩家角色(NPCs)运行。实验的标志是代理人对角色的一致表现以及对类人记忆、计划、反应和反思的令人信服的模仿。他们在两个完整的游戏日内用自然语言相互交流。 应用 通过将生成代理人与多模型相结合,有朝一日可以拥有能够在线和离线与人类互动的社交机器人。因此,现在可以原型化社会系统和想法,测试新的交互体验,并构建越来越逼真的人类行为模型。 人本设计过程是另一个可以使用GOMS和Keystroke Level Model等认知模型的领域。 使用生成代理人作为用户替身可以更多了解他们的需求和偏好,从而实现更个性化和高效的技术交互。 通过在角色扮演、社交原型、沉浸式环境和游戏中使用,这项研究有助于推动基于LLM的由动态和交互人类行为的代理人构成的模拟系统的发展。在进一步的研究中,可以进一步发展本文中建议的生成代理人架构的组成部分。例如,可以调整检索功能中包含的相关性、新近性和重要性函数,以提高检索模块在特定上下文中找到最相关材料的能力。还可以采取措施提高架构的性能,节省成本。 未来的研究应该通过更长时间的观察生成代理人的行为,以全面了解它们的能力和限制,因为本研究对其行为的评估仅限于非常短的时间线。
Leave a Comment人员再识别(Person Re-ID)是一种先进的计算机视觉方法,可以更容易地通过不同地点和时间的监控摄像头来识别人员。尽管个人图像具有改善安全和公共安全的巨大潜力,但其使用存在着重大的隐私问题。由于根据数据隐私法律法规,个人图像被视为私人信息,因此这些问题需要隐私保护的解决方案。 现有的隐私保护人员再识别方法存在一定的局限性。传统的加密方法可以提供较强的隐私保护,但无法对加密数据进行计算。同态加密(HE)直接支持对密文进行计算,但不允许云服务器访问计算结果。此外,现有的浮点特征向量加密机制存在解码和计算错误的问题。 最近,发表了一篇新文章,提出一种名为FREED的新的隐私保护人员再识别解决方案。该系统将隐私保护的人员再识别定义为加密特征向量的相似性度量,使得云服务器可以在不泄露任何个人图像隐私的情况下执行再识别操作。 具体而言,FREED利用新的编码机制和安全批处理计算协议来加密浮点特征向量并有效地执行再识别操作。 FREED引入了三个关键组件来保护特征向量的隐私: 编码机制(ECMO)将浮点特征向量转换为整数,确保准确性并避免解码错误。 安全批处理乘法(BatchSMUL)协议高效计算加密特征向量的相似性度量,减少计算成本。 安全批处理部分解密(BatchPDec)协议安全地对相似性度量进行排序,实现准确的人员再识别,同时不泄露个人隐私。 通过这些组件,可以提供一个强大的隐私保护解决方案,用于人员再识别任务。 提出使用ECMO将浮点特征向量转换为整数,具有两个关键优势。首先,它消除了其他编码方法常见的解码错误。ECMO确保在加密和解密后更准确地检索原始特征向量,保留其准确性,并提高人员再识别的准确性。其次,与传统方法相比,这种转换为整数显著降低了计算错误率和加密成本。ECMO的更高效和精确的过程提高了方案的整体准确性和实用性,适用于实际应用。 通过对计算和通信开销方面的效率进行评估,测试表明ECMO相对于其他编码技术具有较低的错误率。同时还确定了控制参数设置。FREED提供了一种安全可行的人员再识别方法,相比先前的协议在计算和通信方面性能更好。 总之,本文介绍了FREED,一种新颖有效的隐私保护人员再识别解决方案。通过利用编码机制(ECMO)将浮点特征向量转换为整数,FREED解决了传统编码方法的局限性,提高了准确性并减少了计算和计算错误。安全批处理乘法(BatchSMUL)和安全批处理部分解密(BatchPDec)协议提高了系统的效率。通过广泛的实验评估,FREED在计算和通信方面展示了其有效性和效率,相比于MGN等方法,FREED为解决人员再识别中的隐私挑战提供了一种有希望的方法,同时保持了高准确性和实用性,适用于实际应用。
Leave a Comment姿势、眼神、面部表情、手势等,统称为“肢体语言”,一直是许多学术研究的课题。准确记录、解读和创建非言语信号可以极大地增强遥感、增强现实(AR)和虚拟现实(VR)环境中人物形象的逼真程度。 现有的最先进的人物形象模型,如SMPL系列中的模型,可以正确地描绘出逼真姿势中不同的人体形态。然而,它们受到其使用的基于网格的表示和3D网格质量的限制。此外,这类模型通常只模拟裸体,不包含服装和头发,从而降低了结果的逼真度。 他们介绍了X-Avatar,这是一种创新模型,可以在数字化人物形象中捕捉到人类表情的完整范围,以创建逼真的遥感、增强现实和虚拟现实环境。X-Avatar是由瑞士苏黎世联邦理工学院(ETH Zurich)和微软(Microsoft)研究人员开发的一种富有表现力的隐式人类人物模型。它可以捕捉高保真度的人体和手部动作、面部情绪和其他外貌特征。该技术可以从完整的3D扫描或RGB-D数据中学习,生成身体、手部、面部情绪和外貌的综合模型。 研究人员提出了一种部位感知的学习前向蒙皮模块,可以通过SMPL-X参数空间控制,实现X-Avatar的富有表现力的动画。研究人员提出了独特的部位感知采样和初始化算法,以有效地训练神经形状和变形场。研究人员通过一个纹理网络,根据位置、面部表情、几何形状和变形表面的法线来增强几何和变形场,以捕捉具有高频细节的人物外貌。这样可以提高细小身体部位的保真度,同时在关节骨骼数量增加的情况下保持训练的有效性。研究人员凭经验证明,该方法在动画任务上相对于强基线模型在数据领域和质量方面取得了更优秀的定量和定性结果。 研究人员提出了一个名为X-Humans的新数据集,其中包含来自20个受试者的233个高质量纹理扫描序列,共计35,500个数据帧,以促进对表达人物形象的研究。X-Avatar提供了一种以关节神经隐式表面为特征的人体模型,适应着穿着衣物的个体的多样拓扑结构,并实现了更好的几何分辨率和整体外貌的保真度。研究的作者定义了三个不同的神经场:一个用于使用隐式占据网络建模几何形状,另一个用于使用学习的前向线性混合蒙皮(LBS)建模变形,具有连续的蒙皮权重,第三个用于使用RGB颜色值建模外貌。 X-Avatar模型可以接受3D姿势扫描或RGB-D图像进行处理。其设计的一部分包括一个用于在规范空间中建模几何形状的塑形网络,以及一个使用学习的线性混合蒙皮(LBS)建立规范和变形区域之间对应关系的变形网络。 研究人员从SMPL-X的参数空间开始,这是一种捕捉全身人物形状、外貌和变形的SMPL扩展,特别关注手部位置和面部情绪,以生成富有表现力和可控的人类人物形象。以关节神经隐式表面来描述人体模型,代表着穿着衣物的个体的各种拓扑结构。同时,一种独特的部位感知初始化方法通过提高对细小身体部位的采样率,极大地增强了结果的逼真度。 结果表明,X-Avatar可以准确记录人体和手部姿势,以及面部情绪和外貌,从而可以创造出更具表现力和逼真的人物形象。这个倡议的团队衷心希望他们的方法可以激发更多的研究,赋予人工智能更多的个性。 使用的数据集 高质量纹理扫描和SMPL[-X]注册;20个受试者;233个序列;35,427个帧;身体姿势+手势+面部表情;各种服装和发型选择;各个年龄段 特点 有几种方法可以教授X-Avatars。 训练中使用的3D扫描图像,右上方。底部:测试姿势驱动的人物形象。 教学目的使用的RGB-D信息,顶部。测试姿势的人物形象表现较差。 该方法在动画测试中恢复了更好的手部灵活性和面部表情,超过了其他基线模型。这导致使用PyMAF-X从单眼RGB影片中恢复的运动进行动画化的X-Avatars。 限制 X-Avatar在模拟露肩上衣或裤子(例如,裙子)时存在困难。然而,研究人员通常只对每个主题训练一个模型,因此他们在单个个体之外的泛化能力仍然需要扩展。 贡献 X-Avatar是第一个全面捕捉身体姿势、手势、面部情绪和外观的富有表现力的隐式人类化身模型。 考虑底层结构的初始化和采样过程提高了输出质量并保持了训练效率。 X-Humans是一个全新的数据集,包含20个人的233个序列,总共有35,500帧高质量纹理扫描,显示了各种身体、手势和面部情绪。 X-Avatar在捕捉身体姿势,手势,面部情绪和整体外观方面无与伦比。研究人员使用最近发布的X-Humans数据集展示了该方法的效果。
Leave a Comment视觉变压器(ViT)因其简单性、灵活性和可扩展性而快速取代基于卷积的神经网络。图片被分割成补丁,并且每个补丁被线性投影到一个令牌上,构成了这个模型的基础。输入照片通常被划分为一组固定数量的补丁,然后再使用。 最近的研究发表了对这个模型的潜在改进:FlexiViT允许连续的序列长度范围,因此通过在单个设计中适应不同的补丁尺寸来计算成本。这是通过在每次训练迭代中随机选择补丁尺寸,并使用缩放技术来适应初始卷积嵌入中的多个补丁尺寸来实现的。Pix2Struct的替代补丁方法,保持了纵横比,对于图表和文档理解等任务非常有价值。 NaViT是谷歌研究人员开发的一种替代方法。Patch n’ Pack是一种技术,它允许在保持纵横比的同时改变分辨率,通过将来自不同图像的许多补丁打包到一个序列中。这个想法基于“示例打包”,这是一种在自然语言处理中使用的技术,通过将多个实例合并成一个序列来高效训练具有不同长度输入的模型。科学家们发现,随机采样分辨率可以显著减少训练时间。NaViT在广泛的解决方案范围内实现了出色的性能,便于在推理时平滑地权衡成本和性能,并且可以以较低的成本轻松适应新的任务。 从示例打包所实现的固定批次形状中出现了像保持纵横比的解析率采样、可变的令牌丢弃率和自适应计算等研究思路。 NaViT在预训练期间的计算效率尤为令人印象深刻,并在微调过程中持续存在。成功地将单个NaViT应用于不同的分辨率,可以在性能和推理成本之间实现平滑的权衡。 在训练和操作过程中将数据输入深度神经网络是常见的实践。因此,计算机视觉应用必须使用预定的批次大小和几何形状,以确保在现有硬件上获得最佳性能。由于这个原因和卷积神经网络固有的架构限制,将图像调整大小或填充到预定大小已经成为常见的做法。 虽然NaViT基于原始的ViT,但理论上可以使用任何可以处理补丁序列的ViT变种。研究人员对ViT进行了以下结构性改变以支持Patch n’ Pack。Patch n’ Pack是一种将序列打包应用于视觉变换器的简单方法,它显著提高了训练效率,这已经被研究界证明过。由此产生的NaViT模型具有灵活性,易于适应新的任务,而不会造成巨大的成本开销。自适应计算和提高训练和推理效率的新算法的研究只是Patch n’ Pack所带来的可能性的两个例子,而这些以前因需要固定的批次形式而受到限制。他们还认为NaViT对ViT来说是朝着正确方向迈出的一步,因为它代表了大多数计算机视觉模型的传统CNN设计输入和建模流程的改变。
Leave a CommentTransformer模型最近越来越受欢迎。这些神经网络模型遵循顺序输入中的关系,比如句子中的单词,以学习上下文和含义。随着OpenAI提出的GPT 3.5和GPT 4等模型的引入,人工智能领域,特别是深度学习领域取得了巨大的进步,成为了热门话题。竞技编程、对话式问题回答、组合优化问题和图学习任务都将Transformer作为关键组件。 Transformer模型在竞技编程中用于根据文本描述生成解决方案。ChatGPT是一个著名的基于GPT的聊天机器人模型,也是一个备受喜爱的对话式问答模型,是Transformer模型的最佳例子。Transformer模型还被用于解决组合优化问题,如旅行推销员问题,并且在图学习任务中取得了成功,特别是在预测分子特性方面。 Transformer模型在图像、音频、视频和无向图等多种形式的模态中表现出了极高的灵活性,但是对于有向图的Transformer仍然缺乏关注。为了填补这一空白,一组研究人员提出了两种专门针对有向图设计的方向和结构感知的位置编码。磁性拉普拉斯是组合拉普拉斯的方向感知扩展,为第一个提出的位置编码提供了基础。所提供的特征向量捕捉了关键的结构信息,同时考虑了图中边的方向性。通过在位置编码方法中包含这些特征向量,Transformer模型更加关注图的方向性,从而成功地表示了有向图中的语义和依赖关系。 方向随机游走编码是第二种提出的位置编码技术。随机游走是一种探索和分析图的流行方法,模型通过在图中进行随机游走,并将游走信息融入到位置编码中,更多地了解有向图的方向结构。由于它有助于模型理解图内链接和信息流动,这种知识在多种下游任务中被使用。 研究团队表示,经验分析表明,方向和结构感知的位置编码在许多下游任务中表现良好。其中之一是排序网络的正确性测试,即确定一组操作是否真正构成排序网络。所提出的模型在排序网络的图表示中利用图的方向性信息,相对于Open Graph Benchmark Code2的先前最先进方法提高了14.7%。 研究团队总结了以下贡献: 建立了常用于Transformer的正弦位置编码与拉普拉斯特征向量之间的明确联系。 研究团队提出了扩展到有向图的谱位置编码,为位置编码中加入方向性信息提供了一种方式。 将随机游走位置编码扩展到有向图,使得模型能够捕捉到图的方向结构。 研究团队评估了结构感知位置编码在各种图距离预测中的预测能力,展示了其有效性。他们引入了预测排序网络正确性的任务,展示了方向性在该应用中的重要性。 研究团队量化了将程序语句序列表示为有向图的好处,并提出了一种新的源代码图构建方法,提高了预测性能和鲁棒性。 在OGB Code2数据集上取得了新的最先进性能,特别是在函数名预测方面,F1分数提高了2.85%,相对改进率为14.7%。
Leave a Comment文本到图像模型最近发展迅速,其中大部分进展都集中在文本到图像模型上。这些模型可以使用给定的文本提示生成逼真的图像。 图像生成只是这个领域研究的一个组成部分。虽然它是一个重要方面,但还有其他文本到其他模型在不同应用中起着关键作用。例如,文本到视频模型旨在根据给定的文本提示生成逼真的视频。这些模型可以显著加快内容准备过程。 另一方面,文本到3D生成已经成为计算机视觉和图形领域的关键技术。虽然仍处于初级阶段,但从文本输入生成逼真的3D模型的能力引起了学术研究人员和行业专业人士的极大兴趣。这项技术在革新各个行业方面具有巨大潜力,多学科的专家们正在密切关注其持续发展。 神经辐射场(NeRF)是一种最近引入的方法,它允许从一组2D图像或稀疏的3D点集合中高质量地渲染复杂的3D场景。已经提出了几种方法将文本到3D模型与NeRF相结合,以获得更加逼真的3D场景。然而,它们经常出现扭曲和伪影,并对文本提示和随机种子敏感。 特别是3D不连贯问题是一个常见问题,渲染的3D场景在不同视点上多次产生属于正面视图的几何特征,导致3D场景产生严重扭曲。这种失败是由于2D扩散模型对3D信息的缺乏意识,特别是相机姿态造成的。 如果有一种方法可以将文本到3D模型与NeRF的进步相结合,以获得逼真的3D渲染,那会怎么样?是时候见识一下3DFuse了。 3DFuse管道概述。来源:https://ku-cvlab.github.io/3DFuse/ 3DFuse是一种中间方法,它将预训练的具有3D意识的2D扩散模型与3D一致的NeRF优化相结合,使其适用于3D一致性的渲染。它有效地将3D意识注入预训练的2D扩散模型中。 3DFuse从采样语义代码开始,以加快生成场景的语义识别。这个语义代码实际上是生成的图像和给定的文本提示,用于扩散模型。一旦完成了这一步骤,3DFuse的一致性注入模块会接收这个语义代码,并通过为给定视点投影粗糙的3D几何来获得特定于视点的深度图。他们使用现有模型来实现这个深度图。然后,深度图和语义代码被用来将3D信息注入扩散模型中。 3DFuse概述。来源:https://ku-cvlab.github.io/3DFuse/ 问题在于预测的3D几何容易出现错误,这可能会改变生成的3D模型的质量。因此,在进一步进行管道之前,应该解决这个问题。为了解决这个问题,3DFuse引入了一种稀疏深度注入器,它隐式地知道如何纠正有问题的深度信息。 通过提取生成3D一致图像的扩散模型的分数,3DFuse稳定地优化了NeRF以实现视图一致的文本到3D生成。该框架在生成质量和几何一致性方面取得了显著的改进。
Leave a Comment大型语言模型风靡了人工智能社区。它们最近的影响帮助了医疗、金融、教育、娱乐等多个行业的发展。众所周知的大型语言模型,例如GPT、DALLE和BERT,执行了非凡的任务,改善了生活。DALLE 2可以根据简单的文本描述创建图像,GPT-3可以写出优秀的文章,完成代码,总结长篇文本段落,像人类一样回答问题,并仅凭一个简短的自然语言提示生成内容。这些模型正在帮助人工智能和机器学习迅速进行范式转变。 最近,一支研究团队推出了LMQL,一种开源的编程语言和语言模型交互平台。LMQL是Language Model Query Language的缩写,通过结合提示、约束和脚本,改进了大型语言模型(LLM)的能力。作为一种基于Python的声明性SQL语言,LMQL通过控制流、约束引导解码和工具增强,扩展了静态文本提示的功能。借助这种类型的脚本,LMQL可以用很少的代码简化多部分提示流程。 研究人员使用LMQL实现了LMP(Language Model Programming),将语言模型提示从纯文本提示扩展到文本提示和脚本的组合。LMQL从LMP提示中提取约束和控制流,生成高效的推理过程。这些超逻辑和高级约束通过一些评估语义转换为令牌掩码,并在生成过程中严格执行。 团队推出了LMQL,以避免重新查询和验证生成的文本所带来的高成本。这可以帮助LMQL在第一次尝试时生成更接近所需输出的文本,而无需后续迭代。此外,LMQL约束允许用户根据其期望的规范引导或控制文本生成过程,例如确保生成的文本遵循某些语法规则,或避免使用特定的单词或短语。 研究人员提到了LMQL如何捕捉一系列先进的提示方法,如交互式流程,这些方法在现有API中很难实现。评估结果显示,LMQL在许多下游任务上保持或提高了准确性,同时显著降低了计算或使用付费API的成本,节省了13-85%的费用。 LMQL可以简洁明了地表达各种常见和高级提示技术。它与Hugging Face的Transformers、OpenAI API和Langchain集成。相关的开发资源可在lmql.ai上获得,并提供基于浏览器的Playground IDE供实验使用。 总之,LMQL似乎是一个有前途的发展,因为评估表明,LMQL是一个强大的工具,可以提高语言模型编程的效率和准确性。它可以让用户在更少的资源下实现他们期望的结果。
Leave a Comment人工智能近年来取得了巨大的进步。其中,大型语言模型的引入引起了广泛关注,因为它具有令人难以置信的模仿人类能力。这些模型不仅在语言处理方面取得了成功,还在计算机视觉领域取得了成就。尽管AI系统在自然语言处理和可控图像生成方面取得了显著成就,但包括通用图像分割在内的像素级图像理解领域仍存在一定的局限性。 图像分割是将图像分割为不同部分的技术,取得了很大的改进,但要创建一个能处理不同粒度的各种图像的通用图像分割模型仍在讨论中。在该领域取得进展的两个主要挑战是充足的训练数据的可用性和模型设计的灵活性限制。现有方法通常使用单输入、单输出的流水线,无法预测不同粒度的分割掩码并处理不同的细节级别。此外,扩展既具有语义知识又具有粒度知识的分割数据集是昂贵的。 为了解决这些限制,一个研究团队提出了Semantic-SAM,一种基于用户输入的通用图像分割模型,可以在任意所需的粒度上对对象进行分割和识别。该模型能够为对象和部分提供语义标签,并根据用户的点击预测不同粒度的掩码。Semantic-SAM的解码器架构采用了多选择学习策略,使模型具备处理多个粒度的能力。每个点击由多个查询表示,每个查询具有不同的嵌入级别。这些查询通过与不同粒度的真实掩码学习。 该团队分享了Semantic-SAM如何通过使用解耦的部件和对象分类策略来解决语义意识问题。该模型使用共享的文本编码器分别对对象和部件进行编码,从而实现不同的分割过程,并根据输入类型调整损失函数。这种策略确保了模型能够处理来自SAM数据集(该数据集缺少一些分类标签)以及来自通用分割数据的数据。 该团队结合了七个代表不同粒度的数据集,以增强语义和粒度,包括SA-1B数据集、部分分割数据集如PASCAL Part、PACO和PartImagenet,以及通用分割数据集如MSCOCO和Objects365。数据格式已重新调整以符合Semantic-SAM的训练目标。 经过评估和测试,Semantic-SAM表现出比现有模型更优异的性能。当与交互式分割技术(如SA-1B可提示分割和COCO全景分割)结合使用时,性能显著提高。该模型实现了惊人的2.3个框AP增益和1.2个掩码AP增益。在粒度完整性方面,它比SAM表现更好,超过3.4个1-IoU。 Semantic-SAM绝对是图像分割领域的创新进展。该模型通过融合通用表示、语义意识和粒度丰富性,为像素级图像分析创造了新的机会。
Leave a Comment生成式人工智能在计算机视觉领域引起了广泛的关注。最近在文本驱动的图像和视频合成方面取得的进展,例如文本到图像(T2I)和文本到视频(T2V),借助扩散模型的出现,展示了卓越的保真度和生成质量。这些进展展示了相当大的图像和视频合成、编辑和动画潜力。然而,合成的图像/视频与完美仍有很大差距,特别是对于人类中心的应用,如人类舞蹈合成。尽管人类舞蹈合成有着悠久的历史,但现有方法在合成内容与真实舞蹈场景之间存在很大的差距。 从生成对抗网络(GANs)时代开始,研究人员尝试扩展视频到视频的风格转移,将舞蹈动作从源视频转移到目标个体,这通常需要对目标人员进行人员特定的微调。 最近的一系列工作利用预先训练的基于扩散的T2I/T2V模型,根据文本提示生成舞蹈图像/视频。这种粗粒度的条件极大地限制了可控性的程度,使用户几乎不可能精确指定预期的主题,即人类外观,以及舞蹈动作,即人类姿势。 虽然引入了ControlNet部分缓解了这个问题,通过将几何人体关键点的姿势控制与之结合,但由于其依赖于文本提示,ControlNet如何确保参考图像中丰富的语义一致性,如人类外观,仍然不清楚。此外,几乎所有现有方法都是在有限的舞蹈视频数据集上进行训练,要么具有有限的主题属性,要么具有过于简单的场景和背景。这导致对未见过的人物主题、姿势和背景组合的零样本泛化能力较差。 为了支持用户特定的短视频内容生成等实际应用,人类舞蹈生成必须符合真实舞蹈场景。因此,期望生成模型能够根据以下属性合成人类舞蹈图像/视频:保真度、泛化能力和组合性。 生成的图像/视频应通过保留与参考图像一致的人类主题和背景外观,同时准确遵循提供的姿势来展现保真度。该模型还应展示泛化能力,即在不需要人员特定微调的情况下处理未见过的人类主题、背景和姿势。最后,生成的图像/视频应展示组合性,允许从不同的图像/视频中选择任意组合的人类主题、背景和姿势。 在这方面,提出了一种新颖的名为DISCO的方法,用于在真实场景中生成人类舞蹈。该方法的概述如下图所示。 https://arxiv.org/abs/2307.00040 DISCO采用两个关键设计:一种具有分离控制的新颖模型架构,用于提高保真度和组合性,以及一种名为人类属性预训练的预训练策略,用于提高泛化能力。DISCO的新颖模型架构确保生成的舞蹈图像/视频能够忠实地捕捉所需的人类主题、背景和姿势,同时允许这些元素的灵活组合。此外,分离控制增强了模型维持忠实表示和适应多样组合的能力。此外,DISCO采用人类属性预训练策略增强模型的泛化能力。这种预训练技术赋予模型处理未见过的人类属性的能力,使其能够生成超越训练数据限制的高质量舞蹈内容。总体而言,DISCO提供了一个综合的解决方案,将复杂的模型架构与创新的预训练策略结合起来,有效解决了真实场景中人类舞蹈生成的挑战。 以下展示了生成的图像/视频以及与人类舞蹈生成的最先进技术的比较。 https://arxiv.org/abs/2307.00040 这是关于DISCO的摘要,一种生成人类舞蹈的新型人工智能技术。如果您感兴趣并想了解更多关于这项工作的信息,可以通过下面的链接找到更多信息。
Leave a CommentDeepSwap DeepSwap是一个基于人工智能的工具,适用于任何想要创建令人信服的深度伪造视频和图像的人。通过重新面向视频、图片、表情包、旧电影、GIF等方式,创建您的内容非常简单。该应用程序没有内容限制,因此用户可以上传任何内容的材料。此外,您还可以首次成为产品的订阅用户,享受50%的折扣。 Docktopus AI Docktopus是一种由AI驱动的演示工具,通过100多个可自定义的模板简化在线内容的创建,让用户能够在几秒钟内创建专业演示文稿。 Promptpal AI Promptpal AI帮助用户发现获取AI模型(如ChatGPT)最大利益的最佳提示。 Quinvio AI Quinvio是一种AI视频制作工具,可以通过直观的编辑器、AI辅助写作和选择AI发言人的选项快速制作视频演示。 Ask your PDF AskYourPdf是一种AI聊天机器人,可帮助用户轻松与PDF文档进行交互并提取洞见。 Supernormal AI Supernormal是一种AI工具,可以自动创建会议记录,每次会议可节省5-10分钟。 Suggesty Suggesty由GPT-3驱动,为Google搜索提供类似人类的答案。 ChatGPT Sidebar ChatGPT Sidebar是一款ChatGPT…
Leave a Comment自从大规模的OT和Wasserstein GANs出现以来,机器学习越来越倾向于使用神经网络来解决最优传输(OT)问题。最近,OT计划被证明可作为具有可比实际任务性能的生成模型使用。OT成本通常被计算并用作生成模型中生成器更新的损失函数。 人工智能研究所(AIRI)和斯科尔科技学院合作开发了一种利用神经网络优化跨学科信息共享的新算法。该算法的理论基础使其输出更易于理解,而不像竞争方法那样需要耦合训练数据集,如输入-输出示例,这种新方法可以在输入和输出领域的不同数据集上进行训练。 大规模训练数据集很难获得,但对于面部或语音识别以及医学图像分析等应用构建的现代机器学习模型来说是必要的。这就是为什么科学家和工程师经常通过人工手段模拟真实世界数据集的原因。生成模型的最新进展大大提高了生成文本和图像的质量,因此这项工作变得更加容易。 神经网络被教导从配对的训练样本和输入-输出图像集泛化和扩展到新的输入图像;这对于需要处理许多质量不同的相同照片的工作非常有用。换句话说,生成模型通过合成来自不同数据的数据,促进了从一个领域到另一个领域的过渡。例如,神经网络可以将手绘图转换为数字图像,或者改善卫星照片的清晰度。 将概率分布与确定性和随机传输映射对齐是该技术的独特应用,它是一种通用工具。该方法将增强非配对翻译(图像恢复,域适应性等)以外的现有模型。与基于GAN或扩散模型的常见方法相比,该方法允许更好地控制生成样本的多样性水平,并提高了学习映射的可解释性。研究人员可能需要修改所获得的OT映射以适应非配对活动。研究人员强调了某些任务的运输成本设计作为一个潜在的研究领域。 最优传输和生成学习的交集是所选择方法的核心。娱乐、设计、计算机图形学、渲染等领域广泛使用生成模型和高效的传输。上述领域中的几个问题可能适用于该方法。可能的缺点是,一些图形业务中的职业可能会受到先前工具的使用的影响,这些工具使图像处理技术公开可用。 由于成本过高或获取困难,研究人员通常不得不使用不相关的数据集,而不是理想的匹配数据集。团队回顾了苏联数学家和经济学家列昂尼德·坎托罗维奇的著作,借鉴了他关于有效货物运输(最优传输理论)的思想,以开发一种在领域之间规划最优数据传输的新方法。神经最优传输是一种使用深度神经网络和分开的数据集的新方法。 在非配对领域转换评估中,该算法在图片风格化和其他任务上实现了比现有方法更好的结果。此外,它需要较少的超参数,通常很难调整,具有更可解释的结果,并且基于坚实的数学基础而不是竞争方法。
Leave a Comment随着数字文本信息在一般和医疗领域中的数量急剧增加,对有效和准确的文本摘要模型的需求也在增加。文本摘要涉及将一篇冗长的写作压缩成简明的概述,同时保留材料的意义和价值。这已经成为自然语言处理(NLP)研究的重点已经很长时间了。 引入神经网络和深度学习技术,特别是使用编码器-解码器结构的序列到序列模型进行摘要生成,已经传达出积极的结果。与基于规则和统计的方法相比,这些方法生成的摘要更加自然和上下文适用。由于需要保留这些结果的上下文和关联特征以及在治疗环境中精确度的要求,这一努力变得更加困难。 研究人员使用ChatGPT来总结放射学报告,并对其进行了改进。为了充分利用ChatGPT的上下文学习能力,并通过交互不断改进它,研究人员开发并实施了一种新颖的迭代优化方法,使用快速工程学。更准确地说,我们采用相似性搜索算法来构建一个动态提示,其中包含语义上和临床上可比较的现有报告。ChatGPT通过这些并行报告进行训练,以理解类似成像表现的文本描述和摘要。 主要贡献 相似性搜索使得能够使用稀疏数据对语言模型(LLM)进行上下文学习。通过识别语料库中最可比较的案例,开发了一个包含LLM最相关数据的动态提示。 我们为迭代优化技术创建了一个动态提示系统。迭代提示首先评估LLM生成的回复,然后在后续迭代中提供更多指导。 一种利用领域特定信息的新方法来调整LLM。建议的方法可以在需要快速和有效地从现有LLM开发领域特定模型时使用。 方法 变量提示 动态样本使用语义搜索来获取与输入放射学报告相似的报告语料库中的示例;最终查询由相同的预定义查询与测试报告的“发现”部分组成,任务描述描述了角色。 迭代优化 通过迭代优化组件可以完成一些很酷的事情。这种方法的目标是通过使用迭代提示使ChatGPT逐步改进其答案。对于放射学报告摘要等重要应用来说,这也需要一种响应审查过程来检查回复的质量。 通过基于少量训练样本和迭代方法改进输入提示来研究使用大型语言模型(LLMs)进行放射学报告摘要的可行性。通过挖掘语料库中的合适实例,以在上下文中学习LLMs,然后用于提供交互提示。为了进一步提高输出,使用了一种迭代优化技术。该过程包括根据自动评估反馈教授LLM什么是好的和负面的回复。与使用大量医学文本数据进行预训练的其他方法相比,我们的策略已经证明更优越。在现代通用人工智能中,这项工作也为构建更多领域特定语言模型奠定了基础。 在研究ImpressionGPT的迭代框架时,我们意识到评估模型输出回复的质量是一项重要但困难的任务。研究人员假设,用于训练LLMs的领域特定和通用领域文本之间的巨大差异导致了观察到的评分差异。因此,通过使用细粒度的评估指标来检查获得的结果的具体细节。 为了更好地包含来自公共和本地数据源的领域特定数据,我们将在未来继续优化快速设计,同时解决数据隐私和安全问题,尤其是在处理许多组织时。我们还考虑使用知识图谱来使提示设计适应当前的领域知识。最后,我们计划将医学专家(如放射科医生)纳入到优化提示和对系统提供的结果提供客观反馈的迭代过程中。通过结合人类专家在开发LLMs过程中的判断和观点,我们可以得到更精确的结果。
Leave a Comment生成式人工智能的惊人增长引发了图片生成方面的令人着迷的进展,利用DALL-E、Imagen和Stable Diffusion等技术,可以根据文本提示创建出色的图像。这一成就可能不仅局限于2D数据。最近DreamFusion展示了文本到图像生成器可以用于创建高质量的3D模型,尽管生成器缺乏3D训练,但有足够的数据来重建3D形状。本文阐述了如何通过文本到图像生成器获得更多,并获得多个3D物体类型的关节模型。 也就是说,他们不是试图创建单个3D资产(DreamFusion),而是希望创建整个类别的关节3D物体的统计模型(如牛、羊和马),该模型可以用于从单个图像(无论是真实的还是数字化的)创建可用于增强现实/虚拟现实、游戏和内容创作的动画化的3D资产。他们通过训练一个可以根据物体的单张照片预测关节3D模型的网络来解决这个问题。为了引入这样的重建网络,先前的工作一直依赖于真实数据。然而,他们提出使用使用2D扩散模型(如Stable Diffusion)生成的合成数据。 牛津大学视觉几何组的研究人员提出了Farm3D,它是DreamFusion、RealFusion和Make-a-video-3D等3D生成器的一个补充,这些生成器可以通过测试时间优化从文本或图像开始创建单个的3D静态或动态资产,需要数小时。这提供了几个优点。首先,2D图像生成器倾向于生成准确和完好的物体类别示例,从而隐式地筛选训练数据并简化学习过程。其次,通过2D生成器隐含地提供了每个给定物体实例的虚拟视图,进一步提供了对理解的澄清。第三,它通过消除收集(可能还需要审查)真实数据的要求,增加了方法的适应性。 在测试时,他们的网络以前馈方式从单张图像中进行重建,仅需几秒钟即可生成可操作的关节3D模型(例如,可以进行动画化、重新照明),而不是固定的3D或4D工件。他们的方法适用于合成和分析,因为重建网络仅在虚拟输入上进行训练,但能够推广到实际照片。可以将该方法应用于动物行为的研究和保护。Farm3D基于两个重要的技术创新。首先,他们展示了如何通过快速工程使Stable Diffusion产生大量通常干净的物体类别图片,以学习关节3D模型。其次,他们展示了如何将得分蒸馏采样(SDS)损失扩展到合成多视图监督,以训练照片几何自编码器,即MagicPony。为了创建同一物体的新人工视图,照片几何自编码器将物体分成多个方面,这些方面有助于图像形成(例如物体的关节形状、外观、相机视点和照明)。 这些合成视图被输入到SDS损失中,以获得渐变更新和反向传播到自编码器的可学习参数。他们对Farm3D进行了基于3D生成和修复能力的定性评估。由于Farm3D能够进行重建和创建,因此可以在语义关键点传输等分析任务上进行定量评估。尽管该模型不使用任何真实图像进行训练,从而节省了耗时的数据收集和筛选过程,但他们展示了与各种基准相当甚至更好的性能。
Leave a Comment密歇根大学的研究人员开发了一个名为Zeus的开源优化框架,用于解决深度学习模型的能源消耗问题。随着使用更大模型和更多参数的趋势增长,训练这些模型所需的能量需求也在增加。Zeus通过在训练过程中识别能源消耗和训练速度之间的最佳平衡来解决此问题,而无需进行任何硬件更改或新基础设施。 Zeus通过使用两个软件开关实现这一目标:GPU功率限制和深度学习模型的批大小参数。GPU功率限制控制GPU消耗的电量,批大小参数控制在更新模型对数据关系的表示之前处理多少个样本。通过实时调整这些参数,Zeus旨在最小化能源消耗,同时尽可能少地对训练时间产生影响。 Zeus设计用于与各种机器学习任务和GPU配合使用,并且可以在不更改硬件或基础设施的情况下使用。此外,研究团队还开发了名为Chase的补充软件,该软件可以通过在低碳能源可用时优先考虑速度,在高峰时段优先考虑效率来降低DNN训练的碳足迹。 研究团队的目标是开发出符合实际情况、能够减少DNN训练的碳足迹并不与大型数据集大小或数据规定等约束冲突的解决方案。虽然由于需要使用最新数据而不总是可以将训练工作推迟到更绿色的时间范围内,但Zeus和Chase仍然可以在不牺牲准确性的情况下提供显著的能源节约。 通过减少深度学习模型的能源需求,Zeus和Chase的开发是解决深度学习模型能源消耗问题的关键一步。研究人员可以在不影响训练时间的情况下展示出显著的能源节约,从而减轻人工智能对环境的影响并促进可持续实践。 总之,Zeus是一个开源优化框架,旨在通过识别能源消耗和训练速度之间的最佳平衡来减少深度学习模型的能源消耗。通过调整GPU功率限制和批大小参数,Zeus最小化能源使用,同时不影响准确性。Zeus可以与各种机器学习任务和GPU配合使用,而补充软件Chase可以降低DNN训练的碳足迹。Zeus和Chase的开发促进了人工智能领域的可持续实践,并减轻了其对环境的影响。
Leave a Comment一种能够描述高维空间中复杂分布的强大生成模型是基于得分的生成模型(SBGMs),其中包括扩散模型。通常使用随机微分方程(SDE)模拟基于几乎总是高斯的源密度来产生样本。尽管基于模拟的去噪目标优化需要高斯源的假设,但SBGMs受其对高斯源的假设的限制,尽管其经验成功。由于物理或生物系统的时间发展中经常违背这一假设,如单细胞基因表达数据的情况,因此无法使用SBGMs来理解潜在动力学。 连续正则化流(CNFs),也称为流式生成模型,已成为解决这些问题的选择方法。通过普通微分方程(ODE)将源密度转换为目标密度,该ODE在流式模型中假设了确定性连续时间生成过程。以往的研究引入了无需模拟的训练目标,使得在假设高斯源的情况下,CNFs可以与SBGMs竞争,并且这些目标已扩展到任意源分布的情况。流式模型以前受到基于模拟的训练目标的限制,这些目标在训练时要求对ODE进行昂贵的积分。 然而,这些目标仍然需要涵盖学习随机动力学,这对于生成建模和恢复真实系统的动力学可能是有用的。薛定谔桥问题(SB)考虑了在某个参考过程下,源概率分布与目标概率分布之间的最可能演化。它是两个任意分布之间的随机映射的基本概率形式。建模自然随机动力学系统、平均场博弈和生成建模等问题都是使用SB问题的几个应用。SB问题通常缺乏封闭形式的解,除了几种特殊情况(如高斯)。但是,可以使用需要复制已学习的随机过程的迭代技术来近似它。 尽管在理论上有效,但这些方法存在数值和实际问题,仅允许高维缩放。魁北克Mila AI研究所、蒙特利尔大学、麦吉尔大学、多伦多大学和Vector研究机构的研究人员研究了薛定谔桥问题的无模拟得分和流匹配(2M)目标。 2M通过SB问题与熵最优传输(OT)之间的关系,将CNFs的无模拟目标和扩散模型的去噪训练目标同时推广到随机动力学和任意源分布上。 2M可以从源分布和目标分布之间的静态熵最优传输映射中受益,这些映射通过Sinkhorn方法或随机算法有效地近似,而不是需要在每次迭代中模拟SDE的动态SB方法。他们使用模拟和真实数据集展示了2M的实用性。在人工数据上,他们证明了2M在生成建模度量方面优于先前的类似工作,并发现了对真实薛定谔桥的更准确近似。他们通过将一系列薛定谔桥作为交叉测量序列(即不配对的时间序列观测)的建模来应用到实际数据中。 尽管先前已经有几种在静态或低维动态设置中使用薛定谔桥对细胞进行建模的方法,但2M是首个可以扩展到数千个基因维度的方法,因为它的训练不需要模拟。他们还提供了一个静态流形测地线映射,展示了薛定谔桥近似在非欧几里德成本下的最早的实际应用之一,从而增强了动态环境中的细胞插值。最后,他们证明,与静态最优传输示例相比,他们可以直接建模和重构控制细胞动力学的基因-基因相互作用网络。代码和示例可在GitHub上获取。
Leave a Comment人工智能在几乎所有可能的领域都取得了显著的进展。它给创造力提供了翅膀,提升了分析和决策能力。在过去几个月中,生成式人工智能变得越来越受欢迎。从组织到人工智能研究人员,每个人都在探索生成式人工智能在产生独特和原创内容方面的巨大潜力,而且还可以在各个领域产生这些内容。 什么是生成式人工智能? 生成式人工智能是指使用算法来生成、操纵和合成数据的任何类型的过程。它可以解释为人工智能的一个子集,通过从现有数据中学习来生成新数据。新内容具有一定的创造力和独特特征,可以是图像或可读文本形式的数据,并生成之前不存在的内容。 生成式人工智能如何被使用? 生成式人工智能自引入以来一直在快速发展。大型语言模型(LLMs)的发展可以说是生成式人工智能突然增长的主要原因之一。LLMs是设计用于处理自然语言和生成类似人类回应的人工智能模型。OpenAI的GPT-4和Google的BERT是近年来取得重大进展的杰出示范,从聊天机器人和虚拟助手的开发到内容创作。生成式人工智能被应用于内容创作、虚拟助手的开发、人类模仿聊天机器人、游戏等领域。生成式人工智能也被应用于医疗保健行业,为患者生成个性化的治疗计划,提高医疗诊断的准确性等。 什么是MLOps? 随着每个公司都试图将AI ML的潜力融入其服务和产品中,MLOps变得越来越受欢迎。MLOps(机器学习运营)是机器学习工程的一个重要功能,主要关注将ML模型投入生产,并进行后续维护和监控的流程优化。它结合了DevOps和ML的特点,帮助组织以最少的资源和最高的效率设计稳健的ML流水线。 MLOps在提升生成式人工智能能力方面的优势 生成式人工智能的训练和部署模型的复杂性需要大量的计算资源和专用基础设施。与生成式人工智能结合使用时,MLOps可以通过提供一个管理生成式人工智能模型的开发和部署的优秀框架,以及自动化所涉及的流程来解决这些挑战。对于组织来改善基础设施,整合MLOps可以帮助它们在生成式人工智能应用中包括参数优化、自动化部署和扩展等功能而无需额外的人工成本。 MLOps为生成式人工智能提供的主要优势是效率、可扩展性和风险降低。除此之外,MLOps还可以在以下方面做出贡献: 数据管理:MLOps可以帮助管理用于训练生成式人工智能模型的大量数据,确保数据质量高、多样性,并符合所需领域的要求。 模型开发:MLOps可以在整个模型开发过程中提供帮助,包括训练、测试和验证,并提供版本控制、代码审核等工具。 部署:MLOps可以帮助自动化部署生成式人工智能模型,简化生产过程。 扩展:MLOps可以帮助处理不断增长的流量。包括提供管理基础设施和数据量的工具。 监控和维护:MLOps可以通过检测问题、检查性能异常等方式监控工作中的生成式人工智能模型的性能。 结论 由于更多数据的可用性、计算技术的进步以及生成独特和创新内容的能力,生成式人工智能正变得越来越受欢迎。通过引入MLOps,它可以在管理生成式人工智能模型的生命周期中发挥关键作用,从而充分发挥产品和应用的潜力。
Leave a Comment对于包括语言和代码翻译、组合思维和基本算术运算在内的各种下游任务,像GPT-3/4、PaLM和LaMDA这样的大型语言模型展示了通用功能,有时还会出现新的技能。也许令人惊讶的是,模型的训练目标通常是基于下一个标记的预测的自回归损失,它并没有直接编码这些目标。这些技能在早期的研究中已经深入探讨过,同时还探讨了它们在训练计算规模、数据类型和模型大小变化时的变化。然而,鉴于数据的复杂性和评估的工作范围,仍然很难分离这些因素。他们出于好奇,想要确定加速这些能力出现的主要因素,因为他们对于促使这些能力在下一个标记预测者中出现的因素感到好奇。 这些因素包括数据的格式和大小、模型的大小、预训练的存在以及提示的风格。他们的工作是在受控环境中进行的,以便更全面地分析这些参数。他们着重教授数学给小型Transformer模型,包括NanoGPT和GPT-2,在从随机初始状态进行训练时。他们使用常见的自回归下一个标记预测损失,从具有1060万参数的模型缩放到具有1.24亿参数的模型。来自UW Madison的研究人员旨在理解这些模型如何有效地学习加法、减法、乘法、平方根和正弦等基本数学运算,从而让我们对于如何引发新出现的才能有更深入的了解。他们在下面概述了他们的结论。 样本大小和数据格式都很重要。 首先,他们指出使用典型的加法样本(例如“A3A2A1 + B3B1B1 = C3C2C1”)来教授模型加法并不理想,因为它强迫模型首先评估结果的最高位C3,而这取决于两个加数的所有位数的集体。通过训练模型使用结果反转的样本(例如“A3A2A1 + B3B1B1 = C1C2C3”),可以让模型学习一个更简单的函数,这大大增加了样本的复杂性。进一步增强学习的是许多“变体”的样本,这些样本依赖于涉及的位数和进位。即使在这种简单的情况下,他们观察到训练数据量的增加会导致从0%到100%的准确性突变。出乎意料的是,他们指出完成低秩矩阵与从随机样本学习n位加法映射相似。由于这种联系,他们可以对这种阶段性变化提供逻辑上的解释。 认知流动数据的培训。 基于这些发现,他们研究了在培训过程中使用思维链数据的可能优势。这种格式使模型能够学习困难任务的不同元素,因为它包括逐步操作和中间输出。这种结构直接源自相关文献,例如。根据CoT微调文献,他们发现CoT类型的训练数据在样本复杂性和准确性方面显著提高了学习效果,即使在没有语言预训练的情况下,他们的发现仍然成立。他们假设这是因为模型可以通过将需要实现的复合函数分解为单个组件来学习一个更高维度但更简单的函数映射。他们在他们的研究中给出了他们研究的四种数据格式技术的样本,如图1所示。 文本和数学混合训练。 由于LLM模型是在从互联网下载的大量数据上进行训练的,其中很难清洗各种形式的数据,因此他们还研究了文本和数值数据在训练过程中的交互方式。他们跟踪文本与算术输入的比例对模型的困惑度和准确性的影响。他们发现了先前处理的算术操作可以分别增强每个任务的性能,并且从零-shot提示到一-shot提示的切换显著增加了准确性。然而,当提供更多的示例时,准确性的提高不太明显。模型大小和预训练的重要性。 预训练和模型规模的作用。 此外,他们研究了通过微调像GPT-2和GPT-3这样的模型来研究预训练的作用,并发现虽然零-shot性能在算术操作上表现不佳,但预训练期间开发的先前“技能”使得在一些基本算术任务上能够达到可接受的性能,即使只有有限数量的微调样本。然而,当模型在标准格式的操作上进行预训练时,微调非标准格式(如反向格式)可能会干扰模型性能并降低准确性。最后,他们研究了规模对算术性能的影响,并发现虽然规模确实有助于学习算术运算,但并不是必要条件。 长度和组成的泛化。 人们可能会想知道他们训练的模型是否对数学有深入的理解。他们的研究给出了一个复杂的答案。他们发现将长度推广到训练数字长度之外是具有挑战性的。例如,如果模型在所有n位数长度上进行训练,但排除了某个特定长度,那么它会发现很难调整并正确计算这个缺失的数字长度。因此,模型在训练数字长度范围内表现良好,但在范围之外的地方表现要差得多。这表明模型更多地将算术视为一种映射函数,而不是一种灵活的过程。这超出了死记硬背,但不足以对数学进行彻底的“理解”。 创新与以前的努力。 他们并不声称他们的方法在所利用的训练数据类型方面是原创的,而是强调它在以前的研究中利用教育性数据来提高模型性能的工作上。关于随机初始化模型的主要强调,以及对各种采样/数据格式和模型规模设置进行深入的消融研究,以分离导致算术能力快速形成的变量,这使他们的工作与该领域的其他研究有所区别。此外,他们在研究中发现的一些现象有一些简单但可能具有启发性的理论解释。 图1:本研究中所检验的四种数据格式化技术如图所示。普通:普通的加法格式;反转:输出被反转;简化草稿本:逐位求和和进位;以及全面草稿本:全面的中间加法阶段。使用经过这些不同加法格式化技术处理过的数据,我们从头开始训练微型变压器模型。结果(显示在右侧)显示了数据格式化对性能和样本效果的重要性。随着数据格式中信息量的增加,普通永远无法达到100%的准确性,而其他技术学习完全加法的样本复杂度逐渐降低。
Leave a Comment语言模型(LMs)的出色性能表明,大规模的下一个单词预测可以将文本语料库中的知识有效地蒸馏成交互式代理。LMs在各种自然语言处理基准测试中取得了令人印象深刻的成果,超过了最先进的方法,甚至在需要复杂推理的任务中超过了人类。然而,至关重要的是确定它们的成功是源于任务通用推理能力还是在预训练期间识别和回忆特定任务。 以前的研究主要集中在实例级别的泛化,其中数据污染问题可能会复杂化。在这项研究中,研究人员通过改变执行良好任务的条件或规则来研究LMs对新任务变体的泛化能力。这些任务的一般推理过程保持不变,但是具体的输入-输出映射发生了变化。这些称为反事实任务的新任务偏离了默认条件,并衡量了模型的任务级泛化能力。 研究人员提出了一个由11个反事实评估任务组成的套件,涵盖了多个类别和领域。这些任务包括演绎推理、代码生成、绘图和空间推理。虽然原始任务和其反事实变体之间的推理过程保持一致,但是输入-输出映射不同。这个评估旨在评估LMs在适应新任务变体方面的灵活性。 对GPT-4、GPT-3.5、Claude和PaLM-2在任务的默认和反事实条件下的性能进行评估。结果表明,虽然LMs在反事实性能上表现出高于随机的表现,但与默认设置相比,它们的性能持续下降;这表明模型在这些任务上的成功部分归因于默认条件特定的行为,而不是抽象的、可推广的推理能力。 研究结果还揭示了默认任务和反事实任务之间的令人兴奋的关系。观察到默认和反事实性能之间的相关性,零-shot思维链提示的有效性以及任务和实例级频率效应之间的互动。总体而言,任务默认实例化的轻微变化对LMs构成了挑战,这表明现有模型的成功不应仅仅归因于它们对目标任务的通用能力。
Leave a Comment