Press "Enter" to skip to content

Month: November 2023

NVIDIA研究人员推出了一种与当前CTC模型兼容的GPU加速加权有限状态转导器(WFST)波束搜索解码器

“` 在最近的时期,随着人工智能的极度流行,自动语音识别(ASR)领域取得了巨大的进步。它改变了语音激活技术和人机交互的面貌。有了ASR,机器可以将口语转化为文字,这对于各种应用来说都是必不可少的,包括虚拟助手和转录服务。研究人员一直在努力寻找底层算法,因为需要更精确、有效的ASR系统。 在NVIDIA最近的研究中,一队研究人员研究了连接时序分类(CTC)模型的缺点。在ASR流水线中,CTC模型已成为获得很高准确度的主要竞争者。这些模型尤其擅长处理语音语言的细微差别,因为它们非常擅长解释时序序列。尽管准确,但传统的基于CPU的波束搜索解码方法限制了CTC模型的性能。 波束搜索解码过程是准确转录口语的关键阶段。传统的贪婪搜索方法使用声学模型来确定每个时间步长最有可能选择的输出令牌。在处理上下文偏差和外部数据时,这种方法面临许多挑战。 为了克服所有这些挑战,该团队提出了基于GPU加速的加权有限状态传递器(WFST)波束搜索解码器作为解决方案。这种方法旨在与当前的CTC模型无缝集成。有了这个GPU加速的解码器,可以提高ASR流水线的性能,同时提高吞吐量、降低延迟,并支持即时合成以进行针对特定话语的单词增强等功能。建议的GPU加速解码器特别适用于流式推理,因为它具有更高的流水线吞吐量和更低的延迟。 该团队通过在离线和在线环境中测试解码器来评估这种方法。与最先进的CPU解码器相比,GPU加速解码器在离线场景中的吞吐量提高了多达七倍。在在线流媒体场景下,GPU加速解码器实现了超过八倍的较低延迟,同时保持相同或更高的词错误率。这些研究结果表明,使用建议的GPU加速WFST波束搜索解码器可以显著提高效率和准确性。 总而言之,这种方法绝对可以在克服CTC模型中基于CPU的波束搜索解码的性能限制方面发挥出色。建议的GPU加速解码器是CTC模型在离线和在线环境中最快的波束搜索解码器,因为它提高了吞吐量,降低了延迟,并支持高级功能。为了帮助解码器与基于Python的机器学习框架集成,该团队在GitHub上提供了预构建的基于DLPack的Python绑定。这项工作增加了建议解决方案对于使用ML框架的Python开发人员的可用性和可访问性。代码存储库可以在https://github.com/nvidia-riva/riva-asrlib-decoder访问,其中描述了CUDA WFST解码器作为C++和Python库。 “`

Leave a Comment

UC Berkeley的研究人员提出了一种人工智能算法,可以实现零样本学习目标导向对话代理的获取

大型语言模型(LLM)在各种自然语言任务中表现出很强的能力,例如文本摘要、问答和代码生成等,成为许多实际问题的强有力解决方案。然而,这些模型在目标导向对话方面存在困难,即需要通过对话实现目标,例如作为一名有效的旅行顾问提供量身定制的旅行计划。在实践中,它们通常提供冗长且非个性化的回答。 使用有监督的微调或单步强化学习(RL)训练的模型通常在此类任务中表现出困难,因为它们在多次交互后未针对整体对话结果进行优化。此外,它们在处理此类对话中的不确定性方面也存在不足。在本文中,来自加州大学伯克利分校的研究人员探索了一种将RL与LLMs相结合以实现目标导向对话的新方法。他们的贡献包括一种优化的零样本算法和一种名为”imagination engine (IE)”的新系统,该系统可生成与任务相关且多样化的问题以训练下游代理。 由于IE本身无法生成有效的代理,研究人员利用LLM生成可能的情景。为了增强代理实现期望结果的能力,需要使用多步强化学习来确定最优策略。研究人员对此方法进行了一次修改。他们使用线下基于值的RL从合成数据本身学习策略,而不是使用任何在线策略样本。 为了测试他们方法的有效性,研究人员将GPT代理和IE+RL代理的性能进行了人工评估对比。他们考虑了两个基于实际问题的目标导向对话。研究人员在IE中使用GPT-3.5模型生成合成数据,并使用一个相对较小的仅解码器的GPT-2模型作为下游代理。这使得他们的方法更实用,因为仅在数据生成阶段需要先进模型,从而降低了计算成本。 根据他们的实验,他们发现他们提出的代理在所有度量指标上均优于GPT模型,并确保了对话结果的自然性。从定性结果来看,IE+RL代理的表现也优于其相对应的代理。它生成易回答的问题,并且根据前一个问题智能地提出后续问题。研究人员还使用模拟比较了这两个代理的性能。虽然两者几乎相当,IE+RL代理优于GPT代理,但在定性评估中能够产生更好的结果。 总之,在这篇研究论文中,作者介绍了一种改善LLMs在目标导向对话中性能的方法。他们使用想象引擎生成多样化、与任务相关且真实的合成数据来训练对话代理。更具体地说,他们使用线下方法来避免计算成本。结果表明,他们的方法始终胜过传统方法,为未来的改进铺平了道路。他们相信,这个过程还可以进一步自动化,以提高零样本对话代理的性能,从而改善我们与人工智能系统的互动方式。

Leave a Comment

这篇AI论文介绍了LCM-LoRA:通过先进的潜在一致性模型和LoRA蒸馏来改变文本到图像生成任务的革命性方法

“` 潜在扩散模型是机器学习中常用的生成模型,特别是在概率建模中。这些模型旨在捕捉数据集的潜在结构或潜在变量,通常专注于生成逼真的样本或作出预测。它们描述了系统随时间的演变。这可以指从初始分布通过一系列步骤或扩散过程将一组随机变量转化为所需分布。 这些模型基于ODE-Solver方法。尽管减少了推理步骤的数量,但它们仍然需要大量的计算开销,特别是在融入无分类器的引导时。Guided-Distill等蒸馏方法是有希望的,但由于它们的计算需求密集,必须进行改进。 为了解决这些问题,出现了对潜在一致性模型的需求。他们的方法涉及到一个反向扩散过程,将其视为增广的概率流ODE问题。他们创新地在潜在空间中预测解,并通过数值ODE求解器避免了迭代解决方案的需要。在生成高分辨率图像的remarkable综合中,只需要1到4个推理步骤。 清华大学的研究人员通过将LoRA蒸馏应用到Stable-Diffusion模型中,包括SD-V1.5、SSD-1B和SDXL,扩展了LCM的潜力。他们通过实现卓越的图像生成质量,扩大了LCM在具有显著较少内存消耗的大型模型中的应用范围。对于专用数据集,如动画、照片逼真或幻想图像,还需要额外的步骤,例如使用潜在一致性蒸馏(LCD)将预训练的LDM蒸馏为LCM,或直接使用LCF对LCM进行微调。然而,在自定义数据集上是否可以实现快速、无需训练的推理呢? 团队引入了LCM-LoRA作为一个通用的无训练加速模块,可以直接插入到各种Stable-Diffusion经过微调的模型中来回答这个问题。在LoRA的框架内,所得到的LoRA参数可以无缝地集成到原始模型参数中。团队已经证明了在潜在一致性模型(LCMs)蒸馏过程中应用LoRA的可行性。LCM-LoRA参数可以直接与其他LoRA参数组合,并在特定风格的数据集上进行微调。这将使人们能够在特定风格中以最少的采样步骤生成图像,而无需任何进一步的训练。因此,它们代表了适用于各种图像生成任务的一种普遍适用的加速器。 这种创新方法显著减少了迭代步骤的需求,实现了从文本输入快速生成高保真度图像,并为最先进的性能设定了新的标准。LoRA显著减少了需要修改的参数的数量,从而提高了计算效率,并允许用较少的数据进行模型改进。 “`

Leave a Comment

Palo Alto Networks推出Cortex XSIAM 2.0平台:具备独特的自主机器学习(BYOML)框架

Translate this html (keep the html code in the result) to Chinese: 在网络安全领域,组织面临着高效管理安全情报和自动化的挑战。其中一个普遍存在的问题是需要有效的机器学习模型来增强安全措施。传统上,安全团队仅限于预定义的模型,这使得适应不断发展的威胁变得困难。 某些解决方案已经存在来解决这个挑战,但它们通常需要安全团队更多的灵活性。这些解决方案不允许安全专业人员根据特定需求创建和实施他们的机器学习模型。这种限制限制了在欺诈检测、安全研究和数据可视化等领域发挥机器学习潜力的能力。 Palo Alto Networks 推出了 Cortex XSIAM 2.0 平台,其中包含一个独特的 BYOML(Bring-Your-Own-Machine-Learning)框架。该框架通过提供对存储在 XSIAM 上的大量安全数据的访问,赋予安全团队建立和利用自己的机器学习模型的能力,从而实现更高的定制和适应性。…

Leave a Comment

掌握数据科学战略的艺术:与人工智能领域的先驱Vin Vashishta进行对话

潜入Analytics Vidhya的数据科学转型世界,通过Analytics Vidhya领先数据系列的突破性演讲《以数据为先导》。在这个系列的独家采访中,Analytics Vidhya的CEO Kunal Jain与杰出的人工智能领导者Vin Vashishta进行了一场激动人心的对话。揭示Vin的旅程的秘密,他从技术职位转变为领导职位的战略性转变,分享了宝贵的见解和经验。 与Vin Vashishta,V Squared的创始人兼人工智能顾问对话 让我们开始吧! 关键见解 踏上Vin Vashishta非凡的旅程,从安装个人电脑到成为人工智能战略的开拓者。 揭示他对领导者关键决策的看法:在快速解决方案与数据科学应用的可靠性之间取得平衡。 深入了解Vin在行业趋势爆发前预见行动的独特过程,指导他在不断变化的环境中的战略举措。 探索他的创业起源并见证其多年来的发展,亲身经历了挑战和胜利的第一手账户。 深入了解Vin对商业愿景的重要性的信念,即使对于最新技术的晚期采用者,也为持续成功提供动力。 了解为什么Vin主张技术专家进入不同的领域,强调在快速发展的领域中前进的必要性。 您是如何开始您的数据科学之旅的? 起初,我接受教育以成为土木工程师,追随着我父亲的脚步。然而,我12岁时第一次接触编程对我产生了深远的影响。我被在虚拟环境中创造东西的能力所吸引。大学的第一年我上了一门编程课程,立刻就知道这是我的激情所在。我的注意力转移到了编程上,那大约是在1994-1995年。我的数据科学之旅并不直接。我在90年代的第一次人工智能繁荣周期中毕业。尽管我渴望为微软工作并构建先进的模型,但我一直从事更传统的软件工程角色。我从安装个人电脑一步步升职到建立网站和数据库管理。我的第一份公司工作涉及到在公司内部安装软件和平台,直接与客户合作。这种经历至关重要,因为它教会了我交付软件承诺的重要性。 您在数据科学模型方面早期面临的挑战是什么? 我的第一个数据科学项目是在2012年,那时候我们没有今天这样的库和资源。我使用不同的语言构建模型,包括C、C++和Java,因为由于技术限制我们必须对所有东西进行优化。我们没有现在这样的云基础设施,大规模的数据只有大型公司才能获得。我早期的客户是大型公司,直到2016年才有中小型企业来找我。与这些较小的客户合作使我遇到了现实世界的限制,如预算和时间,这与企业界有所不同。 您是如何从技术角色过渡到战略和领导角色的? 在2012年被解雇后,我迅速将我的副业咨询转变为全职事业,创办了V…

Leave a Comment

见到JARVIS-1:具有记忆增强的多模态语言模型的开放世界多任务代理

北京大学、加州大学洛杉矶分校、北京邮电大学和北京智能通用人工智能研究院的研究团队引入了JARVIS-1,这是一个用于Minecraft开放世界任务的多模态代理。借助预训练的多模态语言模型,JARVIS-1解释视觉观察和人类指示,生成复杂的内在控制计划。 JARVIS-1利用多模态输入和语言模型进行规划和控制。建立在预训练的多模态语言模型之上,JARVIS-1整合了一个多模态记忆,用于基于预训练知识和游戏经验的规划。在200个不同任务中实现接近完美的性能,尤其在具有挑战性的长期任务中表现出色,完成率提高了五倍。研究强调了多模态记忆在增强代理自主性和在开放世界场景中的智能性方面的重要性。 该研究解决了在开放世界环境中创建复杂任务的复杂代理的挑战。现有方法需要在多模态数据、长期规划和终身学习方面进行改进。基于预训练的多模态语言模型构建的JARVIS-1代理在Minecraft任务中表现出色。JARVIS-1在200个任务中几乎达到完美的表现,并显著改进了钻石凿任务。该代理展示了自主学习的能力,在很少外部干预的情况下不断演化,为追求普适能人工智能做出了贡献。 基于预训练的多模态语言模型构建的JARVIS-1将视觉和文本输入结合起来生成计划。代理的多模态记忆将预训练知识与游戏经验相结合,用于规划。现有方法使用了分层目标执行架构和大型语言模型作为高层规划器。JARVIS-1在Minecraft宇宙基准的200个任务上进行评估,揭示了由于控制器对短期文本指令执行不完美而导致的钻石功能挑战。 JARVIS-1的多模态记忆促进了自我提升,通过超越其他指令跟随代理,提升了智能和自主学习。在具有挑战性的任务中,JARVIS-1在钻石相关任务中的成功率几乎提高了三倍,超过了没有记忆的DEPS代理。该研究强调了改进计划生成以便更容易执行和增强控制器在钻石相关任务中遵循指令的能力的重要性。 基于预训练的多模态语言模型构建的开放世界代理JARVIS-1在Minecraft宇宙中精通多模态感知、计划生成和内在控制。整合多模态记忆通过利用预训练知识和实时经验来增强决策。JARVIS-1显著提高了长期任务如钻石凿的完成率,使之较之前的记录提高了最高五倍。这一突破为在复杂虚拟环境中开发多功能和适应性代理的未来发展奠定了基础。 进一步的研究建议改进任务执行的计划生成,提高控制器在钻石相关任务中遵循指令的能力,并研究简化执行的方法。提出了通过多模态记忆和实时经验增强开放世界情境中决策能力的方式。建议扩展JARVIS-1在Minecraft中更广泛任务范围的能力,并可能适应其他虚拟环境。该研究鼓励通过终身学习实现不断改进,促进JARVIS-1的自我提升和更大的智能和自主性的发展。

Leave a Comment

从广州到洛杉矶,汽车制造商以人工智能驱动的车辆令人眼花缭乱

汽车爱好者们有好消息:现在到下周都将进行的两个备受赞誉的车展,通过展示由人工智能驱动的下一代汽车设计,让参观者们大呼过瘾。 预计来自世界各地的数十万汽车爱好者将前往中国广州,这个被誉为“花城”的城市参加其车展,活动将于11月26日(星期日)结束。这次活动将展示电动汽车(EV)和自动驾驶方面的最新发展,共有1100辆车展出。 而在世界的城市之一——洛杉矶,洛杉矶车展预计将达到有史以来最高的参观人数。该展览也将持续到11月26日,除了展出私人收藏的古董车和豪华车外,还设有公开测试赛道,参观者可以亲身体验最新的电动汽车。 广州车展 Human Horizons, NIO, ZEEKR 最受期待的之一是莲花(Lotus)的全新纯电动Emeya Hyper-GT,这款豪华车型于9月发布。这款令人惊叹的豪华车拥有运动车的灵活性,并搭载双 NVIDIA DRIVE Orin 处理器提供强大的智能功能。高性能处理能力使驾驶员可以享受车辆的安全驾驶能力,并通过空中升级(OTA)支持未来功能。 为了安全起见,Emeya搭载了34个先进的环绕传感器,用于实时处理多样化和冗余的传感器数据,让驾驶员在车辆后方嵌入了DRIVE Orin处理器,Emeya可以提供先进的驾驶辅助系统(ADAS)功能,并且具备支持自主驾驶未来的内部空间。 Emeya Hyper-GT采用了莲花创新的Electric Premium Architecture,该架构还支撑了Eletre Hyper-SUV,同样由NVIDIA DRIVE Orin提供动力。 此外,莲花还展示了其全系列的电动汽车,包括Evija超级跑车、Eletre Hyper-SUV和最近推出的Type…

Leave a Comment

与杰普森·泰勒一起揭开人工智能的未来

在这一集的《Leading With Data》中,我们与纽约大学的联合AI大师班负责人、Dataiku的前首席AI战略师Jepson Taylor进行了互动。在展望人工智能的未来时,Taylor分享了他旅程中的关键时刻的宝贵见解——从化学工程到人工智能创业、成功的初创公司收购以及生成式人工智能的兴起。 让我们一起深入探讨! 与Jepson Taylor的对话关键见解 生成式人工智能是开启通往AGI道路的关键,革新问题解决和创新方法。 从传统编程转向人工智能需要对技术的热情和冒险精神,比如离开稳定的工作追求创业。 讲故事成为人工智能专业人士的关键技能,能够有效地将复杂的想法传达给高管和利益相关者。 人工智能的未来 embraces 生成式算法,使得人工智能系统能够自主撰写和增强代码,带来更高效和强大的应用。 人工智能初创公司的胜利取决于招募正确的人才,强调有经验的专业人士,他们能够负责自己的工作,并推动公司发展。 在接下来的部分,我们总结了在《Leading With Data》会议上向Jepson Taylor提出的问题。 你从化学工程到人工智能创业的旅程是如何开始的? 在学习化学工程时,我并没有做太多的编程,但有两个平行的路径改变了这一点。首先,我在上学期间创办了一家电子商务公司,这是我在Web编程方面的基础。其次,我在数值方法课上的一位鼓舞人心的老师向我介绍了遗传算法和模拟退火。这激发了我对编程的热情,特别是在计算机可以为你工作的领域,比如高性能计算和计算机视觉。我的工程项目始终有一个编程的延伸,甚至曾经因为在化学工程实习期间进行卫星图像处理而受到批评! 从化学工程转向人工智能,哪些是关键时刻? 起初,我以为自己会去医学院攻读MD-PhD,将医学研究与编程相结合。然而,我爱上了编程和计算机视觉,意识到与医疗保健相比,我可以通过人工智能产生更大的影响。在深度学习出现之前,计算机视觉更多地是一门艺术,需要费力的启发式方法。深度学习改变了这一点,不再需要构建这些复杂规则。 你能分享一下你的初创公司被DataRobot收购的故事吗? 2016年,我和我的合作伙伴参加了犹他州的一个创业比赛,介绍了一个AutoML解决方案。通过创建一个用于结构化数据上传的Web表单,它可以在不到40秒的时间内提供一个AutoML模型的分析结果。数据质量让我们震惊,促使我们转向深度学习。放弃工作是从“创业者”过渡到企业家的关键一步,我们与 Teal…

Leave a Comment

“认识mPLUG-Owl2:一种多模基础模型,通过模态协作改进多模大语言模型(MLLMs)”

“`html 大型语言模型以其仿人能力在人工智能界引起了轰动。凭借出色的文本理解和生成能力,如GPT-3、LLaMA、GPT-4和PaLM等模型受到了广泛关注和热潮。GPT-4是OpenAI最近推出的模型,由于其多模态能力,引起了人们对视觉和语言应用融合的兴趣,也因此产生了多模态大型语言模型(MLLMs)。MLLMs的引入是为了通过添加视觉问题解决能力来改进它们。 研究人员一直在关注多模态学习,之前的研究发现多种模态可以很好地同时提高文本和多模态任务的性能。目前现有的解决方案,如跨模态对齐模块,限制了模态协作的潜力。大型语言模型在多模态指导下进行细化,这导致文本任务性能有所降低,产生了一大挑战。 为了解决所有这些挑战,阿里巴巴集团的研究团队提出了一种名为mPLUG-Owl2的新型多模态基础模型。mPLUG-Owl2的模块化网络架构考虑了干扰和模态协作。该模型结合了常见的功能模块,以鼓励跨模态协作,并使用模态适应模块在各种模态之间无缝过渡。通过这样做,它利用语言解码器作为通用接口。 这种模态适应模块通过将语言和视觉模态投影到共同的语义空间中保证两种模态之间的协作,同时保持模态特定特征。团队为mPLUG-Owl2提出了一个两阶段的训练范式,包括联合视觉-语言指导调优和视觉-语言预训练。借助这种范式,视觉编码器能够更高效地收集高层和低层语义视觉信息。 研究团队进行了各种评估,并展示了mPLUG-Owl2在文本问题和多模态活动中的概括能力。该模型通过在各种任务中实现最先进的性能,展示了其作为单一通用模型的多样性。研究表明,mPLUG-Owl2是独特的,因为它是第一个在纯文本和多模态场景中展示模态协作的MLLM模型。 总之,mPLUG-Owl2无疑是多模态大型语言模型领域的重大进展和重要一步。与早期主要集中于增强多模态技能的方法不同,mPLUG-Owl2强调模态之间的协同作用,以在更广泛的任务范围内提高性能。该模型采用了模块化的网络架构,其中语言解码器作为控制各种模态的通用接口。 “`

Leave a Comment