Press "Enter" to skip to content

Month: November 2023

斯坦福大学研究员推出FlashFFTConv:一种新的人工智能系统,用于优化长序列的FFT卷积

Translate this html (keep the html code in the result) to Chinese: 高效地在延长序列中进行推理是机器学习中的主要难题。最近,卷积已经成为序列建模的关键原始,支持语言建模、时间序列分析、计算机视觉、DNA建模等领域的最新性能。尽管有这些令人印象深刻的质量发现和其他优势,如随着序列长度增加的改进稳定性和更好的可扩展性,卷积序列模型仍然比Transformer模型慢得多。 一个主要原因是硬件支持不稳定。与视觉应用中使用的短滤波器相比,序列建模中的卷积经常使用与输入序列长度一样长的滤波器。快速傅里叶变换(FFT)卷积算法通过映射输入和输出频率来计算输入u和卷积核k之间的卷积。 尽管渐近有效,但FFT卷积算法在现代加速器上的计时效果较低。然而,系统技术的进步使得Transformer模型能够达到当前加速器的极限,在使用FlashAttention-v2时,端到端FLOP使用率超过72%。 为了提供更长的上下文能力,斯坦福大学的一项新研究调查了如何在现代加速器上优化FFT卷积方法。研究人员认为,随着FlashAttention等系统的进步,导致了更好的模型和新的注意力算法,优化FFT卷积将会产生新的更好的算法,提升卷积序列模型的质量。 FFT卷积可以很容易地优化短序列。常见的做法是在多个批次中重复使用卷积核滤波器,这使得可以在重复使用之前预先计算滤波器的FFT。因此,FFT卷积在批次和滤波器之间是并行的,并且内核融合允许将中间卷积输出缓存在静态随机存取存储器(SRAM)或寄存器中。 然而,团队指出,随着序列长度的增加,出现了两个主要瓶颈。就当前加速器而言,FFT卷积不会充分利用专用矩阵-矩阵乘法单元。 其次,随着序列变得过长而无法适应SRAM,内核融合失败,需要进行昂贵的输入/输出操作。用于因果关系的填充操作以及从实值输入/输出转换为复值FFT中间结果可能进一步增加这些I/O成本。 为此,研究人员提出了一种名为FlashFFTConv的新算法,该算法采用了FFT的Monarch分解,以优化针对长序列的FFT卷积。通过p阶Monarch分解,FFT可以通过一系列p个矩阵-矩阵乘法操作有效地传输到硬件中。较大的p值由于较小的矩阵而导致更少的FLOP成本,但需要更多的I/O来传递中间结果。因此,涉及到权衡。 该研究演示了如何基于序列长度使用简单的成本模型来优化FLOP成本和I/O成本,在GPU上优化p。除了在更长的序列长度上促进内核融合之外,该分解还减少了必须在SRAM中维护的序列的数量。因此,FlashFFTConv可以轻松处理从256个字符到400万个字符的序列。通过使用实值FFT算法并在输入进行零填充时跳过部分矩阵-乘法操作,FlashFFTConv可以将FFT操作的长度减少多达一半。最后但并非最不重要的是,FFT卷积的矩阵视图为实施两个架构修改提供了简单的界面:偏差卷积和频率稀疏卷积。这两种方法可以简单地通过省略矩阵分解的部分来实现,从而降低内存占用和计时运行时间,并可以看作是Transformer中稀疏/近似注意力的卷积并行。 研究人员证明了FlashFFTConv加速了FFT卷积,从而实现了更好的质量、更高效和更长的序列模型。 通过更好的效率,FlashFFTConv提高了卷积序列模型的质量:在相同的计算预算下,FlashFFTConv使Hyena-GPT-s的困惑度提高了2.3个点,并使M2-BERT-base的平均GLUE分数提高了3.3个,性能提升相当于模型参数加倍。 与PyTorch相比,FlashFFTConv在卷积效率方面提高了高达7.93倍,并在内存节省方面提高了高达5.60倍,而且这种高效性在序列长度上可以达到四个数量级。对于长度为2K及以上的序列,FlashFFTConv在计时效果上快于FlashAttention-v2端到端,原因是FLOP成本更低,并且实现了高达62.3%的端到端FLOP使用率,仅比FlashAttention-v2少10%。 FlashFFTConv使更长序列的模型成为可能。FlashFFTConv生成的模型是唯一能够完成长阶竞技场基准的Path-512作业(序列长度为256K)的模型,用于高分辨率图片分类。FlashFFTConv是第一个以单核苷酸分辨率嵌入最长人类基因(长达230万个碱基对)的模型;通过部分卷积,它将HyenaDNA扩展到4M的序列长度。…

Leave a Comment

使用Amazon SageMaker Studio与Llama 2、LangChain和Pinecone来构建一个RAG问答解决方案,以便进行快速实验

检索增强生成(RAG)允许您为大型语言模型(LLM)提供对外部知识源(如资料库、数据库和API)的访问权限,而无需对模型进行精细调节在使用生成型人工智能进行问答时,RAG使得LLM能够以最相关、最新的信息来回答问题,并可选择引用[…].

Leave a Comment

什么是超级NIC?

生成式人工智能是快速变化的数字领域中的最新转变。其中一个开创性的创新是一个相对较新的术语:SuperNIC。 什么是SuperNIC? SuperNIC是一类新的网络加速器,旨在为以太网云中的超大规模人工智能工作负载提供超高速的网络连接。它利用基于收敛以太网(RoCE)技术的远程直接内存访问(RDMA),实现了GPU到GPU通信的闪电般快速的网络连接速度,最高可达到400Gb/s。 SuperNIC具备以下独特的特点: 高速的数据包重新排序,确保数据包按照原始传输的顺序接收和处理,从而保持数据流的顺序完整性。 使用实时遥测数据和网络感知算法进行先进的拥塞控制,以管理和预防人工智能网络中的拥塞。 在输入/输出(I/O)路径上进行可编程计算,以实现人工智能云数据中心网络基础设施的定制和可扩展性。 高效节能的低轮廓设计,以在有限的功率预算内有效容纳人工智能工作负载。 全栈人工智能优化,包括计算、网络、存储、系统软件、通信库和应用框架。 最近,NVIDIA推出了世界上第一个专为人工智能计算定制的SuperNIC,基于BlueField-3网络平台。它是NVIDIA Spectrum-X平台的一部分,能够与Spectrum-4以太网交换机系统无缝集成。 NVIDIA BlueField-3 SuperNIC和Spectrum-4交换机系统共同构成了一个专为优化人工智能工作负载而设计的加速计算架构的基础。Spectrum-X始终提供高网络效率水平,胜过传统以太网环境。 “在人工智能推动下一波技术创新的世界中,BlueField-3 SuperNIC是重要的部件,” NVIDIA数据处理器和网络接口卡产品副总裁Yael Shenhav表示,“SuperNIC确保您的人工智能工作负载高效而快速地执行,成为推动人工智能计算未来的基础组件。” 人工智能和网络的不断演变 由于生成式人工智能和大型语言模型的出现,人工智能领域正在发生巨大变革。这些强大的技术打开了新的可能性,使计算机能够处理新的任务。 人工智能的成功在很大程度上依赖于GPU加速计算,用于处理海量数据、训练大型人工智能模型和实现实时推理。这种新的计算能力开辟了新的可能性,但也对以太网云网络提出了挑战。 传统以太网作为支撑互联网基础设施的技术,最初是为了提供广泛的兼容性和连接松散耦合的应用程序而设计的。它并不适用于处理现代人工智能工作负载的要求,这些要求包括紧密耦合的并行处理、快速数据传输和独特的通信模式,它们都需要优化的网络连接。 基础网络接口卡(NIC)是为通用计算、通用数据传输和互操作性而设计的,它们从未被设计用于应对人工智能工作负载的计算强度所带来的独特挑战。 标准的网络接口卡缺乏有效数据传输、低延迟和决定性性能对于人工智能任务至关重要的特性和功能。而SuperNIC则是专为现代人工智能工作负载而构建的。 人工智能计算环境中的SuperNIC优势…

Leave a Comment

解密数据驱动的旅程 Paisabazaar首席执行官的见解

介绍 在《以数据为导向》的这一集中,Kunal Jain与Paisabazaar的首席执行官Naveen Kukreja进行了对话。解密Naveen在银行和金融服务领域的卓越职业生涯,以及在印度不断演变的数字领域中开创数据为中心的战略。让我们通过Naveen在Paisabazaar的经验和领导力,解读数据在业务中的转变能力。 关键见解 拥抱以数据为中心的商业模式对现代决策至关重要,但也具有挑战性。 业务增长取决于适应数字转型和利用类似India Stack的倡议。 数据科学的重要性在企业规模扩大时增强,特别是在量身定制产品/服务以满足消费者需求方面。 公开上市带来纪律和透明度,并对增长和盈利能力采取平衡的方法产生影响。 在数据驱动的组织中有效的领导力需要直觉和数据支持的决策相融合。 人工智能(AI)和机器学习(ML)对未来业务产生深远影响,强调了灵活性和技能提升的需求。 转向数据分析需要实践经验和强大的技术团队。 个人兴趣和持续学习有助于培养全新的视角,促进职业成长。 你能分享一下你是如何进入银行、金融服务和分析领域的吗? 我在印度卡尔卡塔的印度管理学院校园招聘时偶然进入了银行和金融服务领域。我对消费者行为和营销感兴趣,但城市银行改变了我的职业轨迹。我真正接触到分析是在英国的Capital One,在那里数据驱动的决策是业务的核心,这与印度在21世纪初的发展数字领域形成了鲜明对比。 你是如何适应Capital One的数据为中心的环境的? 这个转变是具有挑战性但极为宝贵的。我从城市银行转到Capital One,深入了解信用卡业务并学习在数字成熟市场中的新技能。没有数据分析背景的情况下管理一个分析团队是很困难的,但这磨练了我的决策能力,并教会了我数据在推动业务结果方面的重要性。 是什么促使您回到印度并进入保险行业? 2007年和2009年的全球金融危机使我重新考虑了我的职业道路。Capital One遭遇了困难时期,而我看到了印度不断增长的保险行业中的机会。在Aviva,我从零开始建立了交叉销售和分析功能,这是非常令人兴奋并且与我的优势相符。 您在Aviva的经验如何导致Paisabazaar的创立?…

Leave a Comment

“遇见 GO To Any Thing(GOAT):一种通用导航系统,可以在完全未知的环境中,以图像、语言或类别的方式查找任何指定对象”

来自伊利诺伊大学厄巴纳-香槟分校、卡内基梅隆大学、乔治亚理工学院、加州大学伯克利分校、Meta人工智能研究机构和Mistral人工智能团队的研究人员合作开发了一种名为GO To Any Thing(GOAT)的通用导航系统。这个系统是为家庭和仓库环境中延长自主运行时间而设计的。GOAT是一个多模态系统,可以从类别标签、目标图像和语言描述中解释目标。它是一个终身系统,受益于过去的经验。GOAT适用于各种机器人实体。 GOAT是一个用于移动机器人的多功能导航系统,能够利用类别标签、目标图像和语言描述在各种环境下进行自主导航。GOAT利用深度估计和语义分割创建一个3D语义体素地图,用于准确的对象实例检测和记忆存储。语义地图有助于空间表示、跟踪对象实例、障碍物和已探索区域。 GOAT是一个受到动物和人类导航洞察力启发的移动机器人系统。GOAT是一个通用导航系统,能够在各种环境中自主运行,根据人类输入执行任务。GOAT是多模态、终身学习和平台无关的,使用类别标签、目标图像和语言描述进行目标规定。该研究评估了GOAT在到达未见过的多模态对象实例方面的性能,并强调了它在以前方法中基于SuperGLUE的图像关键点匹配优于CLIP特征匹配的优越性。 GOAT是一个通用导航系统,采用模块化设计和实例感知的语义记忆,用于基于图像和语言描述的多模态导航。该计划是通用的、适应终身学习的,并通过在家庭中进行大规模真实世界实验来展示其功能。利用“路径长度加权成功率”等指标对GOAT的性能进行评估,而无需预先计算地图。代理程序使用全局和局部策略,使用快速行进方法进行路径规划和点导航控制器以达到路径上的航点。 在九个家庭的实验试验中,GOAT作为一种通用导航系统取得了83%的成功率,超过以前的方法32%。它的成功率从第一个目标的60%提高到经过探索后的90%,展示了其适应性。GOAT无缝处理下游任务,如拾取和放置以及社交导航。定性实验展示了GOAT在波士顿动力Spot和Hello Robot Stretch机器人上的部署。在真实世界家庭中对Spot进行的大规模定量实验展示了GOAT相对于三个基准的卓越性能,在匹配实例和有效导航方面表现出色。 出色的多模态和平台无关设计使得可以通过各种方式进行目标规定,包括类别标签、目标图像和语言描述。模块化的架构和实例感知的语义记忆可以区分同一类别的实例,以实现有效的导航。在没有预先计算地图的大规模实验中进行评估,GOAT展示了其多样性,并将其能力扩展到拾取和放置、社交导航等任务。 GOAT的未来轨迹包括在各种环境和场景中全面探索其性能,以评估其广泛性和稳健性。研究将致力于提高匹配阈值,以应对勘探过程中的挑战。根据目标类别对实例进行子采样将进一步探索以提高性能。GOAT的持续发展包括优化全局和局部策略,并可能整合额外的技术以实现更高效的导航。广泛的真实世界评估将涵盖不同的机器人和任务,以验证GOAT的多功能性。进一步探索可以将GOAT的适用范围扩展到物体识别、操纵和交互等领域。

Leave a Comment

这篇来自麻省理工学院的AI论文介绍了一种新的机器人操控方法:通过蒸馏特征场和视觉语言模型来弥合二维到三维的差距

麻省理工学院(MIT)和人工智能和基本相互作用研究所(IAIFI)的一个研究团队引入了一个突破性的机器人操纵框架,解决了让机器人在不可预测和杂乱的环境中理解和操作物体的挑战。目前面临的问题是机器人需要对三维几何有详细的理解,而这常常在二维图像特征中缺乏。 目前,许多机器人任务需要同时具备空间和语义理解。例如,一个仓库机器人可能需要根据产品清单中的文字描述从杂乱的存储箱中拿起一个物品。这就需要机器人能够基于几何属性和语义属性稳定地抓取物体。 为了弥合二维图像特征和三维几何之间的差距,研究人员开发了一个名为机器人操纵特征场(F3RM)的框架。这种方法利用经过训练的视觉和视觉语言模型提取特征,并将其蒸馏成三维特征场。 F3RM框架包括三个主要组成部分:特征场蒸馏、使用特征场表示6自由度姿势和使用开放文本语言指导。蒸馏特征场 (DFFs) 扩展了神经辐射场 (NeRF) 的概念,其中包括一个额外的输出来从视觉模型中重建密集2D特征,这使得模型能够将一个3D位置映射到一个特征向量,结合了空间和语义信息。 对于姿势表示,研究人员使用夹爪坐标系中的一组查询点,这些点从3D高斯分布中采样得到。这些点被转换到世界坐标系中,特征根据局部几何进行加权。得到的特征向量被串联成姿势的表示。 该框架还包括能够结合自然语言命令进行对象操作的能力。机器人在测试过程中接收指定要操作的对象的自然语言查询。然后,它检索相关的演示,初始化粗略的抓取,根据提供的语言指导优化抓取姿势。 就结果而言,研究人员进行了关于抓取和放置任务以及语言引导操纵的实验。它可以理解物体之间的密度、颜色和距离。对杯子、马克杯、螺丝刀柄和蠕虫耳朵的实验显示了成功的运行。机器人可以推广到在形状、外观、材料和姿势上差异显著的物体。它还成功地回应了自由文本的自然语言命令,即使对于演示过程中未见过的新类别的物体。 总之,F3RM框架为机器人操纵系统的开放集合泛化挑战提供了一个有希望的解决方案。通过结合2D视觉先验和3D几何并融合自然语言指导,它为机器人在各种复杂和杂乱环境中处理复杂任务铺平了道路。虽然仍然有一些限制,如模拟每个场景所需的时间,但该框架在推进机器人和自动化领域方面具有重要潜力。

Leave a Comment

揭开权重、偏置与损失函数的奥秘:深入探索深度学习

深度学习是一种利用分层神经网络来帮助计算机自动地从大量数据中学习的机器学习方法,类似于人类的学习方式在高层次上,深度学习模仿了人类大脑处理信息的方式,通过多个层次的神经网络将输入的数据逐步转化为有用的特征和抽象表示,从而实现对复杂问题的高效解决

Leave a Comment

“语义听觉:基于机器学习的新型可穿戴设备功能,可以在保持空间意识的同时,集中关注或忽略现实环境中的特定声音”

华盛顿大学和微软的研究人员引入了一个前沿的概念:通过先进的机器学习算法推动的具有语义听觉能力的降噪耳机。这一创新赋予佩戴者选择他们希望听到的声音,同时消除其他所有听觉干扰的能力。 团队详细阐述了推动他们创新努力的核心障碍。他们强调了现有降噪耳机的问题,强调它们无法具备鉴别和隔离环境中特定声音所需的实时智能能力。因此,实现佩戴者听觉体验与他们的视觉感知之间的无缝同步成为一个关键问题。任何对听觉刺激的处理延迟都被视为不可接受;它必须几乎瞬间发生。 与主要专注于消除传入声音或过滤特定频率的传统降噪耳机不同,这一开创性的原型采取了一种不同的方法。它使用了一个分类系统来处理传入声音,允许用户通过选择他们想要听到的声音来个性化他们的听觉体验。 原型的潜力通过一系列试验得到了证明。从在吸尘器噪音中进行对话,到忽视街头喧闹,专注于鸟鸣,甚至在保持警觉听取交通喇叭声时减轻建筑杂音。该设备通过消除环境噪音促进冥想,除了一个标志着结束的闹钟声。 实现快速声音处理的关键在于充分利用用户的智能手机这一更强大的设备,而不仅仅是集成在耳机中。这一设备承载着一个专门设计用于双耳声音提取的神经网络,研究人员表示这是一个开创性的壮举。 在实验过程中,该团队成功地使用了20个不同的声音类别,证明了他们基于Transformer的网络在连接的智能手机上仅需6.56毫秒就能执行。在新颖的室内和室外情景中进行的真实世界评估证实了概念验证系统在提取目标声音的同时保留其双耳输出中的空间线索的效果。 这项降噪技术领域的开创性进展有着广阔的应用前景,可以提升不同环境中用户的体验。通过让个人实时定制他们的听觉环境,这些下一代耳机超越了之前的限制。随着团队继续完善这一创新并准备发布代码,个性化音景触手可及的未来前景似乎更加接近现实。

Leave a Comment