Press "Enter" to skip to content

Month: November 2023

Microsoft发布了Orca 2:通过定制化训练策略在更小的语言模型中开创先进推理技术

LLMs(大型语言模型)是在大量文本数据上进行训练的,以便理解和生成类似于人类语言的模型。如GPT-3、GPT-4和PaLM-2等模型就是其中的几个例子。这些模型执行复杂的语言任务,包括文本生成、对话交互和问题回答。它们在各个领域的应用中,提升了聊天机器人、编码、网络搜索、客户支持和内容制作等用户体验。 然而,随着AI社区深入研究更小规模模型的广阔领域,微软推出了名为Orca 2的下一个版本,旨在增强紧凑型AI模型的能力。通过集成详细解释和追踪,Orca 1在BigBench Hard和AGIEval等具有挑战性的基准测试中超越传统的指导训练模型。Orca 2进一步深入研究了增强训练信号的潜力,以提高较小语言模型的推理能力。 模仿学习一直是改善小型语言模型的流行方法。尽管这些较小的模型可以以与教师类似的方式生成内容,但它们通常需要在推理和理解能力上迎头赶上。尽管模仿学习具有一些好处,但也有缺点,可能限制较小模型发挥其全部潜力,并阻止它们使用最佳的解决方案来解决特定问题和模型能力。它们通常需要帮助匹配其较大模型对推理和理解能力的匹配,从而限制了它们的潜力。 与简单模仿不同,Orca以各种推理技巧指导模型。这些技巧包括逐步处理、回忆然后生成、回忆-推理-生成和直接答案。目标是指导模型获取辨别最有效解决策略的能力,以适应每个特定任务的细微差别。 Orca 2的零次推理能力凸显了改进更小型神经网络的可能性。微软继续相信,像Orca 2这样的专门训练方法可能揭示新的有用应用。这种方法旨在提高这些神经网络部署的效果。 最重要的是,Orca 2在训练阶段减少了初始线索所引发的特定行为。通过创新的Prompt Erasure技术,Orca 2转变为慎重的推理者。与盲目模仿不同,这种方法使用较大模型作为行为来源,选择最佳行为来解决给定任务。 研究人员对Orca 2进行了全面的基准测试。他们表明,它在与语言理解、常识推理、多步数学问题、阅读理解、摘要等相关的其他等价模型上表现更好。例如,在零次推理任务上,Orca 2-13B的准确率比13B模型高出25%以上,与70B模型持平。 Orca 2在小型语言模型的演进中迈出了重要的一步。它离开了传统的模仿学习,注重教授多样的推理技巧,展示了发挥紧凑型AI模型潜力的新方法。

Leave a Comment

这篇AI论文介绍了“闪电猫”:一种基于深度学习的智能合约漏洞检测工具

智能合约在区块链技术中发挥着重要作用,用于开发去中心化应用。智能合约易受漏洞攻击,可能导致潜在的财务损失和系统崩溃。传统的漏洞检测方法,如静态分析工具,通常因依赖预定义规则而产生误报和漏报。作为回应,中国Salus Security团队提出了一种名为“闪电猫”的新型人工智能解决方案,利用深度学习技术进行智能合约漏洞检测。 论文的关键点可分为三个部分。首先,介绍了利用深度学习方法进行智能合约漏洞检测的闪电猫解决方案。其次,提出了一种有效的数据预处理方法,重点强调通过CodeBERT提取语义特征。最后,实验结果表明,优化的CodeBERT模型在其他模型上表现更优秀。 研究人员通过在闪电猫框架中提出三种优化的深度学习模型来解决静态分析工具的局限性:优化的CodeBERT、LSTM和CNN。CodeBERT模型是一种经过预训练的基于Transformer的模型,针对智能合约漏洞检测这个特定任务进行微调。为了增强语义分析能力,研究人员在数据预处理中采用了CodeBERT,以更准确地理解代码的语法和语义。 实验使用了SolidiFI-benchmark数据集,该数据集包含9369个注入了来自七个不同类型漏洞的易受攻击合约。结果展示了优化的CodeBERT模型的优越性能,达到了令人印象深刻的93.53%的F1分数。通过获取易受攻击的代码函数段来准确提取漏洞特征的重要性,CodeBERT用于数据预处理有助于更精确地捕捉语法和语义。 研究人员把闪电猫定位为一种超越静态分析工具的解决方案,利用深度学习进行自适应和持续更新。CodeBERT因其有效的数据预处理能力以及对语法和语义的全面捕捉而备受重视。优化的CodeBERT模型的优越性能归功于其在提取漏洞特征方面的准确性,其中关键的漏洞代码段起着重要作用。 总之,研究人员倡导智能合约漏洞检测在防止财务损失和维护用户信任方面的关键作用。闪电猫以其深度学习方法和优化模型的优越性崭露头角,相比现有工具,在准确性和适应性方面表现出色。

Leave a Comment

字节跳动推出PixelDance:一种基于扩散模型的新型视频生成方法,结合图像指令和文本指令

一支来自字节跳动研究团队的研究者介绍了PixelDance,一种利用文本和图像指示来创建具有多样化和复杂运动的视频生成方法。通过这种方法,研究者展示了他们的系统的有效性,通过合成具有复杂场景和动作的视频,从而在视频生成领域树立了新的标准。PixelDance在合成具有复杂设置和活动的视频方面表现出色,超过了通常生成具有有限动作的视频的现有模型。该模型通过扩展到各种图像指示,并结合时间上连贯的视频片段来生成组合镜头。 与限于简单场景的文本到视频模型不同,PixelDance利用图像指示来增强视频复杂性,并实现更长的连续剪辑生成。这种创新克服了以前方法中出现的运动和细节限制,特别是在领域外内容方面。强调图像指令的优势,将PixelDance确定为生成具有复杂场景、动态动作和复杂摄像机运动的高动态范围视频的解决方案。 PixelDance架构将扩散模型和变分自编码器整合到输入空间中,以对图像指示进行编码。训练和推断技术聚焦于学习视频动力学,利用公共视频数据。PixelDance可扩展到各种图像指示,包括语义地图、草图、姿势和边界框。定性分析评估了文本、首帧和尾帧指示对生成的视频质量的影响。 基于FVD和CLIPSIM指标,PixelDance在MSR-VTT和UCF-101数据集上的表现优于以前的模型。对于UCF-101的消融研究展示了PixelDance组件如文本和最后帧指示在连续片段生成中的有效性。该方法提出了一些改进的思路,包括使用高质量视频数据进行训练、领域特定的微调和模型扩展。PixelDance展示了无需后期处理的视频编辑,将其转化为一项图像编辑任务。它在MSR-VTT和UCF-101数据集上生成满足文本提示的高质量复杂视频的令人印象深刻的定量结果。 PixelDance在合成具有复杂场景和动作的高质量视频方面表现出色,超过了最先进的模型。模型与文本提示的配合展示了其推进视频生成的潜力。已经确定了需要改进的领域,包括领域特定的微调和模型扩展。PixelDance引入了无需后期处理的视频编辑,将其转化为图像编辑任务,并始终生成时间上连贯的视频。定量评估证实了它能够根据文本提示生成高质量、复杂的视频的能力。 PixelDance对显式图像和文本指示的依赖可能会限制其在未知场景中的泛化能力。评估主要侧重于定量指标,需要更多主观质量评估。对训练数据来源和潜在偏差的影响没有进行深入探讨。需要全面讨论模型在可扩展性、计算需求和效率方面的局限性。模型处理特定视频内容类型(如高度动态场景)的能力仍需澄清。需要对其在多样领域和超出示例之外的视频编辑任务中的普适性进行全面讨论。

Leave a Comment

中国的研究人员推出了视频-LLaVA:一个简单但功能强大的大型视觉语言基准模型

北京大学、彭城实验室、北京大学深圳研究生院和中山大学的研究人员介绍了大型视觉-语言模型(LVLM)方法Video-LLaVA,该方法将视觉表示统一到语言特征空间中。与现有方法单独编码图像和视频不同,Video-LLaVA通过在投影过程中解决对齐问题实现了统一的LVLM。这个简单而强大的模型在九个图像数据集上表现出色,在五个数据集和四个工具包中的图像问答方面表现优秀。 Video-LLaVA将图像和视频整合到一个特征空间中,改善了多模态交互。它在各种图像基准测试中胜过了Video-ChatGPT,并在图像问答方面表现出色。在视频理解方面,Video-LLaVA始终超过Video-ChatGPT,并在多个视频数据集上胜过最先进的Chat-UniVi。利用LLM的推理能力,Video-LLaVA使用Vicuna-7B v1.5进行训练,并使用LanguageBind和ViT-L14得到的视觉编码器。 Video-LLaVA通过在投影之前将图像和视频的视觉表示对齐来解决现有方法中编码图像和视频分开的问题,缓解了LLMs学习多模态交互的问题。Video-LLaVA在各种图像和视频基准测试中超过了先进的LVLM和Video-ChatGPT,展现了在理解和回应人类提供的指令方面的改善性能。这种方法强调了在投影之前将视觉特征对齐到统一空间的益处,以提升多模态交互学习。 Video-LLaVA通过在投影之前将图像和视频的视觉表示对齐到一个统一的特征空间中。它采用Vicuna-7B v1.5作为语言模型,使用由LanguageBind初始化的ViT-L14得到的视觉编码器。训练过程涉及将图像调整大小和裁剪为224×224。利用来自CC3M的558K LAION-CC-SBU图像文本对的子集进行了预训练。指令数据集来自各个地方,包括来自LLaVA v1.5的665K图像文本指令数据集和来自Video-ChatGPT的100K视频文本指令数据集。 Video-LLaVA在九个图像基准测试中表现出色,分别在MSRVTT、MSVD、TGIF和ActivityNet上比Video-ChatGPT提升了5.8%、9.9%、18.6%和10.1%。它在89个图像基准测试中表现优秀,超过了InstructBLIP-7B在问答方面的表现。与更强大的LVLM相媲美,它在VisWiz上超过了InstructBLIP-13B的14.7。Video-LLaVA显著提升了四个数据集上的视频问答,展现了其通过统一的视觉表示理解和学习图像和视频的能力。 总之,Video-LLaVA是一个非常庞大的视觉-语言模型,有效解决了对齐问题,并在各种图像基准测试中表现更好。其对图像和视频的联合训练增强了其功效,使其能够超越专门设计用于图像或视频的专家模型。该模型在统一视觉概念的理解以及图像问答基准测试中的出色表现,展示了其和谐的视觉训练框架的有效性,凸显了其强大的能力。 未来的研究可以探索在投影之前的先进对齐技术,以增强多模态交互中的LVLMs。应该研究其他方法来统一图像和视频的标记化,以解决对齐问题。通过对更多基准测试和数据集进行Video-LLaVA的评估,可以评估其泛化能力。与更大的语言模型进行比较可以阐明其可扩展性和潜在的增强效果。增强Video-LLaVA的计算效率以及研究联合训练对LVLM性能的影响是进一步探索的方向。

Leave a Comment

UCL和Google DeepMind的研究人员揭示了Transformer神经网络中上下文学习(ICL)的瞬息动态

模型在推理时利用输入来修改其行为的能力,而无需更新权重以解决训练期间不存在的问题,被称为上下文学习或ICL。神经网络结构,尤其是为了少样本知识而创建和训练的能够从少量示例中学习所需行为的能力,是最早表现出这种能力的。为了使模型在训练集上表现良好,它必须记住上下文中的示例-标签映射,以便在未来进行预测。在这些情况下,训练意味着在每个“episode”上重新安排与输入示例对应的标签。测试时提供了新的示例-标签映射,网络的任务是使用这些来对查询示例进行分类。 ICL的研究是由transformer的发展而演变而来的。人们注意到,作者并没有通过训练目标或数据来特别鼓励ICL;相反,经过适当大小的自回归训练后,基于transformer的语言模型GPT-3展示了ICL的能力。从那时起,已经有大量的研究探讨或记录了ICL的实例。由于这些令人信服的发现,大规模神经网络中的新兴能力成为研究的主题。然而,最近的研究表明,只有在某些具有特定语言数据特征的情况下,transformer的训练才会有时产生ICL。研究人员发现,在训练数据缺乏这些特征的情况下,transformer通常会转向内部权重学习(IWL)。在IWL状态下,transformer不使用新提供的上下文信息,而是使用存储在模型权重中的数据。关键是,ICL和IWL似乎相互矛盾;当训练数据具有突发特征(即对象以聚类形式而不是随机形式出现)并且具有大量的标记或类别时,ICL似乎更容易出现。有必要使用已建立的数据生成分布进行受控调查,更好地理解transformer中的ICL现象。 同时,还有一系列辅助语料研究探讨了直接在有机网络规模的数据上训练的巨型模型的出现,得出结论认为像ICL这样的非凡特征更可能在训练了更多数据的大型模型中出现。然而,依赖于大型模型带来了重要的实际障碍,包括快速创新、低资源环境下的能源高效训练和部署效率。因此,大量的研究致力于开发更小的transformer模型,这些模型可以提供等效的性能,包括出现ICL的能力。目前,发展紧凑而有效的转换器的首选方法是过度训练。这些小型模型通过使用更多的数据进行训练(可能是重复的)来计算预算,而不仅仅是遵循缩放规则所需的数据量。 图1:具有12层和64个嵌入维度,使用1600门课程进行训练,每类20个示例,上下文学习是暂时的。每个训练会话都会出现突发情况。由于训练时间不足,研究人员尽管发现这些环境极大地鼓励ICL,却没有看到ICL的瞬时性。(a) ICL评估器的准确性。(b) IWL评估器的准确性。研究团队注意到,由于测试序列属于分布之外,IWL评估器的准确性提高得非常缓慢,尽管训练序列的准确性为100%。(c) 训练日志的损失。两种颜色代表两个实验种子。 从根本上说,过度训练是建立在近期LLMs的ICL调查中的一个固有前提上的:持久性。人们认为,只要模型已经接受了足够的训练以产生ICL依赖能力,并且训练损失持续减少,模型将会在训练过程中保持。在这里,研究团队否定了普遍的持久性假设。他们通过修改一个常见的基于图像的少样本数据集来做到这一点,这使得我们能够在一个受控环境中全面评估ICL。研究团队提供了简单的场景,其中ICL出现并随着模型损失的减少而消失。 换个角度来说,尽管ICL被广泛认可为一种新兴现象,研究团队也应考虑到它可能只是暂时存在的可能性(图1)。研究团队发现,这种短暂性发生在各种模型大小、数据集大小和数据集种类上,尽管研究团队也表明某些属性可以延缓短暂性的出现。一般而言,那些被长时间不负责任地训练的网络发现ICL可能会瞬间消失,让人们对当代人工智能系统所期待的技能感到失望。

Leave a Comment

认识LQ-LoRA:一种LoRA的变种,允许低秩量化矩阵分解,以实现高效的语言模型微调

在人工智能迅猛发展的时代,大型语言模型(LLMs)的引入改变了机器与人类相互交互的方式。最近几个月,LLMs的数量呈指数增长,具备令人难以置信的能力和超先进的算法。像GPT 3.5、GPT 4、LLaMa、PaLM等模型在自然语言理解(NLU)、处理、翻译、摘要甚至内容生成方面展示了一些卓越的人类仿真能力。 这些LLMs是通过大量数据进行训练的。然而,当这些模型需要适应新数据集时,就会遇到挑战。研究人员通常在将这些庞大的LLMs适应新数据集时面临问题,因为全面微调的开销和内存需求很高。为解决LLM微调中的内存效率问题,最近一个研究团队提出了参数高效微调的方法。 通过学习原先预训练模型的较小、微调扩展,这些技术可以降低微调所需的内存量。低秩适应(LoRA)是一种受欢迎的有效LLM调整策略,它涉及重新参数化预训练模型的权重矩阵,仅微调其两个组成部分,即L1和L2,其余组成部分保持不变。 研究人员通过将LoRA应用于量化的预训练模型来增强其内存效率。为了节省内存,量化降低了模型的参数精度,如果量化显著,则零初始化可能不是最优选择。为了克服量化误差,团队提出了一种称为LQ-LoRA的LoRA变种。 LQ-LoRA通过一种受主成分分析(PCA)影响的迭代技术,将权重矩阵分解为量化组件Q和低秩组件L1L2。在LQ-LoRa中,L1和L2在适应过程中得到改进,并捕获了初始权重矩阵的高方差子空间。 团队表示,该方法使用整数线性规划来找到混合量化方法,以解决将同一量化配置应用于所有层的问题。通过给定总体期望比特率,该技术允许为每个矩阵分配不同的配置,包括比特数和块大小。 团队使用LQ-LoRA修改了不同大小的RoBERTa和LLaMA-2模型,分别是7B和70B。结果表明,LQ-LoRA比GPTQ-LoRA和强QLOrA基线表现更好。通过将2.5比特的LLaMA-2模型训练在OpenAssistant基准上,与使用4比特QLoRA微调的模型具有竞争力,表明建议的方法允许更激进的量化。 此外,通过调整数据校准语言模型,LQ-LoRA在模型压缩方面也表现出良好的性能。尽管比特率降低,但团队能够生成与完全精度下的原始模型具有竞争力的2.75比特LLaMA-2-70B模型。这表明该建议的方法可以大幅减少大型语言模型的内存需求,而不会牺牲特定活动的功能。 总而言之,LQ-LoRA是语言模型发展的一个重要转折点。其内存高效适应和数据感知考虑,以及动态量化参数调整,肯定会在人工智能领域引起范式转变。

Leave a Comment

通过使用Amazon Personalize Next Best Action,通过向用户推荐行动来建立品牌忠诚度

Amazon Personalize非常高兴地宣布推出新的Next Best Action(aws-next-best-action)配方,帮助您确定向个体用户建议的最佳行动,从而增加品牌忠诚度和转化率Amazon Personalize是一项完全托管的机器学习(ML)服务,使开发人员能够轻松传达高度个性化的体验…

Leave a Comment

使用亚马逊个性化和生成式人工智能实现超个性化客户体验

今天我们很高兴地宣布推出三个新产品,通过使用Amazon Personalize和生成式人工智能技术,帮助你提升个性化客户体验无论你是寻找托管解决方案还是自主创建,你都可以利用这些新功能来推动你的发展Amazon Personalize是一项完全托管的机器学习(ML)服务,它可以使…

Leave a Comment

亚马逊转录宣布推出一款新的基于语音模型的ASR系统,支持扩展至100多种语言

亚马逊转录是一项完全托管的自动语音识别(ASR)服务,可帮助您将语音转换为文本,并轻松地将其添加到您的应用程序中今天,我们很高兴地宣布推出了一种下一代多十亿参数语音基础模型驱动的系统,将自动语音识别扩展到超过100种语言在本文中,我们将讨论一些相关内容…

Leave a Comment

医疗影像人工智能更易实现:NVIDIA推出作为托管云服务的MONAI

英伟达今天推出了一项用于医学影像人工智能的云服务,通过完全托管的基于云的应用程序编程接口,进一步简化和加速地创建基准数据和训练专门的人工智能模型。 在芝加哥举行的北美放射学学会年会上宣布的英伟达MONAI云API——提供了一条加速开发人员和平台提供商将人工智能整合到医学影像产品中的快速路径。这些API使用英伟达和伦敦国王学院创办的开源MONAI项目构建。 医学影像在整个医疗保健领域至关重要,约占约90%的医疗数据。放射科医师和临床医生用它进行筛查、诊断和干预,生物药物研究人员用它评估临床试验患者对新药物的反应,医疗设备制造商用它提供实时决策支持。 在这些领域的工作规模需要一个专门的医学影像人工智能工厂——一个企业级平台,提供大规模的数据管理、创建基准注释、加速模型开发和建立无缝的人工智能应用部署。 通过英伟达MONAI云API,解决方案提供商可以更轻松地将人工智能整合到他们的医学影像平台中,使他们能够为放射科医师、研究人员和临床试验团队提供强大的工具,构建专门领域的人工智能工厂。这些API可以通过英伟达DGX Cloud AI超级计算服务的早期访问模式使用。 英伟达MONAI云API已经集成到Flywheel中,这是一个支持端到端人工智能开发工作流程的领先医学影像数据和人工智能平台。医学图像注释公司RedBrick AI和机器学习运营平台提供商Dataiku的开发人员正准备将英伟达MONAI云API整合到他们的产品中。 医学影像的即时数据标注和训练 构建高效、具有成本效益的人工智能解决方案需要一个健壮的、专门领域的开发基础,其中包括针对软件的全栈优化、可扩展的多节点系统和最先进的研究。它还需要高质量的基准数据,对于需要高级专业技能进行标注的3D医学影像来说,这可能是艰难而耗时的。 英伟达MONAI云API具备由VISTA-3D(Vision Imaging Segmentation and Annotation)基础模型驱动的交互式标注功能。它专为连续学习而设计,这一功能可根据用户反馈和新数据提高人工智能模型的性能。 VISTA-3D是通过对来自超过4000名患者的3D CT扫描图像进行注释数据集训练而得到的,涵盖了各种疾病和身体部位,可加速用于医学影像分析的3D分割掩模的创建。随着连续学习,人工智能模型的注释质量会随时间提高。 为了进一步加速人工智能训练,该版本还包括使基于MONAI预训练模型构建自定义模型变得无缝的API。英伟达MONAI云API还包括Auto3DSeg,它自动化了给定的3D分割任务的超参数调优和人工智能模型选择,简化了模型开发过程。 英伟达研究人员最近在MICCAI医学影像会议上使用Auto3DSeg赢得了四项挑战。其中包括用于分析肾脏和心脏的3D CT扫描的人工智能模型,以及用于大脑MRI和心脏的3D超声。 解决方案提供商和平台构建者拥抱英伟达MONAI云API 医学影像解决方案提供商和机器学习平台正在使用英伟达MONAI云API向客户提供至关重要的人工智能洞见,加速他们的工作。 Flywheel通过NVIDIA AI…

Leave a Comment

芝加哥大学研究人员推出三维笔刷:一种利用文本作为输入,在网格上生成本地化风格纹理的人工智能方法

3D绘画刷通常用于3D建模或雕塑应用程序,用于创建和操作3D物体或模型。这些工具允许用户直接在3D表面上绘制,为模型添加纹理、颜色和细节。这个过程对于在游戏、动画、电影等各个行业中创造逼真纹理、添加复杂细节和让3D物体栩栩如生至关重要。 高度详细和准确的本地化对于限制编辑在特定区域内是很重要的,以防止与目标编辑无关的更改。通常使用一种叫做纹理映射的技术。纹理映射是一种围绕3D模型表面的2D图像或一组图像,用于提供颜色、表面图案、粗糙度、光泽度和其他视觉特性等细节。由顶点、边和面组成的3D结构形成了物体的形状。 芝加哥大学和Snap Research的研究人员开发了一种3D绘画刷,通过文本描述自动对网格上的本地语义区域进行着色。他们的方法是设计用于直接操作网格,生成无缝融入标准图形流水线的纹理映射。3D绘画刷可通过直观、自由形式的文本输入进行控制,允许用户使用开放词汇描述在各个网格上的编辑。 他们还开发了级联分数蒸馏(CSD)来增强本地纹理区域的细节和分辨率。使用CSD,他们可以修改本地化区域并变形本地化区域中的几何体。他们使用由多层感知器编码的神经场来表示本地化和纹理映射。这种本地化明确标记了纹理,并确保与本地边界一致的本地样式。 显式地学习本地化和纹理确保了本地化区域界限编辑。他们说,3D绘画刷的本地化比现有模型产生的本地化更清晰。用户可以使用他们的CSD来控制监督的粒度和全局理解,实现比其他SDS更高分辨率的纹理和本地化。 他们的方法使用在3D表面上定义的MLP来创建神经纹理,产生在3D中平滑变化的输出。当2D纹理映射在纹理接缝处存在不连续性时,也可以进行这样的操作。MLP提供的平滑度减少了伪影,产生了更少噪音的纹理,并包含超分辨率功能。 团队同时优化本地化和纹理区域。他们发现同时优化可以产生高度详细的纹理,使其有效符合预测的本地化区域。预测的本地化区域是锐利和复杂的。在未来,他们希望扩展本地化编辑能力,超越纹理和学习,使用相同的本地纹理映射来提供形状之间的对应关系。

Leave a Comment

华丽打造你的AI职业生涯:与Aleksa Gordić风华绝代

在这一期的《以数据为先导》中,我们邀请到了Aleksa Gordić。他是一个自学的爱好者,从电气工程转行成为科技巨头Microsoft和DeepMind的关键人物。Aleksa分享了关于坚持不懈、个性化学习以及实习的变革力量等宝贵见解。了解他在YouTube上内容创作方面的战略方法以及他目前的创业项目Ortus AI,旨在将多语言人工智能系统带到前沿。让我们一起深入探讨人工智能的快速发展领域,涉及硬件、软件、元宇宙整合以及这个开创性领域的不可预测性。 您可以在热门平台如Spotify、Google Podcasts和Apple上收听这一期《以数据为先导》。 与Aleksa Gordić谈话的关键见解 Aleksa的人工智能之旅彰显了坚持和自学的重要性。 制定个性化的人工智能学习路径对于成功至关重要,超越一般课程。 实习和竞争意识在个人和职业成长中发挥了转变的作用。 Aleksa的YouTube战略注重技术深度,建立一个知识型社群。 朝着多语言人工智能系统的发展具有全球影响力的潜力,尤其是在非英语区域。 人工智能发展是动态的,关注硬件创新、软件优化以及与元宇宙等新兴技术的整合。 从传记、经典著作和商业书籍等各种来源不断学习,对于人工智能专业人士的成长增加了实质性的价值。 加入我们即将举行的《以数据为先导》系列讨论,与人工智能和数据科学领域的专家展开深入探讨! 现在,让我们来看看Aleksa Gordić对一些重要的人工智能问题的回答! 您的人工智能之旅是如何开始的? 作为一名电气工程学生,我最初专注于硬件,但我意识到软件领域有巨大的机会。我在学业结束时转向软件工程,自学了Android开发,并热衷于参加黑客松和数据松。我的朋友在大型科技公司实习,他启发了我研究算法和数据结构,从而让我为大型科技公司面试做准备。尽管在Facebook和Microsoft面试中遭到拒绝,但我坚持不懈,最终在Microsoft找到了一份工作,参与了HoloLens项目。这段经历引发了我的机器学习兴趣,我开始自学、阅读论文、制作YouTube视频,并最终成为DeepMind的研究工程师。 是什么启发您在人工智能领域创造自己的学习路径? 我相信没有人比你更了解个人发展的最佳课程。无论是通过运动改变身体还是学习新语言,我一直是一个自学者。我发现自己能够更高效地学习。虽然有许多像Fast AI或Coursera课程这样的通用课程,但我希望打造一条适合我的兴趣和优势的学习路径。 您可以分享在德国实习期间的关键时刻吗? 我在德国的时光是具有转变性的。我意识到我需要将我的精力投入到特定领域,而不是成为一个兴趣广泛的“万事通”。我受到同行的启发,变得有竞争力,不只是与个人竞争,而是与行业进展竞争。这种动力使我专注于机器学习,尤其是视觉组件,我发现这比文本分析更有满足感。 什么促使你开始了你的YouTube频道,AI…

Leave a Comment

Meta研究介绍了System 2 Attention(S2A):一种使用人工智能技术的方法,使得LLM能够根据输入环境中的重要部分来生成良好的回应

大型语言模型(LLMs)虽然在各种语言任务上高效,但往往显示出弱推理能力,会犯下非常简单的错误。它们有时会因为无关的语境而做出错误的判断,或者展示出一种叫做谄媚的问题,即模型虽然输入的文本是错误的,但仍然同意它。研究人员试图通过增加监督式训练数据或采用强化学习策略来解决这些问题。然而,更有效的解决方案是修复变压器架构中的潜在瓶颈,特别是注意机制。 在变压器中,软注意力往往会赋予输入文本的大部分重要性,包括不相关的内容。此外,由于训练方式的原因,它过于关注重复的标记,导致了上述问题。Meta的研究人员团队引入了一种新方法,称为系统2注意力(S2A),利用调整指令的LLM来识别和提取输入上下文的最相关部分,从而减轻了不必要信息的影响。这种方法的另一个优点是,控制LLM的注意力焦点成为可能,类似于人类如何处理注意力。 变压器中的注意机制使其能够识别文本中的相关性。虽然这增强了模型的下一个单词预测能力,但同时也使得模型更容易被语境中的错误相关性所误导。文本中重复单词的概率随着每次迭代而增加,形成了一个正反馈循环,导致模型专注于特定主题。S2A的工作方式是首先删除上下文中的不必要部分并重新生成,然后将其用于输出最终结果,而不是使用原始文本。 研究人员进行了各种实验来测试他们方法的性能。他们得出了以下结果: S2A提高了模型对有关观点的问题的真实性。 S2A增加了长篇生成文本的客观性,表明它不容易受到意见的影响。 此外,S2A还提高了模型在包含无关句子的数学问题上的性能。 研究人员还测试了S2A方法的不同变体(关注相关性而非无关性,删除不必要的词后保留原始语境等)。他们发现,除了少数实验外,这些变体的表现不如原始方法。 尽管该方法能够绕过无关信息,但仍可能受到其影响。此外,与标准LLM再生相比,它更具计算开销。然而,这个问题可以通过加快技巧来解决,研究人员将其留给未来工作。总体而言,S2A是一种可以防止LLM专注于文本中不重要部分以增加模型能力的方法。该技术改善了模型在处理观点提示和包含无关句子的数学问题时的性能。虽然仍有进一步改进的空间,但也可以探索其他途径以提高LLMs的推理能力。

Leave a Comment

见snntorch:一个用于使用脉冲神经网络执行基于梯度的学习的开源Python包

在人工智能领域,效率和环境影响已成为重要的关注点。加州圣克鲁兹大学的Jason Eshraghian开发了snnTorch这一开源Python库,实现了脉冲神经网络,从大脑在处理数据方面的出色效率中汲取灵感。研究中强调的关键问题在于传统神经网络的低效率和不断增长的环境足迹。 传统神经网络缺乏大脑处理机制的优雅性。脉冲神经网络模仿大脑,只在有输入时激活神经元,与持续处理数据的传统网络形成对比。Eshraghian旨在将人工智能注入到生物系统中观察到的效率中,为当前神经网络能量密集型所引起的环境担忧提供切实可行的解决方案。 鉴于snnTorch这一在大流行病期间产生的热情项目,其使用已取得了不错的成果,下载量超过了10万次。它的应用范围从NASA的卫星跟踪到与Graphcore等公司的合作,优化AI芯片。snnTorch致力于利用大脑的能源效率,并将其无缝集成到AI功能中。在芯片设计背景下,Eshraghian看到了通过软件和硬件共同设计以实现最大功率效率的计算芯片优化的潜力。 随着snnTorch的采用增加,对教育资源的需求也在增长。Eshraghian的论文作为该库的伴随文档具备双重功能:记录代码并提供一个基于大脑启发的人工智能的教育资源。它采用了极为诚实的方法,承认了神经形态计算的不确定性,避免了学生在这个领域中普遍存在的挫折感。 这项研究的诚实也体现在其呈现方式上,使用代码块来呈现,这是传统研究论文的一种变化。这些带有解释的代码块突出显示了某些领域的不确定性,提供了在经常晦涩难懂的领域中的透明度。Eshraghian旨在提供他在编码之旅中所希望拥有的资源。这种透明度在有关研究在神经形态硬件初创企业的入职培训中的应用方面获得了积极的回响。 这项研究探讨了大脑启发深度学习的限制和机会,并认识到相对于人工智能模型而言,我们对大脑过程的理解还存在差距。Eshraghian提出了一种前进的道路:识别相关性和差异。一个关键区别是大脑无法重访过去的数据,而专注于实时信息——这为可持续人工智能至关重要的增强能源效率提供了机会。 这项研究深入探讨了神经科学的基本概念:“共同激发,联结在一起”。传统上认为这与深度学习的误差反向传播截然相反,研究者提出了一种互补的关系,开辟了探索的道路。与生物分子工程研究人员合作在脑器官模型方面架起了生物模型与计算研究之间的桥梁。将“生物硬件”纳入软件/硬件共同设计范例,这种多学科方法承诺为大脑启发的学习提供深入的洞察力。 总之,snnTorch及其论文标志着迈向大脑启发人工智能的里程碑。其成功凸显了对传统神经网络的持续需求,即对能源效率更高的替代方案。研究者的透明和教育方法促进了一个致力于推动神经形态计算界限的协作社区。在snnTorch的指导下,该领域有潜力革新人工智能,并加深我们对人脑进程的理解。

Leave a Comment

“遇见超人类:一种新颖的AI框架,用于模拟具有潜在结构扩散的超真实人类生成”

从用户定义的条件(如文本和姿势)生成超逼真的人类图像对于各种应用非常有意义,包括图像动画和虚拟试穿。为了探索可控人类图像生成的任务,已经做出了许多努力。早期的方法要么依赖于重建方式的变分自动编码器(VAEs),要么通过生成对抗网络(GANs)提高了逼真度。尽管某些方法可以创建高质量的图像,但不稳定的训练和有限的模型容量等挑战限制了它们在小数据集和低多样性的情况下。 最新出现的扩散模型(DMs)引入了一种逼真合成的新范例,成为生成智能领域中的主流架构。然而,像稳定扩散和DALL·E 2这样的例子文本到图像(T2I)模型仍然难以创建具有一致解剖结构的人类图像,如手臂、腿和自然姿势。主要挑战在于人体形态的非刚性变形,需要难以仅通过文本提示来描述的结构信息。 最近的研究,如ControlNet和T2I-Adapter,尝试通过引入可学习的分支来调节预训练的DMs(如稳定扩散)以实现结构控制的图像生成,以插拔的方式进行。然而,这些方法存在主支和辅助支之间的特征差异,导致控制信号(如姿势映射)和生成的图像之间的不一致性。HumanSD提出通过通道级串联直接将身体骨架输入扩散U-Net以解决这个问题。然而,该方法只能生成有限多样性的艺术风格图像。此外,人类内容只通过姿势控制合成,忽略了深度图和表面法线图等其他重要的结构信息。 本文报道的工作提出了一个统一框架HyperHuman,用于生成高逼真度和多样化布局的现实世界人类图像。其概述如下图所示。 关键洞察是识别人类图像在多个粒度上固有的结构性质,从粗级身体骨架到细粒度的空间几何。在一个模型中捕捉明确外观和潜在结构之间的这种相关性对于生成连贯和自然的人类图像至关重要。该论文建立了一个大规模的以人为中心的数据集HumanVerse,包含了3.4亿个现实世界的人类图像和全面的注释。基于这个数据集,设计了两个模块用于高逼真度可控人类图像生成:潜在结构扩散模型和结构引导细化器。前者增强了预训练扩散主干,同时去噪RGB、深度和法线方面,确保去噪纹理和结构之间的空间对准。 由于这种精心设计,图像外观、空间关系和几何建模都在一个统一的网络中进行协同。每个分支互补,融入了结构意识和纹理丰富性。增强的噪声计划消除了低频信息泄漏,确保局部区域的深度和表面法线值的均匀性。每个分支使用相同的时间步长增强学习并促进特征融合。通过空间对准的结构图,结构引导细化器为详细、高分辨率的图像生成合成了预测条件。此外,设计了强大的调节方案,以减轻两阶段生成管线中的误差积累的影响。 下图报告了与最先进技术的比较。 每行的前4×4网格包含输入骨骼,共同去噪的法线、深度和粗糙RGB(512×512),这些都是通过HyperHuman计算得出的。 这就是HyperHuman的概述,它是一个新颖的人工智能框架,用于生成具有高逼真度和多样化布局的真实环境中的人类图像。如果您有兴趣并且想要了解更多信息,请随意参考下面引用的链接。

Leave a Comment