Press "Enter" to skip to content

Month: November 2023

“导致奥特曼离职的信件?”

在人工智能飞速发展的领域中,OpenAI作为创新的灯塔脱颖而出。然而,该公司最近陷入风暴中心,其首席执行官Sam Altman被撤职。据说,这一戏剧性转变的催化剂是来自OpenAI研究人员的一封信。这封信警告了一个名为Q星或Q*的人工智能突破,具有深远的影响。这一事件在科技行业引起了轩然大波,并引发了关于人工智能未来及其对社会的影响的问题。在本文中,我们将深入探讨这封信的细节、人工智能突破以及Altman被解职的影响。 OpenAI人工智能发展的重大突破 最近,揭示了OpenAI的Q项目,引发了人们的兴趣和争议。长期担任高管的米拉·穆拉蒂透露了Q的存在,并展示了解决数学问题的早期成果。Q*,发音为Q-Star,代表着OpenAI进军人工通用智能(AGI)的雄心壮志。尽管信中没有具体细节,但很明显,Q*有潜力重新定义人工智能发展的格局。研究人员就未公开的安全问题提出了警示,强调了Q*发展的重要意义和相关风险。在OpenAI应对这个关键时刻时,Q*的未来成为该组织追求突破性人工智能技术的证明。 Sam Altman的四天流亡 Altman被解职让许多人感到惊讶,考虑到他在塑造该组织的愿景和战略方面发挥了重要作用。据报道,决策者在信中提出的关于人工智能突破的担忧影响了此决定。董事会对这一发现的潜在后果心生忧虑,决定采取立即行动。Altman的解职在科技界引发了激烈的辩论,一些人对董事会的决定提出质疑,而另一些人则赞赏他们的积极态度。这段短暂的流亡凸显了形势的严重性,以及董事会在OpenAI未来发展方向上的深思熟虑。 人工智能的伦理十字路口 信中提到的人工智能突破对社会具有深远影响。它有潜力改变行业,自动化流程,并增强决策能力。然而,它也引发了关于失业、隐私和权力集中于少数人手中的担忧。随着人工智能以前所未有的速度发展,解决这些伦理和社会挑战至关重要。这将确保对这项技术进行负责和包容的部署。该公司的经验为整个行业提供了一个警示性故事。然而,实际上问题是在速度和安全之间做出选择。只有时间会告诉我们接下来会发生什么。 我们的观点 Sam Altman从OpenAI被解职不仅仅是一种领导变革,它更是关于人工智能在社会中角色的广泛讨论。当我们站在可能重新定义我们世界的人工智能突破的边缘时,我们必须谨慎地、有远见地导航这些领域。OpenAI的研究人员和董事会的行动可能为人工智能社区如何应对未来道义挑战树立了一个先例。

Leave a Comment

Google AI揭示了Mirasol3B:一种跨音频、视频和文本模式学习的多模自回归模型

在机器学习这个广阔的领域中,解码嵌入在不同模态(音频、视频和文本)中的复杂性是一个巨大的挑战。时间对齐和不对齐模态之间的复杂同步以及视频和音频信号中的庞大数据量促使研究人员寻求创新的解决方案。这就是Google专门团队开发的Mirsol3B,一种巧妙的多模自回归模型。这个模型解决了不同模态的挑战,并且在处理更长的视频输入方面表现出色。 在深入了解Mirsol3B的创新之前,了解多模机器学习的复杂性是至关重要的。现有的方法在同步时间对齐的模态(音频和视频)和不对齐的模态(如文本)之间存在同步困难。这种同步挑战在视频和音频信号中的大量数据的情况下会更加复杂,通常需要压缩。越来越明显的是,需要能够无缝处理更长视频输入的有效模型。 Mirsol3B标志着在应对这些挑战方面的范式转变。与传统模型不同,它采用了多模自回归架构,将时间对齐和上下文模态的建模分开。Mirsol3B由用于时间对齐模态(音频和视频)的自回归组件和用于不对齐模态(如文本信息)的独立组件组成,提出了一种新颖的观点。 Mirsol3B的成功取决于其对时间对齐和上下文模态的熟练协同。视频、音频和文本具有不同的特点;例如,视频是一种具有高帧率的时空视觉信号,而音频是一种具有更高频率的一维时间信号。为了桥接这些模态,Mirsol3B采用了交叉注意机制,促进自回归组件之间的信息交流。这确保了模型全面理解不同模态之间的关系,而无需精确同步。 Mirsol3B的创新优势在于将自回归建模应用于时间对齐模态,保留了关键的时间信息,尤其是在长视频中。视频输入被智能地分割成较小的块,每个块包含可管理的帧数。组合器是一个学习模块,会处理这些块,生成联合的音频和视频特征表示。这种自回归策略使模型能够了解各个块及其时间关系,这对于有意义的理解是至关重要的一个方面。 组合器是Mirsol3B成功的核心部分,它是一个学习模块,旨在有效地协调视频和音频信号。该模块通过选择较少的输出特征来应对处理大量数据的挑战,从而有效地减少了维度。组合器表现出各种风格,从简单的基于Transformer的方法到Memory Combiner(如Token Turing Machine,支持具有可微分内存单元)。这两种风格都有助于模型能够高效处理广泛的视频和音频输入。 Mirsol3B的性能令人印象深刻。该模型在包括MSRVTT-QA、ActivityNet-QA和NeXT-QA在内的各种基准测试中始终优于最先进的评估方法。即使与拥有800亿参数的更大模型(如Flamingo)相比,Mirsol3B凭借其3,000亿参数的紧凑性能表现出卓越能力。值得注意的是,该模型在开放式文本生成环境中表现出色,展示了它的泛化能力和生成准确的响应的能力。 总的来说,Mirasol3B在解决多模态机器学习挑战方面迈出了重要的一步。其创新的方法,结合自回归建模、时间对齐模态的战略分割以及高效的Combiner,为该领域设定了新的标准。研究团队优化性能的能力,即使使用相对较小的模型也不损失准确性,使Mirasol3B成为在需要强大多模态理解的实际应用中有希望的解决方案。随着追求能够理解我们世界复杂性的AI模型的探索继续进行,Mirasol3B在多模态领域脱颖而出,成为进步的标志。

Leave a Comment

AWS reInvent 2023生成AI和ML指南

是的,AWS reInvent季节已经到来,一如既往,这个时候应该去的地方是拉斯维加斯!你已经在日历上做了标记,预订了酒店,甚至购买了机票现在你只需要一些有关生成AI和机器学习(ML)的指导,以便在第十二届reInvent大会上参加相关的会议虽然生成AI在之前的活动中出现过,但今年我们将把它提升到一个新的水平除了在主题演讲中发布多个令人兴奋的新闻之外,我们的讲座中的大部分都将以某种形式涉及到生成AI,所以我们可以真正称之为“生成AI和机器学习”专题在这篇文章中,我们将为您介绍该专题的组织方式,并突出几个我们认为您会喜欢的会议虽然我们的专题侧重于生成AI,但许多其他专题也有相关的会议在浏览会议目录时,请使用“生成AI”标签来查找它们

Leave a Comment

Amazon EC2 DL2q实例现已全面推出,用于经济高效的高性能人工智能推断

这是一篇由来自高通AI的A.K Roy所撰写的客座文章亚马逊弹性计算云(Amazon EC2)DL2q实例由高通AI 100标准加速器提供动力,可用于在云端高效部署深度学习(DL)工作负载它们还可用于开发和验证DL工作负载的性能和准确度

Leave a Comment

使用自定义镜头构建良好架构的IDP解决方案-第三部分:可靠性

IDP Well-Architected Custom Lens适用于所有使用AWS运行智能文档处理(IDP)解决方案并寻求在AWS上构建安全、高效和可靠的IDP解决方案的AWS客户在云中构建一个适用于生产环境的解决方案涉及到资源、时间、客户…之间的一系列权衡

Leave a Comment

AI技术驱动的科技公司帮助杂货商在供应链管理方面重新开始

谈论追求低垂果实。Afresh是一家人工智能初创公司,通过使供应链更高效,帮助杂货店和零售商减少食品浪费。 在NVIDIA的最新一期人工智能播客中,主持人诺亚·克拉维茨(Noah Kravitz)与该公司的联合创始人兼总裁Nathan Fenner进行了交谈,探讨了公司的使命、产品和消除食品浪费的更大挑战。 针对杂货店和零售商的大多数供应链和库存管理产品都已经过时。Fenner和他的团队注意到,那些针对非易腐品的解决方案在新鲜侧面效果不佳,导致大量食物浪费并造成数十亿美元的利润损失。 人工智能播客AI力量的科技公司帮助杂货店在供应链管理中重新开始 这个团队最初致力于解决店铺补货的挑战,通过开发一个帮助杂货商决定订购多少新鲜食品以优化成本并满足需求的平台。 他们创建了机器学习和人工智能模型,能够有效地使用由于时间衰减、需求波动较大以及缺乏条形码导致自助结账台扫描错误等因素而产生的新鲜食品所生成的数据,这些数据比非易腐品所生成的数据更加混乱。 结果是一个完全集成的、基于机器学习的平台,它可以在操作过程的每个节点上帮助杂货商做出明智的决策。 该公司还最近推出了库存管理软件,允许杂货商通过智能跟踪库存来节省时间并提高数据准确性。这些信息可以输入到平台的订购解决方案中,进一步提高库存数据的准确性。 这一切都是Afresh致力于应对气候变化的更大使命的一部分。 “我们可以做的最具影响力的事情就是减少食品浪费以缓解气候变化,”Fenner表示。“这真的是将我引入这个行业的关键之一:我一直对从事气候领域工作有着敏锐的视觉。对我们团队来说,这真的是激励人心的,并且是我们使命的关键部分。” 订阅人工智能播客:现在可在亚马逊音乐上收听 人工智能播客现在可在亚马逊音乐上收听。 此外,还可以通过iTunes、Google Podcasts、Google Play、Castbox、DoggCatcher、Overcast、PlayerFM、Pocket Casts、Podbay、PodBean、PodCruncher、PodKicker、Soundcloud、Spotify、Stitcher和TuneIn获得人工智能播客。 让人工智能播客变得更好。有几分钟可以填写这份听众调查问卷。

Leave a Comment

这篇AI论文介绍了子句编码器:一种对文本进行细粒度语义表示的对比学习上下文嵌入AI模型

来自宾夕法尼亚大学、华盛顿大学和腾讯AI实验室的研究人员提出了一种子句编码器,这是一种对比学习的上下文嵌入模型,它为文本序列中的原子命题生成不同的嵌入。与传统的句子嵌入不同,它通过学习不同含义单元的上下文嵌入,专注于细粒度的语义表示。该模型在检索支持事实和识别条件语义相似性等任务中具有很好的效果。子句编码器与句子编码器具有相似的推理成本和空间复杂度,展示了其实用性。 子句编码器通过为文本序列中的原子命题生成不同的嵌入,专注于细粒度的语义表示。应用包括检索支持事实和识别条件语义相似性。精细级别的有效编码有望影响文本评估、归属和事实估计。受到文本归属需求的影响,子句编码器设计具有潜在的跨文档信息链接应用。 该研究挑战了将整个文本序列编码为定长向量的常见做法,引入了子句编码器。子句编码器架构在跨文档信息链接方面具有潜在应用,为具有不同信息粒度的任务提供了灵活性。该研究旨在评估子句编码器在检索支持事实和识别条件语义相似性等任务中的实用性。 该模型为文本序列中的不同原子命题生成不同的上下文嵌入。使用二进制标记掩码作为输入,基于Transformer架构将子句编码器应用于检索支持事实和识别条件语义相似性。尽管研究承认英文文本的实验局限性,但提出了更广泛的语言适用性潜力,并引入了创建子句编码器训练数据的自动过程。 子句编码器在识别相同上下文中命题之间的微妙语义差异方面优于句子编码器,提高了精确性和召回率。子句编码器在原子事实检索方面表现与文档级和句子级模型相当,展示了增强的记忆能力。研究强调了子句编码器在不同粒度的多向量检索中的潜力,表明其在各种检索任务中的灵活性。 该架构在跨文档信息链接和具有不同粒度的各种任务方面具有潜力。原子事实检索评估显示了子句编码器在检索支持命题方面的实用性。子句编码器提高了多向量检索的召回率,突出了其在各种检索任务中的潜在优势。该研究强调了子句编码器在文本归属中解决粒度挑战的重要性。 研究表明,所展示的发现可能为进一步的长篇文本评估、归属和事实估计研究铺平道路。研究承认在英文文本方面实验规模有限,提出了对多语种子句编码器的未来研究,并指出了对其他语言的潜在扩展。研究强调了对持续探索的需求,希望该工作将激发子句编码器应用的进展,进一步推动该领域的研究。

Leave a Comment

加州大学伯克利分校和中国上海交通大学的研究人员引入了“重新表述样本”的概念,以重新思考语言模型的基准和污染问题

大型语言模型的复杂性越来越高,评估也变得更加困难。社区在相对短的时间内产生了许多基准,但基准分数并不总是与实际性能相对应。一些证据表明,许多流行的基准测试可能使用了用于微调和预训练的有缺陷的数据集。 尽管普遍认为这是一个重要问题,但找出污染源一直很困难。N-gram叠加和嵌入相似性搜索都得到了广泛应用。字符串匹配在GPT-4、PaLM和Llama等最新创新中被广泛使用,用于N-gram叠加污染的检测。然而,其精确度略低。嵌入相似性搜索会查看先前训练模型(如BERT)的嵌入,以发现相关且可能被污染的样本。然而,在决定相似性水平时在召回率和精确度之间找到平衡可能很困难。此外,模型训练中有一种新兴趋势,即使用由LLM(例如GPT-4)生成的合成数据,使用字符串匹配来识别污染可能更加困难。 为了研究去污方法,美国加州大学伯克利分校和上海交通大学进行了一项新研究,引入了“重新表述样本”的概念,其语义与原始样本相同,但很难通过现有的污染测试来识别。LLM通过将测试样本翻译和改写成另一种语言生成重新表述样本。研究人员证明,如果将这种重新表述的示例用于训练,则产生的模型对过度拟合非常敏感,并且可以在测试基准上实现极高的性能。使用精细校准的13B Llama模型可以与GPT-4在所有基准测试中的性能匹敌,同时通过N-gram叠加作为污染而不被察觉。这种行为在广泛使用的基准测试如MMLU、GSM-8k和HumanEval中观察到。因此,识别重新表述样本的能力至关重要。 研究人员解释了传统去污技术的缺陷,并提出了一种新颖的基于LLM的方法。为了确定任何前k个样本是否与测试实例过于相似,他们首先应用嵌入相似性搜索来找到与所讨论的测试样本最相似的模型。结果证明,他们建议的LLM去污方法优于传统技术。他们在用于微调和预备训练的各种热门数据集上测试了他们的去污器。同时还发现,GPT-3.5的合成数据集CodeAlpaca中有相当一部分重新表述样本来自HumanEval(确切地说,占12.8%)。这暗示了在使用LLM生成的假数据进行训练时可能存在污染的潜在可能。 研究人员建议社区为使用公共基准测试来评估LLM建立更全面的去污流程。他们希望创建新的一次性测试,如Codeforces和Kaggle竞赛,以公平评估LLM并克服这些基本问题。

Leave a Comment

“自动聚类的启动:探索多智能体框架的基础知识”

介绍 踏上一段激动人心的旅程,探索多智能体框架的基础知识,并进入软件开发的未来,这就是“自动产生:探索多智能体框架基础”的主题。在OpenAI的ChatGPT之后,一个名为LLM(LLM agent)的专业领域正在经历前所未有的飞速发展,彻底改变了AI代理开发。从自动化繁琐任务到解决动态决策中的挑战,LLM代理正在挑战曾经被认为不可能的界限。 随着我们进入空间计算时代,设想一个世界,计算机与现实无缝融合,AI代理的重要性变得至关重要。想象一下通过语言和手势指令代理完成任务,具有无与伦比的推理和行动能力。然而,我们正处于AI代理革命的黎明期,见证着新的基础设施、工具和框架的诞生,这些赋予代理应对越来越复杂任务的能力。剪裁多智能体聊天系统的先进框架Autogen,在我们的探索中扮演重要的角色。 在这篇文章中,让我们一起揭开AI代理革命的早期阶段的细节,深入了解Autogen的能力,并探索如何让这些智能实体焕发生机。 学习目标 了解什么是LLM代理 学习Autogen是什么,并探索使用Autogen构建代理的基础知识 使用Autogen和OpenAI API构建代理 探索LLM代理的现实世界应用案例 本文是《数据科学博文马拉松》的一部分。 什么是LLM代理? 传统的语言模型在许多方面都表现出色,例如翻译、问答等。然而,它们的知识和能力是有限的。这就像是一名泥瓦工在修筑房子时缺少工具一样。然而,有观察发现,LLM代理在给予必要的工具后能够进行推理和行动。大多数LLM代理对世界的了解有限,但我们可以通过提示将它们与自定义来源的信息进行增强。 我们可以通过两种方法实现这一目标:检索增强生成和LLM代理。在检索增强生成中,我们通过自定义的硬编码流程将信息提供给模型。但对于代理来说,基于其推理,LLM代理将利用其掌握的工具。例如,带有Serp工具的GPT-4将浏览互联网并相应地回答,或者在可以访问雅虎金融工具时,它可以获取和分析股票表现。因此,LLM模型、工具和用于推理和采取行动的框架的组合就是AI代理的概念。 构建LLM代理的平台和工具急剧增长。Autogen就是其中之一。让我们了解一下Autogen是什么,以及如何使用它来创建LLM代理。 什么是Autogen? Autogen是微软推出的一款面向构建稳定多智能体应用的开源工具。该工具从头开始设计,充分考虑到多智能体之间的通信。它允许我们创建LLM应用程序,其中多个代理互相对话以找到解决方案。这些代理是高度可定制的,意味着我们可以引导它们执行特定的任务。它还与Langchain工具生态系统完美集成,这意味着我们可以利用现有的Langchain工具来增强我们的代理。 为了完成任务,Autogen提供了不同类型的代理,包括: 助理代理:负责完成编码、审核等任务 用户代理:如其名称所示,这些代理代表最终用户行动。这些代理将人类引入代理循环,以引导对话 可教授代理:该代理被配置为易于教授。我们可以向代理提供LLM中缺失的显式信息 我们在大多数情况下只需要一个助理代理和用户代理进行配置。所以,让我们看看如何使用 Autogen 配置代理。RAG…

Leave a Comment

易于应用集成的前五种稳定扩散API

介绍 在人工智能时代,API是解决企业面临的重要挑战之一,即将AI模型整合到软件和应用中时的高计算要求的一种解决方案。这种解决方案被称为应用程序编程接口(API)。API可以帮助你摆脱维护的麻烦,让你专注于业务逻辑和用户体验。这意味着任何人都可以利用这些API构建和商业化应用。本文将探讨稳定扩散API,这是一组专注于图像生成的生成式AI模型,这些模型对于各种应用程序至关重要。 我们首先将看到Segmind API,这是一个非常高效和有效的选择。这些API已经彻底改变了开发人员、设计师和创作者处理视觉内容生成的方式。我们将探索一些排名前五的稳定扩散API,重点介绍它们的特点、用途、定价等等。 学习目标 深入了解稳定扩散模型。 了解稳定扩散模型的基础知识,包括它们的应用。 了解现代软件开发中的API。 探索API在简化软件和应用开发中的关键作用。 本文是数据科学博文马拉松的一部分。 了解稳定扩散模型 什么是稳定扩散模型? 稳定扩散模型是一类专注于生成高质量图像的生成式AI模型。这些模型旨在生成具有各种应用的逼真、高分辨率图像。它们的特点是稳定和可靠,对于图像合成、风格转移和数据增强等任务非常有帮助。 稳定扩散模型使用扩散过程生成图像,从而逐渐向图像添加噪声,直到演化为复杂而连贯的输出。这个过程确保生成的图像具有高质量并展现出细节。 什么是API? API,或应用程序编程接口,是一组规则和协议,允许一个软件应用程序与另一个应用程序、服务或平台的功能或数据进行交互。API是中介,实现软件之间的集成。 在软件开发中,API为开发人员提供了一种访问功能、服务或数据的方式,包括云服务、数据库或AI模型等源,而无需理解底层复杂性。这简化了开发过程,加速了功能丰富应用的创建。 API可以采用多种形式,包括RESTful API、gRPC API和WebSocket API,每种都针对特定的用例。在现代软件中,它们发挥着关键作用,使开发人员能够利用第三方服务和功能的强大能力,同时专注于核心应用程序逻辑。 前五稳定扩散API 让我们来看看我们列表上排名靠前的稳定扩散API,首先是用户友好的Segmind API。 1.…

Leave a Comment

南开大学和字节跳动的研究人员推出了一种名为ChatAnything的新型人工智能框架,专注于生成LLM-增强人物形象

南开大学和字节跳动的研究人员提出了一个名为ChatAnything的新型框架,旨在以在线方式生成基于大型语言模型(LLM)的角色的人形化人物形象。目标是仅根据文本描述创建具有自定义视觉外观、个性和语调的人物形象。研究人员利用LLM的上下文学习能力使用精心设计的系统提示生成个性。他们提出了两个创新概念:声音的混合 (MoV) 和扩散物质的混合 (MoD),用于多样化的语音和外观生成。 MoV使用预定义音调的文本到语音(TTS)算法,根据用户提供的文本描述选择最匹配的音调。MoD结合了文本到图像生成技术和说话头算法,简化了生成说话对象的过程。然而,研究人员观察到当前模型生成的拟人化对象常常被预训练的面部标志检测器无法检测到,导致面部动作生成失败。为了解决这个问题,他们在图像生成过程中引入像素级引导,以注入人脸标志。这个像素级注入显著提高了面部标志检测率,实现了基于生成的语音内容的自动面部动画。 本论文讨论了大型语言模型(LLMs)及其上下文学习能力的最新进展,将其定位于学术讨论的前沿。研究人员强调了需要一个框架来生成具有自定义个性、声音和视觉外观的LLM增强人物形象。对于个性生成,他们利用LLM的上下文学习能力,使用文本到语音(TTS) API创建了声音模块池。声音的混合模块(MoV)根据用户文本输入选择音调。 使用最新的说话头算法解决了由语音驱动的说话动作和表情的视觉外观问题。然而,研究人员在使用扩散模型生成的图像作为说话头模型的输入时遇到了挑战。只有30%的图像能够被最先进的说话头模型检测到,表明分布不对齐。为了弥合这一差距,研究人员提出了一种零样本方法,在图像生成阶段注入面部标志。 提出的ChatAnything框架由四个主要模块组成:基于LLM的控制模块、人像初始化器、文本到语音模块的混合以及动作生成模块。研究人员结合了扩散模型、声音变换器和结构控制,创建了一个模块化和灵活的系统。为了验证引导扩散的有效性,研究人员创建了一个带有不同类别提示的验证数据集。他们使用预训练的面部关键点检测器评估面部标志检测率,展示了他们提出方法的影响。 研究人员介绍了一个全面的框架ChatAnything,用于生成具有拟人特征的LLM增强人物形象。他们解决了面部标志检测方面的挑战,并提出了创新的解决方案,在验证数据集中呈现了有希望的结果。这项工作为将生成模型与说话头算法整合以及提高数据分布对齐性的未来研究开辟了新的途径。

Leave a Comment

奥特曼回来了:OpenAI首席执行官在董事会纷争中取得胜利

在一次令人震惊的事件中,前OpenAI首席执行官Sam Altman计划在最近几天的势均力敌的董事会政变后重新夺回他的职位。这场动荡导致Altman于上周五被驱逐,却见证了故事情节的意外转折。 Altman在董事会混乱中的复兴 OpenAI的混乱走势迎来了一次戏剧性的转变,前首席执行官Sam Altman成功地进行了谈判,确保了他的回归。公司在内部纷争中披露了Altman回归的“原则性协议”。 新的董事会组成标志着治理重置 作为最初协议的一部分,提出了一个新的董事会,由Bret Taylor,Larry Summers和Adam D’Angelo组成。这个临时董事会的主要任务是审核和任命多达9位成员的正式董事会。旨在重置OpenAI的治理结构。 微软在重塑后的OpenAI中的角色 随着微软有望获得扩展董事会的席位,Altman的回归暗示着两个实体之间的战略合作伙伴关系。包括Altman和微软首席执行官Satya Nadella在内的重塑领导层,凸显了OpenAI的关键时刻。 尽管有正式公告,但关于“原则性协议”的细节仍然扑朔迷离。当被问及该术语时,OpenAI没有提供额外评论,为Altman的回归的细节留下了猜测的空间。 员工反叛和董事会的弱点 在Altman被驱逐期间,史无前例的员工反叛展示了内部的动荡。对于Altman被解职的缺乏明确解释使董事会成员受到攻击,导致关键成员Ilya Sutskever支持Altman。 我们的观点 当这个引人注目的公司事件尘埃落定后,OpenAI面临着关键时刻。Altman的回归带来了期待和不确定性的混合,引发了关于该公司未来方向和导致这种意外转折的动力学的问题。

Leave a Comment

这项人工智能研究介绍了BOFT 一种新的通用微调人工智能方法,用于基础模型的适应性调整

“`html 在人工智能领域,尤其是大型语言模型的引入,最近取得了许多发展,为几乎所有领域铺平了AI的道路。ChatGPT和Stable Diffusion等基础模型具有显著的泛化能力。然而,由于参数数量的增加,从头开始训练这些模型是一个挑战。 微调模型的方法非常简单,因为它不涉及任何额外的推理延迟。然而,传统微调技术难以理想地维护权重矩阵的关系信息,这些技术具有较低的学习速率。研究人员一直在研究正交微调(OFT)技术,该技术通过使用相同正交矩阵对同一层中的神经元进行转换,在微调过程中保持神经元之间的成对角度。虽然这种技术具有很大的潜力,但也存在同样的局限性,即正交矩阵的高维度导致了庞大的可训练参数数量。 为了解决这个挑战,一组研究人员提出了正交蝴蝶(BOFT)方法,这是一种独特且最新的方法,解决了正交微调中的参数效率问题。BOFT受到Cooley-Tukey快速傅里叶变换技术中蝴蝶结构的启发,通过将其与许多分解稀疏矩阵组装在一起,生成稠密的正交矩阵。为了将正交矩阵表示为稀疏矩阵的乘积,需要以计算时间为代价来节省空间。 研究团队指出,通过将其比作一个网格结构图上的信息传输问题,可以理解这种技术,这使得可以使用多种保持表达能力的稀疏矩阵分解技术,同时限制可训练参数的数量。BOFT受到了Cooley-Tukey方法的蝴蝶图的启发,其主要创新在于蝴蝶分解过程。 借助这种分解,可以创建一个含有O(log d)个稀疏矩阵的稠密矩阵,每个稀疏矩阵具有O(d)个非零元素。BOFT可以通过保证每个稀疏矩阵的正交性,以O(d log d)的参数数量提供高效的正交参数化,从而显著减少了原始OFT参数化的数量。BOFT提供了一个通用的正交微调框架,并包含OFT。 研究团队将BOFT与OFT中的块对角结构进行了比较,并且已经证明为了降低有效可训练参数,BOFT和OFT都给正交矩阵增加了稀疏性。但对于下游应用,BOFT的蝴蝶结构提供了正交群矩阵和单位矩阵之间更平滑的插值的较小假设类别。为了强调低秩矩阵和稀疏矩阵都是实现参数效率的结构化矩阵的家族,该结构化方法已与LoRA中的低秩结构进行了比较。 研究人员总结了他们的主要贡献如下: 研究了正交微调中参数效率的问题,以提高大型模型对下游任务的适应性。 引入了一种用于信息传输的新框架,将构建参数高效稠密正交矩阵的挑战转化为网格结构图内的问题。 引入了一种参数效率的正交微调方法-正交蝴蝶(BOFT)。 讨论了矩阵分解以及BOFT为什么能够显著降低可训练参数,同时保持表达能力和训练稳定性的理论解释。 BOFT在适应应用中表现出色,表明其具有卓越的参数效率和泛化能力,优于目前的技术水平。 “`

Leave a Comment