Press "Enter" to skip to content

Tag: Large Language Model

此AI研究就大型语言模型(LLMs)的限制和能力在组合任务上进行了实证和理论的探讨

ChatGPT正成为热门话题,每天有数百万人在使用。凭借其惊人的能力,如问答、生成独特而富有创意的内容、总结海量文本数据、代码补全以及开发非常有用的虚拟助手,ChatGPT使我们的生活更加便捷。ChatGPT由OpenAI开发,基于GPT 3.5(生成式预训练变换器)和GPT 4的变换器架构。GPT 4是由OpenAI发布的最新版本的语言模型,具有多模态性,即它以文本和图像的形式输入,与之前的版本不同。甚至其他大型语言模型(LLM),如PaLM、LLaMA和BERT,也被用于涉及医疗保健、电子商务、金融、教育等各个领域的应用中。 一组研究人员在最近发布的研究论文中强调了类似GPT这样的大型语言模型在复杂任务上表现出色而在简单任务上的困难。研究团队对三个代表性的组合任务进行了实验:多位数相乘、逻辑网格谜题和经典的动态规划问题。这些任务涉及将问题分解为较小的步骤,并将这些步骤组合起来产生准确的解决方案。 为了研究变换器在解决需要多步推理的组合任务方面的限制,作者提出了两个假设。第一个假设是变换器通过将多步推理线性化为路径匹配来完成任务,因此依赖于模式匹配和快捷学习,而不是真正理解和实现开发正确解决方案所需的底层计算规则。这种方法在训练期间可以快速准确地预测相似模式,但无法推广到不常见的复杂示例。第二个假设认为,在尝试解决具有独特模式的高复杂性组合任务时,变换器可能存在固有限制。早期的计算错误可能会传播并导致后续步骤中的严重错误,阻止模型获得正确解决方案。 为了研究这两个假设,作者将组合任务形式化为计算图,以便调查。这些图将解决问题的过程分解为更小、更易管理的子模块化功能步骤,从而实现问题复杂性的结构化度量,并将计算步骤的语言化作为语言模型的输入序列。他们甚至使用信息增益来预测模型可能基于底层任务分布而学习的模式,而无需在图中进行完整的计算。 基于实证结果,作者提出变换器通过将多步推理简化为线性子图匹配来处理组合挑战。他们提供了基于抽象多步推理问题的理论论证,强调随着任务复杂性的增加,变换器的性能迅速下降。这表明模型在处理极度复杂的组合问题方面可能已经受到限制。 总的来说,实证和理论结果表明,与对底层思维过程的深入理解相比,变换器的性能主要受到模式匹配和子图匹配的驱动,这也支持变换器在执行越来越困难的任务时可能遇到困难的观点。

Leave a Comment

一项新的人工智能研究提出了PanGu-Coder2模型和RRTF框架,有效地提升了预训练大型语言模型用于代码生成的能力

大型语言模型(LLMs)近几个月来引起了大量关注。这些模型通过回答相关问题、生成精确内容、翻译语言、总结长文本段落以及完成代码示例等方式模仿人类。LLMs正在迅速发展,定期推出强大的模型,展示出在代码生成任务中出色的性能。研究人员已经探索了几种技术,包括有监督的微调、指导微调、强化学习等,以提高预训练代码LLMs生成代码的能力。 最近的一项研究中,来自华为云有限公司、中国科学院和北京大学的研究人员团队引入了一种名为RRTF(Rank Responses to align Test&Teacher Feedback)的独特框架,成功而高效地增强了预训练大型语言模型的代码生成能力。RRTF框架旨在提高代码LLMs在代码生成活动中的性能,它使用自然语言LLM对齐技术和评级反馈而不是绝对奖励值。 从人类反馈中进行强化学习的方法,例如使用排名响应作为反馈而不是绝对奖励值的InstructGPT或ChatGPT等模型,为这种新颖方法提供了灵感,该方法将自然语言LLM对齐技术应用于代码LLMs。通过应用RRTF框架,该团队还引入了PanGu-Coder2模型,在OpenAI HumanEval基准测试中,该模型以出色的62.20%的一等通过率位居第一位。 通过在StarCoder 15B上使用该方法,该团队超越了PanGu-Coder并取得了所有记录的代码LLMs中最佳性能,证明了RRTF的实用性。对HumanEval、CoderEval和LeetCode三个基准的全面分析表明,代码LLMs在代码创作任务中可能能够超越相同或更大规模的自然语言模型。该研究还强调了高质量数据在提高模型遵循指令和编写代码能力方面的价值。 该团队总结了以下贡献: 引入了RRTF优化模式,该模式具有许多优点,使其成为一个与模型无关、简单直观和高效的方法。 引入了PanGu-Coder2模型,PanGu-Coder2的性能大幅超越原始模型约30%。HumanEval、CoderEval和LeetCode是一些展示这一显著速度提升的基准。 PanGu-Coder2在代码生成方面超越了所有先前发布的代码LLMs,取得了新的最先进成就。 该团队讨论了他们在构建用于代码生成的良好训练数据方面的想法和实践知识。 使用RRTF框架训练了PanGu-Coder2模型,并提供了有关该过程的有益见解。 除了提高代码生成效率,该团队还提出了PanGu-Coder2使用的优化方法,以保证快速推理。这一领域的发现有助于创建现实部署方案,因为高效的推理对于实际应用至关重要。

Leave a Comment

“认识RAP和LLM推理器:基于相似概念的两个框架,用于LLM的高级推理”

每一天都带来了大型语言模型(LLMs)的显著进展,这些模型在文本生成、情感分类、文本分类和零样本分类等各种任务中表现出色。它们的能力超越了这些领域,使内容创作、客户服务和数据分析实现自动化,从而彻底改变了生产力和效率。 最近,研究人员还开始探索使用LLMs进行推理的用途和效用。这些模型可以理解复杂的文本信息,并从中进行逻辑推理。LLMs擅长于问题回答、问题解决和决策制定等任务。然而,LLMs仍然不能像人类一样解决对人类来说很容易的问题,比如在给定环境中生成执行任务的行动计划,或者进行复杂的数学、逻辑和常识推理。LLMs在某些任务上面临困难,因为它们没有像人类那样的内部世界模型。这意味着它们无法预测在特定情况下事物的发展情况,或者模拟行动的长期结果。人类拥有内部世界模型,即对环境的心理表示,使得人类能够模拟行动及其对世界状态的影响,从而在复杂任务中进行有意识的计划。 为了解决这些问题,研究人员设计了一种新的推理框架,即基于规划的推理(RAP)。该框架使用一个库,使LLMs能够使用先进的推理算法进行复杂的推理。该框架将多步推理方法视为规划,并搜索最优推理链,以实现“世界模型”和“奖励”之间的最佳探索与开发平衡。除了RAP论文外,研究团队还提出了LLM推理器。LLM推理器是一个专门为语言模型(LLMs)设计的AI库,通过使用先进的算法,使其具备进行复杂推理的能力。它将多步推理视为规划,搜索最有效的推理链,并使用“世界模型”和“奖励”的概念优化探索和开发之间的平衡。你只需要定义一个奖励函数和(可选地)一个世界模型。LLM推理器负责处理其余的事情,包括推理算法、可视化、LLM调用等等! 世界模型将部分解决方案视为状态,并将新的行动/思考附加到状态作为状态转换。奖励函数在评估推理步骤的表现好坏方面起着关键作用。其思想是,具有更高累积奖励的推理链更有可能是正确的。 研究人员对该框架进行了广泛的研究。他们将RAP应用于数学推理和逻辑推理等几个具有挑战性的推理问题。这些任务的实际结果表明,RAP优于几种强基准方法。当应用于LLaMA33B时,RAP超越了GPT-4上的CoT,在计划生成方面实现了惊人的33%相对改进。 在推理过程中,LLM通过不断评估最佳推理步骤(行动)巧妙地构建推理树。为此,它使用其世界模型,这与以不同方式使用的相同LLM相同。通过模拟未来结果,LLM估计潜在奖励,并使用此信息更新其对当前推理步骤的信念。通过探索更好的替代方案和改进决策,它改进了推理过程。该框架提供了先进的推理算法,提供直观的可视化和解释,并与任何其他LLM库兼容。 研究人员强调,在对各种具有挑战性的推理问题进行广泛实验后,RAP优于几种基于CoT的当代推理方法。该框架甚至在某些情况下表现优于先进的GPT-4。RAP在设计奖励、状态和行动方面的灵活性展示了其作为灵活的框架处理各种推理任务的潜力。RAP将规划和推理以创新的方式结合在一起,这种方法有可能彻底改变我们对LLM推理的理解方式,为AI系统实现人类级别的战略思考和规划铺平道路。

Leave a Comment

纽约大学和Meta AI研究人员通过学习用户和已部署模型之间的自然对话,改进社交对话代理,无需额外注释

人类输入是改善社交对话模型的关键策略。在带有人类反馈的强化学习中,当需要许多人类注释来保证令人满意的奖励函数时,学习从反馈中取得了巨大的改进。反馈的来源包括用户对对话转折或对话情节的数字分数、排名或自然语言评论,以及对机器人转折的二元评估。大多数工作有意利用众包工人收集这些信号,因为自然用户可能不愿意被打扰或者如果他们这样做可能提供不准确的信息。 在这项研究中,来自纽约大学和Meta AI的研究人员考虑到他们有很多部署时的对话情节,这些情节展示了模型与真实用户之间的真实讨论。他们试图确定是否可以从这些自然用户讨论中获取任何隐含的指示,并利用这些信号来增强对话模型。这样做有两个原因。首先,尽管他们可能不提供明确的注释,但自然用户最接近未来部署的数据分布。其次,使用先前对话情节中的隐含信号可以节省用于众包的金钱。 图1:方法的总体概述。从人类和机器人之间的对话中获取隐含信号,例如下一个人类转折是否会很长或很短、快乐或不快乐。 更准确地说,他们研究了是否可以调整聊天机器人以使用最佳的隐含反馈信号,如即将到来的人类答案的数量、长度、情感或响应性。他们使用来自BlenderBot在线部署的公开可用的去标识化数据来研究这个问题。使用这些数据,他们训练样本和重新排序模型,比较各种隐含反馈信号。通过自动化和人工判断,他们发现他们的新模型优于基线回复。此外,他们还询问是否支持这些措施会导致不良行为,因为他们的隐含反馈信号是两个生成质量的粗略代理指标。 是的,这取决于使用的信号。特别是,优化更长的讨论长度可能导致模型提出有争议的观点或以敌对或争斗的方式回复。另一方面,优化积极的回应或情绪相对于基线减少了这些行为。他们得出结论,来自人类的隐含反馈是一种有益的训练信号,可以提高整体性能,但所采用的具体动作具有重要的行为影响。

Leave a Comment

中国的一项新的人工智能研究提出了SHIP:一种即插即用的生成式人工智能方法,用于改进现有的微调方法

本文介绍了一种名为合成提示(SHIP)的新方法,用于改进现有的微调方法。 微调:在预训练之后,模型会在一个较小的、特定任务的数据集上进行微调。这涉及到在新数据上继续训练过程,通常使用较小的学习率。其思想是调整模型从预训练中获得的泛化知识,使其更适用于特定任务。 研究人员要解决的问题是某些类别缺乏数据的情况。他们的目标是训练一个生成模型,可以通过提供类别名称合成特征,从而能够为没有数据的类别生成特征。 为没有数据的类别生成特征是指为训练数据集中不存在的类别或类别合成表示的过程。这在收集某些类别的真实数据可能具有挑战性或不可能的情况下特别有用。 研究人员随后使用现成的方法对CLIP进行了原始标记和新合成特征的微调。然而,一个重要障碍是生成模型通常需要大量数据进行训练,这与他们的数据效率目标相矛盾。他们提出利用变分自编码器(VAE)作为框架,相比于需要对抗训练的模型,在低数据场景中更易于训练且更有效。 尽管GAN和VAE都是能够创建新数据样本的生成模型,但它们在架构、目标和训练方法上存在显著差异。GAN以生成高质量、逼真样本而闻名,但训练难度较大。而VAE提供了一个概率框架,在有限数据的情况下更易于处理,但可能不如GAN产生锐利或逼真的样本。 CLIP(对比式语言-图像预训练)是OpenAI开发的一种模型,可以从文本描述中学习理解和生成图像,反之亦然。它已经在大规模数据集上进行了预训练,并具有对齐的视觉和语言表示。预训练的语言编码器有助于生成更逼真的特征。本文旨在通过利用合成数据来增强CLIP微调方法的性能。研究人员在基于新的泛化、跨数据集迁移学习和广义零样本学习的综合实验中进行了全面的实验,取得了最先进的性能。 所提出的模型架构利用VAE框架对特征进行编码和生成,与CLIP集成以提取图像特征并重构它们。在训练过程中,模型学习将特征编码为潜在空间,然后重构它们。在生成阶段,它使用这个学到的编码为新类别合成特征,允许在某些类别没有数据的情况下对CLIP进行微调。基于CLIP的新颖生成器由轻量级MLP和冻结的CLIP文本编码器组成,在转换潜在代码和构建最终提示符进行特征重构方面起到关键作用。 研究人员观察的实验结果: 基于新的泛化:实验在11个不同的图像分类数据集上进行,包括ImageNet、Caltech101、OxfordPets、StanfordCars、Flowers102、Food101、FGVCAircraft、SUN397、DTD、EuroSAT和UCF101。数据集被分为基类和新类,每个基类以16个样本进行训练。评估同时针对基类和新类进行。 广义零样本设置:本文还在更现实的广义零样本设置下评估了基于新的泛化,其中基类和新类的数据混合在测试数据集中。结果表明,以前的方法在新类别中的性能显著下降,但提出的SHIP方法在新类别中的性能继续提高。 与其他方法的比较:结果与其他方法进行了比较,包括CLIP、CoOp、CLIP-Adapter和Tip-Adapter。提出的SHIP方法在各个数据集中的新类别中表现出了改进的性能。 结论: 本文提出了一种新颖的SyntHesIzed Prompts (SHIP)方法,旨在改进现有的微调方法,特别是在某些类别没有数据的情况下。该方法通过为没有数据的类别合成特征,并使用原始标记和新合成特征对CLIP进行微调,实现了各种任务的最先进性能。本文指出了额外的训练成本作为一种限制,并表达了在未来研究中探索SHIP在密集预测任务中的适用性的意愿。 总体而言,本文通过解决某些类别数据稀缺的挑战,并利用合成数据提高CLIP微调方法的性能,在该领域提出了重要贡献。

Leave a Comment

“认识高级推理基准(ARB):一个评估大型语言模型的新基准”

自然语言处理在最近几年取得了显著进展,特别是创建了复杂的语言模型。几乎所有的自然语言任务,包括翻译和推理,在像GPT 3.5、GPT 4、BERT、PaLM等著名模型的性能方面都取得了显著进步。一些基准用于评估和评估人工智能领域中这些发展。基准基本上是一组标准化任务的集合,用于测试语言模型的能力。 考虑到GLUE和SuperGLUE基准,它们是最早的几个语言理解基准,像BERT和GPT-2这样的模型更具挑战性,因为语言模型一直在击败这些基准,引发了模型开发和基准难度之间的竞争。通过使模型变得更大并在更大的数据集上进行训练,可以提高性能。LLMs在各种基准测试中展示了出色的表现,评估了它们的知识和数量推理能力,但是当这些模型在当前标准上得分更高时,很明显这些基准已不再适用于评估模型的能力。 为了解决这些限制,一组研究人员提出了一个新的独特基准,称为ARB(高级推理基准)。ARB旨在传达各种学科领域(如数学、物理、生物学、化学和法律)中更困难的问题。与早期的基准相比,ARB侧重于复杂的推理问题,以提高LLM的性能。该团队还引入了一组数学和物理问题,作为ARB的子集,需要复杂的符号思维和深入的学科知识。这些问题非常困难,超出了当前LLMs的范围。 该团队对ARB基准进行了评估,包括GPT-4和Claude。这些模型在处理这些困难的复杂性方面遇到了困难,这些发现表明它们在ARB中更困难的任务上的表现得分明显低于50%。该团队还演示了一种基于评分表的评估方法,以改进评估过程。通过使用这种策略,GPT-4可以评估自己的中间推理过程,试图解决ARB问题。这扩大了审查过程的范围,并揭示了模型的问题解决策略。 ARB的符号子集也经过了人工审查。人工注释员被要求解决问题并提供自己的评估。人类评估者和GPT-4的基于评分表的评估分数之间存在有希望的一致性,表明模型的自我评估与人类判断相当一致。在需要专业推理的数量领域中,新数据集明显优于以前的基准,其中有数百个问题。 与过去基准中的多项选择题不同,大部分问题由简答和开放式回答组成,这使得LLMs更难进行评估。通过专家级推理任务和更现实的问题格式的结合,可以更准确地评估模型处理复杂的现实问题的能力。

Leave a Comment

遇见FACTOOL:一种用于检测大型语言模型(例如ChatGPT)生成的文本中事实错误的任务和领域无关框架

GPT-4是生成式人工智能(AI)技术的一个例子,它将自然语言处理中的多个任务结合成一个单一的序列生成问题。这种统一的架构具有卓越的效率和交互性,使用户能够使用自然语言界面执行各种活动(包括代码生成、数学问题解决和科学出版物的创建)。然而,这种生成式范式也带来了一些特定的困难。由于大型语言模型(LLMs)的限制,自动生成的文本经常显示错误或偏离事实。 LLMs往往会创建出令人信服的信息,但可能需要在事实上更准确或精确。这种限制限制了生成式AI在医疗、金融和法律等高风险行业的使用。因此,必须通过系统地识别这些错误来改进所创建材料的实用性和可靠性。例如,用于质量保证的检索增强验证模型、用于文本摘要的幻觉检测模型以及用于代码的执行评估模型等都是当前文献中关注的检测和减轻机器学习模型产生的事实错误的单一特定任务的例子。 鉴于LLMs处理的活动和领域的非凡灵活性,这些方法已经在各自的领域取得了成功。然而,拥有一个更全面的事实性检测和验证框架同样重要。此外,事实性检测的问题在当前文献中通常被概括为:(i)在给定一个主张的情况下评估一个主张是否事实准确,或者(ii)检测生成的主张是否得到给定证据的支持。 在用户与生成模型(如ChatGPT)进行交互时,他们经常需要评估长篇生成的事实准确性,而不是明确的主张和证据,因此需要更好地匹配这个任务定义。在这项研究中,来自上海交通大学、卡内基梅隆大学、香港城市大学、纽约大学、Meta AI、香港科技大学和上海人工智能实验室的研究人员提供了FACTOOL,这是一个任务和领域无关的框架,用于查找LLM生成的文档中的事实错误。在图1中,他们将“工具使用”和“事实性检测”的概念联系起来,并解释了他们的方法。 图1:带有工具增强的事实性检测框架。 为了获得所创建信息的事实性证据,FACTOOL专门使用多种资源,如Google搜索、Google学术、代码解释器、Python甚至LLMs。此外,他们的方法利用LLMs的批判性思维能力,根据可用数据评估内容的事实性。他们创建了一个基准,并对四个任务进行了实验: 基于知识的质量保证 代码生成 解决数学问题 撰写科学文献综述 他们解决了事实性识别的工作,并扩展了它以实现对最新生成式AI模型的更全面审计。根据他们对使用FACTOOL的现代聊天机器人的事实性分析,GPT-4在几乎所有情况下都具有最高的事实性。基于知识的质量保证测试显示,经过精心调整的聊天机器人(Vicuna-13B)具有可观的事实性。然而,它们在撰写科学文献综述和解答算术问题等更困难的任务上还存在困难。

Leave a Comment

谷歌DeepMind与东京大学研究人员推出WebAgent:一种由LLM驱动的代理,可以根据自然语言指令在真实网站上完成任务

通过利用大型语言模型(LLM)的HTML理解和多步推理能力,可以解决一些自然语言任务,包括算术、常识、逻辑推理、问答任务、文本生成,甚至是交互式决策任务。在自主网页导航方面,LLM最近在满足给定的自然语言指令时通过一系列计算机动作控制计算机或浏览互联网展现出了出色的成功。然而,预先定义的动作空间的缺失、与模拟器相比更长的HTML观察以及LLM缺乏HTML领域知识都对实际网站上的网页导航产生了负面影响(图1)。 图1:实际网页导航的困难。现代语言模型代理可以探索虚拟网站,在那里他们控制预定义的操作并接收经过简化且易于理解的HTML文本。然而,在导航实际网站时,代理必须处理开放性任务和包含多个与任务无关的组件的较长HTML文本,因此语言模型代理仍然面临困难。 由于指令的复杂性和开放性的实际网站,预先选择正确的动作空间并不容易。尽管有各种研究表明指令微调或从人类输入中进行强化学习可以提高HTML理解和在线导航的准确性,但目前的LLM只有在处理HTML文本方面偶尔具有最佳性能设计。大多数LLM都优先考虑广泛的任务泛化和模型大小可扩展性,通过优先选择较短的上下文持续时间而不是真实网页中的典型HTML令牌,并且不采用过去用于结构化文档的方法,包括文本-XPath对齐和文本-HTML令牌分离。 即使对这样的长文本应用令牌级别的对齐,成本也相对较低。通过在程序空间中对规范的Web操作进行分组,他们提供了WebAgent,这是一个由LLM驱动的自主代理,可以在实际网站上执行导航任务并遵循人类命令。通过将自然语言指令分解为更小的步骤,WebAgent实现了以下功能: 为每个步骤规划子指令。 基于子指令将较长的HTML页面压缩为与任务相关的片段。 在实际网站上执行子指令和HTML片段。 在这项研究中,来自Google DeepMind和东京大学的研究人员结合了两个LLM,创建了WebAgent:最近创建的HTML-T5是一个专业领域的预训练语言模型,用于工作规划和条件HTML摘要生成。Flan-U-PaLM用于基于代码的生成。通过在编码器中包含本地和全局注意力方法,HTML-T5专门用于更好地捕获较长HTML页面的结构语法和语义。它是自我监督的,使用CommonCrawl1创建的大型HTML语料库进行预训练,并结合了长跨度去噪目标。现有的LLM驱动代理通常使用单个LLM完成决策任务,并为每个任务提示各种示例。然而,对于现实世界的任务来说,这是不够的,因为其复杂性超过了模拟器的复杂性。 通过全面的评估,他们的集成策略与插件语言模型相结合,可以提高HTML理解和连接性,并提供更好的泛化能力。全面的研究表明,将任务规划与HTML摘要结合在专门的语言模型中对于任务性能至关重要,可以使实际在线导航的成功率提高50%以上。与声音基准相比,WebAgent在静态网站理解任务中的问答准确性表现优异,并且具有可比较的性能。此外,HTML-T5还作为WebAgent的关键插件,可以独立地在基于Web的任务上产生尖端结果。在MiniWoB++测试中,HTML-T5比天真的局部-全局注意模型及其指令微调变体表现更好,比以前最佳技术提高了14.9%的成功率。 他们主要做出了以下贡献: • 他们提供了WebAgent,该代理结合了两个LLM,用于实际的网络导航。通用语言模型生成可执行程序,而领域专家语言模型处理规划和HTML摘要。 • 通过采用局部-全局注意力和在大规模HTML语料库上进行长跨度去噪预训练的组合,他们提供了HTML-T5,一种新的HTML特定语言模型。 • 在真实的网站中,HTML-T5的成功率显著提高了50%以上,在MiniWoB++中,它超过了之前的LLM代理14.9%。

Leave a Comment

见到GOAT-7B-社区模型:一种在GoatChat应用收集的数据集上对AI模型Fine-Tuned LLaMA-2 7B模型进行微调的模型

最近,AI研究实验室的科学家们发布了GOAT-7B-Community模型,该模型通过使用GoatChat应用的数据对LLaMA-2 7B模型进行了改进。Meta的LLaMA v2 7B经过微调,成为了最先进的GOAT-7B-Community模型,利用了从GoatChat应用获得的新颖、细粒度的数据集。 “对齐”在创建大型语言模型(LLM)中至关重要。这是一种模型可以拒绝回答其认为不道德或非法的问题的思想,基于其教育和经验。对齐对于道德AI实施至关重要,但也给模型优化带来了新的障碍。 研究人员注意到,通过对齐生成的回答很少提供客户所需的精确细节。这些反应通常更为温和,表明不愿意详细阐述。解决这个问题是至关重要的,如果要构建一个可靠的模型,为问题提供深入和完整的回答。他们发现,对齐过滤器并不能消除所有不当建议。因此,对齐通常会导致丢弃大量的数据集。这相当于案例中总信息的三分之一左右。 鉴于这个问题,研究人员开发了一种新的清理数据集的技术。此外,他们进行了一项受管制的实验,以全面了解对齐回复对模型性能的影响。 科学家们是如何受教的 配备八个A100 NVIDIA GPU的高性能节点为深度学习计算提供了支持。研究人员选择了bfloat16浮点格式和DeepSpeed ZeRO-3优化作为训练过程的基础。他们对模型进行了三次迭代,每隔一个时期保存一次进展。然而,经验证据显示,执行一个时期后,质量开始下降。这促使他们重新思考他们的策略,并选择进行一次训练时期并进行一次中途检查。常用的评估语言模型的标准,如MMLU和BigBench Hard,用于评估GOAT-7B-Community模型。团队目前正在分析所有模型,并将很快发布他们的研究结果。 用途 大语言模型和聊天机器人的研究是GOAT-7B-Community的主要关注点。自然语言处理、机器学习和人工智能的学者和爱好者将发现它特别有用。 限制 尽管具有令人印象深刻的推理能力,该模型仍然存在与其相对较小的规模(7B模型被认为是“小型”LLM)相关的问题。其中最明显的问题是“幻觉”。这些“幻觉”是一个不断阻碍解决的障碍,随着LLM的改进和扩展。 “幻觉”是人工智能研究中非常强调的一个持久性问题。最终目标是开发出能够产生逻辑上正确、符合语法的答案,并忠实于所提供事实的模型。 风险和偏见 由于GOAT-7B-Community模型使用了公共和专有数据进行训练,因此该模型的可靠性不高,可能会返回与现实相悖的结果。因此,GOAT-7B-Community模型可能产生不准确、有偏见甚至令人反感的结果。 主要观察 没有比这更好的免费7B模型。 良好的MMLU结果的关键是多样化和高质量的数据集。 与当前的13B模型相比,7B的表现令人钦佩。 然而,尺寸限制仍然存在。…

Leave a Comment

认识 REPLUG 一种检索增强的语言建模框架,它将一个冻结的语言模型与一个冻结/可调节的检索器结合,将GPT-3 (175B) 在语言建模方面的性能提高了6.3%

近年来,语言模型已成为人工智能领域增长最快的领域之一。这些模型被开发用于处理和生成自然语言文本,正在推动一些最创新和突破性的人工智能应用,并处于人工智能扩展的新时代的前沿。特别是一种语言模型,名为GPT-3,因其非凡的能力和性能而引起了全球轰动。GPT-3使用了变压器架构来处理文本,从而产生了一个能够像人类一样回答问题的模型。不仅如此,该模型甚至可以对长段落进行总结,完成代码,以及以无与伦比的速度和准确性完成任务。 像GPT-3这样的语言模型在生成准确和适当的响应时仍然存在一些局限性。这就是REPLUG发挥作用的地方。一种名为REPLUG的新方法已经被引入:一种检索增强的语言模型框架。这是一种通过将它们与检索式结构合并来改善黑盒语言模型性能的方法。检索系统从大量文本语料库中找到与给定提示匹配的最合适的段落,然后在检索到的段落上对语言模型进行微调。这使得语言模型能够产生更准确的答案,特别是当提示在其训练数据中看不见时。 REPLUG方法包括两个主要步骤-文档检索和输入重构。首先,使用检索器从外部语料库中识别相关文档。然后,将每个检索到的文档明确添加到原始输入上下文中,并从多个传递中组合输出概率。该方法使用了一种能够支持注意机制的深度神经网络来学习不同模态之间的网络。 REPLUG在包括大型图像字幕数据集在内的各种基准数据集上进行了测试,并且在准确性和可扩展性方面显示出比现有系统更好的结果。REPLUG的一个关键优势是它不需要对基础语言模型架构进行任何修改。可以通过添加检索系统来增强像GPT-3这样的当前模型。这使得REPLUG易于访问和实施。通过调整的检索器,REPLUG将GPT-3(175B)在语言建模方面的性能提高了6.3%,并将Codex在五个样本MMLU上的性能提高了5.1%。 因此,REPLUG的引入似乎是自然语言处理领域的一个游戏规则改变者。它结合了黑盒语言模型和检索系统的优势,生成了一个优于传统语言模型的混合模型。REPLUG使用的深度神经网络架构具有可扩展性,适用于需要处理大量多模态数据的真实世界应用。REPLUG的潜在应用范围绝对是巨大的,并在不久的将来似乎很有前景。

Leave a Comment

斯坦福大学的研究人员引入了Gisting:一种用于语言模型中高效提示压缩的新技术

模型专业化涉及将预训练的机器学习模型适应特定的任务或领域。在语言模型(LMs)中,模型专业化对于改进其在摘要、问答、翻译和语言生成等各种任务中的性能至关重要。将语言模型专门用于特定任务的两个主要过程是指令微调(将预训练模型适应新任务或任务集)和模型蒸馏(从预训练的“教师”模型转移知识到更小、专门的“学生”模型)。提示是LM专业化领域的一个关键概念,因为它提供了引导模型朝特定行为的方式,允许更有效地使用有限的训练数据,并且对于实现最先进的性能至关重要。压缩提示是一种研究中的技术,希望能够在计算、内存和存储方面节省大量开销,同时不会对输出的总体性能或质量产生显著降低。 本文由斯坦福大学的研究人员提出,提出了一种名为gisting的提示压缩新技术,该技术训练了一个LM将提示压缩为更小的“要点”标记集。为了降低提示的成本,可以使用微调或蒸馏等技术训练一个模型,该模型的行为类似于没有提示的原始模型,但在这种情况下,模型必须针对每个新提示进行重新训练,这远非理想。然而,gisting的思想是使用元学习方法从提示中预测要点标记,这不需要为每个任务重新训练模型,并且可以在没有额外训练的情况下实现对未见指令的泛化。这将降低计算成本,并允许压缩、缓存和重用提示以提高计算效率。它还允许用户在有限的上下文窗口中容纳更多内容。 作者们尝试了一种实现这种模型的简单方法-他们使用LM本身(利用其现有的知识)在指令微调过程中预测要点标记,同时修改Transformer注意力掩码。给定一个(任务、输入)对,他们在任务和输入之间添加要点标记,并将注意力掩码设置如下:要点标记之后的输入标记不能与要点标记之前的任何提示标记关联(但它们可以与要点标记关联)。由于输入和输出不能参考提示,这迫使模型将提示中的信息压缩到要点标记之间。为了训练要点模型,他们需要一个包含各种任务的数据集,因此他们创建了一个称为Alpaca+的数据集,该数据集结合了两个现有的指令微调数据集(斯坦福Alpaca和Self-Instruct),总共超过130k个示例。然后,他们保留了3个验证拆分,以便在训练后验证模型,其中包括已见、未见和手工制作的人类提示。通过这种方式,他们能够测试对未见指令的泛化性能,其中人类拆分提出了更强的泛化挑战。他们还使用了多种LM架构(即LLaMA-7Bm、仅解码器的GPT风格模型和FLAN-T5-XXL),并使用不同数量的要点标记(1、2、5或10)训练要点模型。然而,结果显示,模型对于要点标记的数量通常不敏感,有些情况下甚至显示出更多标记实际上对性能有害。因此,他们在后续实验中使用了单个要点模型。 为了评估提示压缩的质量,他们将性能与正面控制进行了校准,正面控制实际上是标准指令微调,它提供了性能的上限,并且负面控制中模型完全无法访问指令,导致生成随机要点标记,这提供了性能的下限。为了将模型的输出与正面控制进行比较并测量胜率,他们要求ChatGPT选择哪个响应更好,并解释其推理过程。他们还使用了一个称为ROUGE-L的简单词汇重叠统计指标(用于衡量生成文本与人类编写的指令之间的相似性)。50%的胜率表示模型的质量与不进行提示压缩的模型相当。 研究结果显示,在已见指令上,概要模型的胜率非常接近正向对照模型,LLaMA为48.6%,FLAN-T5为50.8%。更重要的是,他们能够表明概要模型在未见提示上具有竞争力的泛化能力,LLaMA为49.7%,FLAN-T5为46.2%。只有在最具挑战的人类分割上,他们的胜率略微下降(但仍具竞争力),LLaMA为45.8%,FLAN-T5为42.5%。FLAN-T5的表现稍差以及特定的失败案例为未来的研究提供了更多的假设。 研究人员还调查了通过概要提取可能实现的效率提升。结果非常令人鼓舞,概要缓存导致FLOPs减少40%,墙上时钟时间比未优化的模型降低4-7%。尽管这些改进在仅有解码器的语言模型中较小,研究人员还证明了概要模型使未见提示的压缩率提高了26倍,为输入上下文窗口提供了相当大的额外空间。 总的来说,这些发现说明了概要提取对于增强专用语言模型的有效性和效率的巨大潜力。作者还提出了几个有前途的概要提取后续工作方向。例如,他们指出,从概要提取中获得的最大计算和效率收益将来自于对更长提示的压缩,并且“概要预训练”可以通过首先学习压缩任意自然语言段落来改善压缩性能。

Leave a Comment

Meta AI和剑桥大学的研究人员研究了如何利用大型语言模型(LLMs)加强语音识别能力

大型语言模型是新的趋势,得益于著名的ChatGPT的引入。这个聊天机器人由OpenAI开发,能够回答问题、对长段落的文本数据进行摘要、完成代码片段、将文本翻译成不同的语言等等。大型语言模型具有模仿人类的能力,基于人工智能的子领域,包括自然语言处理、自然语言理解、自然语言生成、计算机视觉等等。 在没有明确监督的情况下,大型语言模型通过预测大量文本数据中的下一个单词进行训练,从而在其神经网络的限制内开发了对外部世界的大量知识编码能力,使其在各种下游任务中非常有用。尽管大型语言模型在不同领域展现出了出色的性能,但最近的研究将一个小型音频编码器纳入模型中,通过启用语音识别进一步扩展了大型语言模型的能力。 该过程直接将一系列音频嵌入,如音频数据表示,融入已有的文本标记嵌入中。这使得大型语言模型能够像文本等价物一样自动执行语音识别(ASR)任务,因为它具有集成的表示。它还可以将口头交流翻译成打印文本。团队表示,仅具有解码器的大型语言模型可以执行多语种语音识别,并在训练时超过监督式单语训练基线。音频编码器模型的大小和帧速率、LLM参数的低秩适应、文本标记掩蔽以及所使用的大型语言模型类型是研究考察以提高识别准确性的几个变量之一。 通过分析音频编码器的输出,团队证明了音频嵌入与相应的文本标记准确匹配,展示了音频和文本信息的有效融合。为了评估这种策略的有效性,团队使用了Multilingual LibriSpeech(MLS)数据集来衡量其效果。开源的LLaMA-7B大型语言模型采用了一种专门用于音频处理的神经网络——conformer编码器。结果表明,这种调整使LLM在语音识别任务上的表现比单语基线提高了18%。主要以英文文本进行训练的LLaMA-7B在多语种语音识别方面表现出色。 除了主要实验外,该研究还对增强型LLM的性能的其他方面进行了调查。为了确定在LLM被冻结训练时是否能够保留其初始能力,研究人员进行了剔除试验。这意味着在ASR系统进行训练时不改变LLM的参数,并且结果表明,即使在LLM被冻结的情况下,它仍然能够很好地执行多语种ASR。 团队还研究了增加音频编码器规模、提高音频编码器步幅(与音频如何划分相关的参数)和生成更少的音频嵌入的效果。通过这些测试,旨在提高ASR系统的有效性和效率。总之,研究结果表明,即使使用更大的音频编码器或更长的步幅,多语种ASR的可行性仍然存在,并且LLM能够处理长格式音频输入。

Leave a Comment

这篇人工智能论文提议将3D世界注入大型语言模型,并引入全新的3D-LLM家族

在过去几年中,我们见证了大规模语言模型(LLM)(如GPT4)的崛起,这些模型在包括沟通和常识推理在内的各种任务上表现出色。最近的研究关注如何将图片和视频与LLM对齐,以创建一种新型的多模态LLM(如Flamingo和BLIP-2),能够理解和理解二维视觉。然而,尽管这些模型在沟通和决策方面非常有效,但它们并不基于真实的三维物理世界中的更深层次概念,包括空间连接、可行性、物理和交互等。因此,与科幻电影中展示的能够理解三维情境并基于这些理解进行推理和规划的机器人助手相比,这种LLM是微不足道的。为了做到这一点,他们建议将三维世界纳入大规模语言模型,并引入一类全新的三维LLM,可以使用三维表示(即带有相关属性的三维点云)作为输入来处理各种三维相关任务。 图 1 当LLM使用三维情景表示作为输入时,它们从两个方面获益:(1) 它们可以将完整场景的长期记忆存储在整体的三维表示中,而不是片段性的部分观察。(2) 从三维表示中推理可以推断出三维特征,如可行性和空间链接,远远超出基于语言或二维图像的LLM的能力。数据收集是训练提出的三维LLM的一个重要障碍。缺乏三维数据使得基于三维数据创建基础模型变得困难,而互联网上的二维图像和文本数据却非常丰富。更难获取的是与口头描述相结合的三维数据。 他们提出了一系列独特的数据生成过程,以提供大量与语言相关的三维数据来解决这个问题。他们为三维数据和语言之间的交流提供了三个有效的提示过程,特别是使用ChatGPT。如图1所示,他们可以通过这种方式获取30万条三维语言数据,其中包括各种任务的信息,例如三维字幕、密集字幕、三维问题回答、三维任务分解、三维基础、三维辅助对话、导航等。下一个困难是找到与语言特征相匹配的有用的三维属性,用于三维LLM。一种方法是使用类似于CLIP的对比学习范式从头开始训练三维编码器,对齐语言和二维图片。然而,这种方法使用了大量的数据、时间和GPU资源。从不同的角度来看,最近的一些努力(如想法融合和3D-CLR)从二维多视图照片构建三维特征。他们还使用了一个三维特征提取器,根据这个提取器使用二维预训练特征的渲染多视图图片创建三维特征。 近期许多视觉语言模型(如BLIP-2和Flamingo)开始使用二维预训练的CLIP特征来训练它们的VLMs。由于它们映射到与二维预训练特征相同的特征空间,它们可以轻松地将二维VLMs作为骨干,并输入提取的三维特征以有效地训练三维LLM。三维LLM被预期具有潜在的三维空间信息感,这使它们在几个重要方面与传统的LLM和二维VLM不同。因此,来自加州大学洛杉矶分校、上海交通大学、华南理工大学、伊利诺伊大学厄巴纳-香槟分校、麻省理工学院、马萨诸塞大学阿默斯特分校和麻省理工-IBM沃森人工智能实验室的研究人员创建了一个将语言与地理位置连接起来的三维定位系统。他们将三维位置嵌入到检索到的三维特征中,更有效地编码空间信息。此外,他们向三维LLM添加了几个位置标记。然后,可以根据景物的语言描述生成位置标记来训练定位。这将使三维LLM能够更有效地记录三维空间数据。 总之,他们的论文提出了以下贡献: • 他们提出了一种新的基于3D的大型语言模型(3D-LLMs),可以使用来自带有特征和语言提示的3D点的输入来处理一系列与3D相关的任务。他们集中研究传统的或2D-LLMs无法涵盖的活动,例如对整个场景的认知、3D空间连接、适应性和3D规划等。 • 他们创建了创新的数据收集管道,可以生成大量的3D语言数据。基于这些管道,他们收集了一个包含超过30万个3D语言数据点的数据集,涵盖了广泛的3D相关活动,例如3D grounding、密集字幕、3D问题回答、任务分解、3D辅助对话、导航等。 • 他们使用3D特征提取器,该提取器可以接收渲染的多视角图片并提取有用的3D特征。他们使用2D预训练的VLMs构建了他们的训练系统。为了让3D-LLMs更好地收集3D空间信息,他们添加了一种3D定位方法。 • 在实验中,ScanQA(一种保留评估数据集)的表现优于先进的基准模型。在ScanQA上,特别是3D LLMs在基准模型(例如BLEU-1时提高了9%)的基础上表现更好。他们的方法在使用保留数据集进行3D字幕、任务创建和3D辅助对话的测试中击败了2D VLMs。定性调查显示,他们的方法可以更详细地处理各种工作。 • 他们希望将他们的3D-LLMs、3D语言数据集以及数据集的语言对齐的3D特征提供给即将进行的研究。

Leave a Comment

“赋能设备端人工智能:高通和Meta与Llama 2技术合作”

Meta发布了新的开源Llama 2,引发了关于大型语言模型(LLMs)用例的讨论。然而,对于许多人来说,在本地硬件上访问和运行Llama 2仍然是一个重要的障碍。为了解决这个问题并使Llama 2的能力普及化,Meta与高通合作,优化该模型以在设备上使用,利用高通的AI能力骁龙芯片。 Meta和高通的合作旨在在设备上实现Llama 2,并利用新的AI能力骁龙芯片的功能。通过在设备上运行模型,开发人员可以减少云计算成本,并为用户提供增强的隐私,因为没有数据传输到外部服务器。设备上的AI处理还可以实现生成式AI而无需互联网连接,并且可以根据用户的偏好对模型进行个性化。 高通的Hexagon处理器为其骁龙芯片配备了各种AI功能,包括微瓦推断、张量核心以及SegNet、标量和矢量工作负载的专用处理。将Llama 2整合到高通AI堆栈中,进一步优化了在设备上运行AI模型。 Meta从第一款LLaMA模型的泄露中吸取了教训,该模型最初仅向研究人员和学术机构开放。然而,互联网上的泄露导致了开源LLM创新的爆发,产生了各种改进版的LLaMA。开源社区做出了重大贡献,创建了可以在设备上运行的版本,使LLM更加易于访问更广泛的受众。 为了应对泄露事件,Meta在Llama 2的发布中采取了不同的方式,积极接受开放和合作。与高通的合作使芯片制造商了解了模型的内部工作原理,使他们能够优化骁龙芯片上的性能。这种合作预计将与高通的骁龙8 Gen 3芯片在2024年发布同时进行。 开源社区也预计在Llama 2的开发中发挥关键作用。将行业对设备上AI的势头与开放的LLM生态系统结合起来,这一举措被视为朝着培育活跃的设备上AI生态系统的众多步骤中的第一步。 专家预测,开源LLM可能会引领一代新的以AI为动力的内容生成、智能助手、生产力应用等。在设备上本地运行LLM的能力为设备上的AI处理开启了众多可能性,并支持AI能力在边缘的不断增长趋势,例如苹果在M1芯片中加入神经引擎和微软的混合AI Loop工具包。 总的来说,Meta和高通之间的合作标志着向AI模型普及化迈出了重要的一步,为开发人员创造AI应用程序开辟了令人兴奋的机会,并引领着类似于iPhone应用商店繁荣的设备上AI生态系统的新时代。

Leave a Comment

这项脑AI研究通过稳定扩散从读取脑电波中重建图像

构建与人类视觉系统类似的人工系统,是计算机视觉的一个重要目标。最近在人口脑活动测量方面的进展,以及深度神经网络模型的实现和设计的改进,使得可以直接比较人工网络的结构特征与生物大脑潜在表示的架构特征,揭示了这些系统的工作方式的关键细节。从脑活动中重建视觉图像,比如通过功能磁共振成像(fMRI)检测到的脑活动,就是其中的一个应用之一。这是一个有趣但困难的问题,因为潜在的脑表示大部分是未知的,而且用于脑数据的样本量通常很小。 近年来,学者们使用深度学习模型和技术,如生成对抗网络(GAN)和自监督学习,来应对这一挑战。然而,这些研究要求对fMRI实验中使用的特定刺激进行微调,或者从头开始训练新的生成模型。这些尝试在像素级和语义保真度方面表现出很大但受限的性能,部分原因是神经科学数据量较小,部分原因是构建复杂生成模型的多个困难。 扩散模型,尤其是计算资源消耗较少的潜在扩散模型,是最近的一个GAN替代方案。然而,由于LDMs仍然相对较新,很难完全理解它们的内部工作原理。 大阪大学和CiNet的研究团队使用一种名为稳定扩散的LDM来从fMRI信号重建视觉图像,试图解决上述问题。他们提出了一个简单的框架,可以在不需要训练或微调复杂深度学习模型的情况下,重建具有高语义保真度的高分辨率图像。 作者在这项研究中使用的数据集是自然场景数据集(NSD),该数据集收集了来自fMRI扫描仪的数据,每个受试者在30-40个会话期间观看了10,000张图片的三次重复。 来源:https://www.biorxiv.org/content/10.1101/2022.11.18.517004v2.full 首先,他们使用潜在扩散模型从文本中创建图像。在上图(顶部)中,z被定义为由模型通过c进行修改的生成的潜在表示,c被定义为文本的潜在表示(描述图像),zc被定义为由自编码器压缩的原始图像的潜在表示。 为了分析解码模型,作者按照以下三个步骤进行操作(上图,中部)。首先,他们从早期视觉皮层(蓝色)的fMRI信号中预测出呈现图像X的潜在表示z。然后,将z经过解码器处理,产生粗糙的解码图像Xz,然后将其编码并通过扩散过程。最后,将噪声图像添加到从高级视觉皮层(黄色)的fMRI信号中得到的解码潜在文本表示c中,并进行去噪处理,得到zc。从zc出发,解码模块产生最终重建的图像Xzc。需要强调的是,这个过程所需的唯一训练是线性映射fMRI信号到LDM组件zc、z和c。 从zc、z和c出发,作者进行了编码分析,通过将它们映射到脑活动来解释LDM的内部操作(上图,底部)。从表示中重建图像的结果如下所示。 来源:https://www.biorxiv.org/content/10.1101/2022.11.18.517004v2.full 使用简单的 z 重新创建的图像具有与原始图像的视觉一致性,但其语义价值丧失了。另一方面,仅使用 c 部分重建的图像产生了具有很强语义保真度但视觉不一致的图像。通过使用 zc 恢复的图像能够产生具有很高语义保真度的高分辨率图像,从而证明了该方法的有效性。 对大脑的最终分析揭示了关于 DM 模型的新信息。在大脑的后部,即视觉皮层中,所有三个组件都取得了很高的预测性能。特别是,z 在早期视觉皮层(位于视觉皮层后部)中提供了强大的预测性能。同时,它在上部视觉皮层(即视觉皮层的前部)中表现出很强的预测值,但在其他区域的值较小。另一方面,在上部视觉皮层中,c 提供了最佳的预测性能。 来源:https://www.biorxiv.org/content/10.1101/2022.11.18.517004v2.full 查看论文和项目页面。所有关于这项研究的荣誉归功于该项目的研究人员。还请不要忘记加入我们的26k+ ML…

Leave a Comment

这篇AI论文展示了一种利用LLM而不是人类创造大量具有不同复杂程度的指导数据的方法

在开放领域指令遵循数据上训练LLM的结果是惊人的。然而,手动开发这种类型的指令数据需要时间和精力。此外,人类可能需要帮助创建高度复杂的指令。最近,许多自然语言处理(NLP)社区的努力集中在教导大型语言模型更好地理解和遵循指令。最近的研究表明,LLM也可能从教学中受益。因此,这种数据现在常规用于在开放领域训练和微调LLM。 Evol-Instruct是一种革命性的方法,使用LLM创建不同复杂度的大量指令数据;这是由微软和北京大学的研究人员团队开发的。该团队的WizardLM模型生成的指令在人类评估中得分高于人类创建的指令数据集。 Evol-Instruct流程分为三个阶段: 指令的演化 基于新开发的教育的响应的演化 消除的演化 为了从简单的种子指令生成更复杂的指令,Evol-Instruct可以执行深度演化(涉及五种操作之一:添加约束、加深、具体化、增加推理步骤和复杂化输入)或广度演化(基于给定的指令创建新的指令)。最后一个阶段,消除演化,作为一个过滤器来消除不良指令。 研究人员使用Evol-Instruct生成不同复杂度的指令。然后,他们将所有生成的指令数据合并起来,通过实证研究来微调LLaMA LLM并开发他们的WizardLM模型。WizardLM与ChatGPT、Alpaca和Vicuna等行业标准工具进行了评估。 研究人员主要得出以下结论: Evol-Instruct的指令优于人类开发的ShareGPT。使用相同数量的Evol-Instruct数据(即70k)微调LLaMA 7B时,WizardLM的表现比Vicuna高出12.4%(41.3%对28.9%)。 在面临困难的测试指令时,标注者对WizardLM的结果比对ChatGPT的结果更满意。在测试集上,WizardLM相比ChatGPT输了12.8%,胜率为28.0%对40.8%。然而,在测试集的高难度部分(难度级别8)中,WizardLM相对于ChatGPT的胜率高出7.9个百分点,为42.9%对35.0%。这表明该技术极大地增强了大型语言模型处理复杂指令的能力。 研究的作者通过评估高复杂性组件的人类评估结果,显示WizardLM模型的输出优于OpenAI ChatGPT的输出。结果显示,使用AI演进的指令进行微调是增强大型语言模型的潜在途径,即使WizardLM在某些方面仍落后于ChatGPT。源代码和输出数据都可以在https://github.com/nlpxucan/WizardLM上查看。 研究人员使用以下三个LLM作为起点: OpenAI创建了AI聊天机器人ChatGPT,以使对话变得自然和有趣。它基于从互联网等大量文本数据训练的LLM,如GPT-3.5和GPT-4。在人类训练员的监督下,使用监督学习和强化学习方法对ChatGPT进行微调。 Alpaca是斯坦福大学的一个倡议,旨在创建和传播一种免费的、由社区驱动的遵循指令的范例。该模型使用通过查询OpenAI的text-davinci003模型创建的52K个遵循指令实例开发,并建立在LLaMA 7B上,这是一个经过训练的大型语言模型,使用了多个文本来源。 Vicuna是一个开源聊天机器人,可以为用户提供人性化和有趣的回复。它基于LLaMA 13B,使用了来自ShareGPT的70K个用户共享对话数据进行微调。 研究人员使用ChatGPT来评估每个指令的复杂性和困难度,从而使他们能够更深入地了解指令演化过程。根据LLaMA模型许可,研究人员以增量权重的形式发布[WizardLM]权重。可以通过将增量添加到初始LLaMA权重来获得WizardLM权重。 研究人员使用人工指导评估集将Wizard的输出与人类评估者生成的输出进行比较。在Wizard和控制组之间进行了盲目的成对比较。作者的评估数据收集涵盖了许多以用户为中心的任务,从复杂的代码生成和调试到数学推理,复杂格式的推理,学术写作和广泛的学科。 这些结果表明,Evol-Instruct的AI演化指令方法可以极大地提高LLM性能,并使模型具备处理具有挑战性和复杂指令的能力,例如涉及数学计算、程序开发和逻辑思考的指令。

Leave a Comment

基于Transformer的LLM如何从其参数中提取知识

近年来,基于Transformer的大型语言模型(LLMs)因其捕捉和存储事实知识的能力而变得非常流行。然而,这些模型在推理过程中如何提取事实关联的方式仍然相对未被充分探索。谷歌DeepMind、特拉维夫大学和谷歌研究的研究人员最近进行了一项研究,旨在研究Transformer-based LLMs存储和提取事实关联的内部机制。 该研究提出了一种信息流方法,以调查模型如何预测正确属性以及内部表示如何在层之间演化以生成输出。具体而言,研究人员关注了仅有解码器的LLMs,并确定了与关系和主题位置相关的关键计算点。他们通过使用“去除”策略,在特定层次阻止最后一个位置与其他位置进行关注,并观察推理过程中的影响。 为了进一步确定属性提取发生的位置,研究人员分析了在这些关键点和前面的表示构建过程中传播的信息。他们通过对词汇表、模型的多头自注意力(MHSA)和多层感知机(MLP)子层和投影进行额外干预来实现这一目标。 研究人员确定了一种基于主题丰富过程和属性提取操作的属性提取内部机制。具体而言,在模型的早期层中,关于主题的信息在最后一个主题令牌中得到丰富,而关系传递给最后一个令牌。最后,最后一个令牌使用关系通过注意力头参数从主题表示中提取相应的属性。 这些发现揭示了LLMs内部存储和提取事实关联的机制。研究人员认为,这些发现可能为知识定位和模型编辑开辟新的研究方向。例如,该研究的方法可以用于确定LLMs获取和存储有偏见信息的内部机制,并开发缓解此类偏见的方法。 总的来说,这项研究强调了研究Transformer-based LLMs存储和提取事实关联的内部机制的重要性。通过了解这些机制,研究人员可以开发更有效的方法来改善模型性能并减少偏见。此外,该研究的方法可以应用于自然语言处理的其他领域,如情感分析和语言翻译,以更好地了解这些模型的内部运作方式。

Leave a Comment

“结识PaLM-E:一个新的拥有5620亿参数的具身多模态语言模型,能够执行机器人操作规划、视觉问答等任务”

大型语言模型(LLMs)展示了在包括对话、逐步推理、数学问题解决和代码撰写在内的各个领域中的强大推理能力。尽管将大量文本数据用于LLMs的训练可以产生与其物理环境有关的表示,但将这些表示与真实世界的视觉和物理传感器模态相连接对于解决计算机视觉和机器人领域中更广泛的基于真实世界的问题至关重要。 以前的工作将LLMs的输出与学习到的机器人策略和可行性函数结合起来进行决策,但这种方法受到限制。以前的工作的局限性在于LLM只接收文本输入,这对于许多需要场景的几何配置至关重要的任务来说是不足够的。此外,他们的研究表明,在常见的视觉语言任务(如视觉问答)上训练的最先进的视觉语言模型无法直接解决机器人推理问题。在这项研究中,来自Google和TU Berlin的研究人员提出了具有体现的语言模型,该模型直接包括来自具体代理的传感器模态的连续输入,并允许语言模型在实际世界中进行更准确的顺序决策。他们开发了PaLM-E,这是一个单一的大型具体化多模态模型,具有积极的迁移效果,可以解决多种观察模态下的多种具体化推理问题。 PaLM-E LLM表现出积极的迁移效果,即学习者在学习第二语言(L2)时可以将他们在第一语言(L1)中的知识或技能应用于L2学习中,从而更快、更有效地掌握L2。例如,如果学习者的L1与他们正在学习的L2具有相似的语法结构,他们可能能够利用对L1语法的了解来更快地理解和应用L2语法规则。同样,如果学习者的L1和L2共享同源词(在两种语言中拼写和含义相似的词),他们可以通过识别和记忆这些同源词来快速扩展他们的L2词汇量。积极迁移与负迁移相对应,负迁移发生在学习者的L1的知识或技能干扰他们获得L2的能力时。例如,如果学习者的L1的语法结构与他们的L2大相径庭,即使他们在理解上理解了L2的语法规则,他们也可能在正确应用L2的语法规则时遇到困难。 与基于Transformer的LLM的自注意力层处理语言标记的方式类似,图片和状态估计等输入也被合并到与语言标记相同的潜在嵌入中。他们首先通过编码器将连续输入注入到预训练的LLM中。这些编码器经过端到端训练,可以产生自然语言中的顺序判断,具体化代理可以通过配置低层规则或响应具体化查询来理解这些判断。通过对比各种输入表示(例如标准与以物体为中心的ViT编码用于视觉输入)、在训练编码器时冻结与微调语言模型以及研究在多个任务上进行联合训练是否能够实现迁移,他们在一系列情境中评估了这种方法。 他们在三个机器人操作领域(其中两个在真实世界中是闭环的)、常见的视觉语言任务(如VQA和图片描述)和语言任务上测试了这种技术,以确定该方法的广度。根据他们的研究结果,多任务训练相对于单一任务训练可以提高性能。他们展示了在机器人任务中这种任务之间的迁移可能导致更高的数据效率,包括在新的物品组合或未知对象上表现出一次性或零次性的泛化,并大大提高从少量训练样本中的学习性能。据他们所知,将540B的PaLM LLM和22B的Vision Transformer(ViT)结合起来创建了迄今为止发表的最大的视觉语言模型,使PaLM-E扩展到了562B个参数。 在没有使用任务特定的微调的情况下,PaLM-E-562B在OK-VQA基准测试上取得了最先进的性能。他们还发现,即使只在单个图像示例上进行训练,PaLM-E-562B显示出了广泛的技能,包括零次多模态思维链(CoT)少量提示、无OCR算术推理和多图像推理。在他们的知识范围内,使用端到端模型在多模态数据上展示零次CoT尚未被证明具体化程序。 总结他们的主要贡献,他们(1)建议并展示了如何在训练多模态大型语言模型时包含具体化数据,以创建一个通用的、迁移学习的、多具体化决策代理。他们证明,即使最先进的通用视觉语言模型在开箱即用的情况下不能有效解决具体化推理问题(零-shot),也有可能训练一个既有效的具体化推理器又能胜任任务的通用视觉语言模型。在研究这种模型的最佳训练方法时, 他们(3)提供了新的架构概念,包括实体标记的多模态标记和神经场景表示。最后但并非最不重要的是,他们(4)证明了PaLM-E不仅是一个具体化推理器,而且还是一个定量技能丰富的视觉和语言通用模型,并且(5)显示扩大语言模型的规模可以实现多模态微调而减少灾难性遗忘。可以在他们的项目网站上找到各种演示。

Leave a Comment

阿里巴巴AI研究提出Composer:一个基于数十亿(文本,图像)对训练的巨型(50亿参数)可控扩散模型

现如今,基于文本的生成图片模型已经能够创建各种逼真的图片。最近的许多研究努力将文本到图片的模型进一步扩展,通过添加分割图、场景图、绘画、深度图和修复遮罩等条件或在少量特定主题数据上进行微调来实现定制化生成。然而,当将这些模型应用于实际应用时,设计师仍然需要更多的控制。例如,在真实世界的设计项目中,生成模型通常需要帮助可靠地生成同时对语义、形式、风格和颜色有要求的图片。 阿里巴巴中国的研究人员介绍了Composer。它是一个训练有数十亿个(文本,图片)对的大型(50亿参数)可控扩散模型。他们认为组合性而不仅仅是条件性是控制图像生成的秘密。后者引入了很多可能的组合,可以极大地扩大控制空间。类似的思想在语言和场景理解领域也有研究。在这些领域中,组合性被称为组合泛化,即能够从有限数量的可用组件中识别或创建出有限数量的独特组合的能力。基于上述概念,他们在这项工作中提供了一个组合生成模型的实现,称之为Composer。他们将可以平滑重新组合视觉元素以创建新图片的生成模型称为组合生成模型。他们使用一个具有UNet骨干的多条件扩散模型来实现Composer。每个Composer训练迭代有两个阶段:分解阶段,在这个阶段,计算机视觉算法或预训练模型被用来将一批图片分解成单个表示;合成阶段,在这个阶段,Composer被优化以从表示子集中重建图片。 图1:组合图像合成的思想,首先将一张图片分解成多个基本部分,然后以很高的创造力和控制度重新组合它们。为了做到这一点,这些组件以各种形式存在,并在整个生成过程中充当条件,使得在推理步骤中可以进行广泛的修改。建议以高分辨率查看。 Composer可以解码出从未见过的表示组合中的独特图片,这些表示可能来自多个来源,可能不兼容,而仅仅是通过重建目的进行训练。尽管概念上很简单且易于使用,但Composer在传统和以前未开发的图片生成和操作任务上表现出色,如但不限于文本到图片生成、多模态条件图片生成、风格转换、姿势转换、图片翻译、虚拟试穿、插值和来自各个方向的图片变化、通过修改草图进行图片重构、依赖图片翻译和图片翻译。 此外,Composer可以将所有上述操作的可编辑区域限制在用户指定的区域内,这比传统的修复操作更灵活,同时通过引入掩膜的正交表示防止在该区域之外修改像素。尽管经过多任务训练,Composer在COCO数据集上利用标题作为标准,在文本到图片合成中获得了零射击FID为9.2的结果,展示了其出色的性能。他们的分解-合成范式表明,当条件是可组合的而不仅仅是单独使用时,生成模型的控制空间可以大大增加。因此,他们的Composer架构可以重塑广泛的传统生成任务,并揭示了迄今未被认识的生成能力,为进一步研究各种分解技术提供了启示。此外,基于无分类器和双向引导,他们展示了许多使用Composer进行不同图片生成和修改任务的方法,并为后续研究提供了有益的参考。在将这项工作公开之前,他们计划仔细检查Composer如何降低滥用风险,并可能提供一个经过筛选的版本。

Leave a Comment

OpenAI推出Baby Llama——为低功耗设备提供的LLM!

来自人工智能领域的重大新闻!OpenAI的著名深度学习专家Andrej Karpathy进行了一项令人兴奋的周末项目,可能会彻底改变我们在资源受限设备上运行复杂模型的方式。通过他创建的“Baby Llama”,这是Llama 2模型的简化版本,Karpathy展示了纯C代码的强大能力,以及它在小型设备上实现高度互动速率的潜力。让我们深入探讨这个具有颠覆性的发展! 还阅读:OpenAI将发布AI模型的开源版本,加入开源竞赛 追求互动速率 – Baby Llama的诞生 受到探索新可能性的好奇心驱使,深度学习领域的先驱Andrej Karpathy开始了一个使开源Llama 2潜力得以释放的任务。尽管他能够在一个周末内构建出GPT-5,但Karpathy将时间投入到了对Llama 2的实验中,展示了他对推动人工智能边界的热情。 还阅读:Meta的Llama 2:面向商业用途的开源 将GPT-2转换为Llama 2:周末实验 在他的GitHub存储库Llama2.c中,Karpathy分享了他的创作过程。他巧妙地将nanoGPT框架转换为C编程语言中的Llama 2架构。结果,他的存储库引起了极大的关注,在短时间内获得了超过2.2K的星标。 在资源受限模型上实现互动速率 Karpathy实验最令人惊讶的成就之一是他能够在相对较小的模型上实现高度互动速率。尽管使用了一个包含数百万参数的模型,但在一个包含1500万参数的TinyStories数据集上训练,Karpathy的方法取得了显著的成功。 还阅读:新的AI模型仅使用30B参数就超越了GPT-3 低功耗设备上的惊人速度 在他的M1 MacBook…

Leave a Comment

加州大学伯克利分校的研究人员提出了一种名为“后见之链(CoH)”的新技术,可以使LLMs从任何形式的反馈中学习,提高模型性能

在过去的几年里,大规模神经网络引起了研究人员的广泛关注。这主要是因为它们在各种任务中表现出色,包括自然语言理解、解决具有挑战性的数学方程,甚至蛋白质结构预测。然而,为了确保这些模型对社会做出建设性贡献,关键是它们与人类价值观保持一致,并考虑人类偏好。使用人类反馈是实现这一目标最重要的方面之一,因为它使人类能够根据一系列指标(如准确性、公平性、偏见等)评估这些模型的性能,并提供改进这些模型以产生更具伦理输出的见解。为了提高整合用户反馈的效率,研究人员在过去几年中一直在尝试多种人机协同系统的方法。结果表明,ChatGPT和InstructGPT在使用人类反馈进行学习方面取得了惊人的成果。 这种语言建模的性能提升主要归因于依赖监督微调(SFT)和利用人类反馈进行强化学习(RLHF)的策略。尽管这些策略在提高语言模型性能方面做出了显著贡献,但它们也有自己的缺点。SFT主要依赖于人工注释,使得这些模型难以使用并且在数据利用上效率低下。另一方面,由于强化学习是基于奖励函数的,优化这些模型非常具有挑战性。 为了解决这些问题,加州大学伯克利分校的研究人员开发了一种将所有反馈转化为句子并使用它们来微调模型以理解反馈的新技术。这种技术被称为“回顾链”(CoH),它在很大程度上受到人类如何处理以语言形式提供的大量反馈的启发。研究人员在设计这种技术时的目标是结合SFT和RLHF的优势,同时避免使用强化学习来充分利用所有反馈。他们目前的方法利用语言理解和学习反馈的能力,最终提高模型在执行各种任务时的准确性和效果。 研究人员利用人类从语言形式的丰富反馈中学习得很好的事实。鉴于预训练语言模型在上下文中有效学习的卓越能力,研究人员想知道是否可以将所有反馈都转化为一个句子,并训练模型遵循这些反馈。更详细地说,研究人员建议微调模型以预测结果,同时依赖于一个或多个排序结果及其比较形式的反馈。CoH在训练过程中随机选择一个或多个模型输出,并利用它们构建一个包含正面和负面比较反馈的句子。例如,两个示例句子可以是“以下是一个糟糕的摘要”和“以下摘要更好”。模型在推理时使用正面反馈生成所需的输出。 CoH方法允许模型从正面和负面反馈中学习,以识别和纠正负面属性或错误。该策略还具有其他一些优点,包括更有机的反馈样式和一个训练系统。此外,根据研究人员进行的众多实验评估,CoH技术在关联语言模型与人类偏好方面远远优于先前的方法。该方法在人类评估中受到青睐,并在摘要和讨论任务上表现出色。加州大学伯克利分校的研究团队坚信,CoH在未来在各种其他类型的反馈(如自动和数值反馈)中具有巨大潜力。

Leave a Comment

马里兰大学的新人工智能研究探讨了在一天内使用单个GPU训练语言模型的压缩挑战

在自然语言处理的许多领域中,包括语言解释和自然语言合成,利用变压器拓扑的大规模机器学习模型的训练取得了突破性的进展。这些系统的广泛认可行为是它们在模型参数数量和数据量增加时能够稳定扩展或继续表现更好的能力。 虽然大多数研究都集中在寻找推动极端计算边界的新方法上,但马里兰大学的研究人员正在研究最佳的语言模型训练规模缩减方式和可能出现的权衡。 研究人员认为,由于规模效应带来的竞争,他们可以训练一个语言模型。最初的BERT模型在自然语言处理的许多实际应用中得到了使用。然而,这个模型已经需要大量计算才能训练。 在资源相对有限的情况下,有可能训练一个接近BERT性能水平的语言模型,这带来了许多有趣的后果。一个原因是,如果缩减模型的预训练是大规模计算预训练的有效替代品,那么它将开辟一系列目前难以实现的额外学术研究。研究人员表示,可能会出现一些场景,从业者有兴趣利用专门的或可靠的数据源重新训练他们的语言模型,但法律因素使得不确定是否可以接受在具有可疑来源的公共数据上训练的模型。 马里兰大学的研究人员进行了一项新研究,探索了“挤压”挑战——在考试前一天学习整个语言模型。他们的研究证明,在这种受限情况下,性能与大规模计算环境中发现的缩放规律密切相符。为了确定对训练流程的更改是否会导致缩小的情况下性能的提高,该研究首先研究了各种训练流程方面。 缩小规模是具有挑战性的。虽然较小的模型设计可以实现更快的梯度计算,但随时间的推移,模型改进的整体速率几乎保持不变。然而,利用缩放定律的训练配方修改可以通过增加梯度计算的有效速率而获得收益,而不需要减小模型的大小。最终,团队能够在有限的预算下训练模型并提供可观的性能,在GLUE任务中经常接近甚至超过BERT。 团队评估了将基于变压器的语言模型放入计算资源非常有限的情况下的性能。他们发现,多个变化方面导致在GLUE上可观的下游性能。团队希望这项工作可以作为对挤压问题进行调查的起点,并对多种改进和策略提供额外的见解。

Leave a Comment

Salesforce AI和哥伦比亚大学的研究人员推出DialogStudio:一个保留原始信息的统一而多样化的对话数据集合,包含80个对话数据集

近年来,对话式人工智能取得了重大进展,使得机器和用户之间的交互更加类似于人类之间的交流。推动这一进展的关键组成部分之一是大规模且多样化的数据集,这些数据集为训练复杂的语言模型提供了基础。Salesforce AI和哥伦比亚大学的研究人员推出了DialogStudio,作为一项开创性的倡议,为研究提供了一个包含统一对话数据集的综合性收集平台,以及训练大型语言模型(LLM)的支持。 统一对话数据集的需求 开发高效且多功能的对话式人工智能系统需要访问覆盖各个领域和对话类型的多样化数据集。传统上,不同的研究小组贡献了旨在解决特定对话场景的数据集。然而,这种分散的方法导致了对数据集之间更多标准化和互操作性的需求,使得比较和集成变得更加困难。 DialogStudio通过汇总33个不同的数据集来填补这一空白,这些数据集代表了多个类别,如知识驱动对话、自然语言理解、开放领域对话、任务导向对话、对话摘要和对话推荐。统一过程保留了每个数据集的原始信息,同时促进了无缝集成和跨领域研究。 对话质量评估 为了确保数据集的质量和适用性,DialogStudio采用了一套全面的对话质量评估框架。根据六个关键标准(理解、相关性、正确性、连贯性、完整性和整体质量)评估对话,使得研究人员和开发人员能够有效衡量模型的性能。评分范围为1到5分,分数越高表示对话质量越好。 通过HuggingFace实现无缝访问 DialogStudio通过HuggingFace提供了方便访问其庞大的数据集收藏。研究人员可以通过声明与DialogStudio中的数据集文件夹名称相对应的数据集名称来快速加载任何数据集。这一简化流程加速了对话式人工智能模型的开发和评估,节省了宝贵的时间和精力。 模型版本和限制 DialogStudio提供了基于选定数据集训练的1.0版本模型。这些模型基于小规模预训练模型,并且不包括用于训练像Alpaca、ShareGPT、GPT4ALL、UltraChat等大规模数据集的模型,也不包括OASST1和WizardCoder等其他数据集。尽管在创造性能力方面存在一些限制,但这些模型为开发复杂模型提供了一个坚实的起点。 DialogStudio是发展对话式人工智能的一个重要里程碑,提供了一个统一且广泛的对话数据集收藏。通过将多样化的数据集集中在一个平台上,DialogStudio使得研究人员和开发人员能够探索对话式人工智能的新领域,为机器和用户之间更加复杂、类似于人类的交互铺平了道路。凭借其持续改进和社区参与的关注,DialogStudio注定将在未来多年中塑造对话式人工智能的未来。

Leave a Comment

中国的一项新的人工智能研究提出了Meta-Transformer:一种用于多模态学习的统一人工智能框架

人脑被视为神经网络理论的典范,同时处理来自各种感官输入的信息,如视觉、听觉和触觉信号。此外,从一个来源获得的理解可能有助于从另一个来源获得知识。然而,由于深度学习中的巨大模态间隙,构建一个能够处理各种输入形式的统一网络需要大量的工作。在一个数据模态上训练的模型必须根据每个数据模态的不同数据模式进行调整。与口头语言相比,照片由于图像中像素的紧密排列而具有显着的信息冗余。 相反,由于点云在三维空间中的稀疏分布和对噪声的敏感性增加,很难描述点云。音频频谱图是由不同频率域的波的组合组成的非平稳的时变数据模式。视频数据具有记录空间信息和时间动态的独特能力,因为它由一系列图片帧组成。图数据通过在图中将项目表示为节点和关系表示为边来建模实体之间复杂的多对多交互。由于不同数据模态之间存在显著差异,使用其他网络拓扑独立编码每个数据模态是常见做法。 例如,Point Transformer使用向量级位置注意力从3D坐标中提取结构信息,但它无法对图片、自然语言句子或音频频谱图片段进行编码。因此,创建一个可以使用多个模态共享的参数空间来编码不同数据类型的单一框架需要时间和精力。通过对成对数据进行广泛的多模态预训练,最近开发的统一框架如VLMO、OFA和BEiT-3提高了网络的多模态理解能力。然而,由于它们更注重视觉和语言,它们无法在模态之间共享整个编码器。深度学习在自然语言处理(NLP)领域取得了很大的成就,得益于转换器架构和注意机制等其他研究人员提出的模型。 这些发展极大地改善了各种模态的感知能力,包括2D视觉(包括ViT和Swin Transformer)、3D视觉(包括Point Transformer和Point-ViT)、听觉信号处理(AST)等。这些研究说明了基于转换器的设计的适应性,并激发了学术界调查是否可以创建用于组合多个模态的基础模型,最终实现跨所有模态的人类水平感知能力。图1说明了它们如何探索转换器设计处理包括图片、自然语言、点云、音频频谱图、视频、红外线、高光谱、X射线、IMU、表格、图形和时间序列数据在内的12种模态的潜力。 图1:统一多模态学习 – 自然语言、图片、点云、音频、视频、红外线、高光谱、X射线、时间序列、表格、惯性测量单元(IMU)和图形数据都由Meta-Transformer使用相同的骨干进行编码。它展示了转换器系统如何提供统一的多模态智能。 他们讨论了使用转换器学习每种模态的过程,并解决了将它们组合成一个统一框架的困难。因此,来自香港中文大学和上海人工智能实验室的研究人员提出了一个名为Meta-Transformer的全新综合多模态学习框架。首个框架Meta-Transformer使用相同的参数集同时对来自十几种不同模态的输入进行编码,实现了更加综合的多模态学习方法。Meta-Transformer包括数据到序列标记的模态专家、跨模态提取表示的模态共享编码器和面向下游任务的任务特定头部这三个简单但有价值的组件。更准确地说,Meta-Transformer首先从多模态数据中创建具有共享流形空间的标记序列。 之后,使用冻结参数的共享编码器提取表示。使用轻量级分词器和更新的下游任务头参数进一步定制个别任务。最后,这种简单直接的方法可以高效训练特定任务和通用模态的表示。他们使用来自12种模态的几个标准进行了大量研究。Meta-Transformer在处理来自多个模态的数据时表现出色,仅使用LAION-2B数据集中的图片进行预训练,并在各种多模态学习任务中持续优于最先进的技术。 总之,他们的贡献如下: • 他们提供了一个独特的框架,称为Meta-Transformer,用于多模态研究,使单个编码器能够同时使用相同的参数集从多个模态中提取表示。 • 他们在处理多个模态的多模态网络架构中,对Transformer的组件(如嵌入、分词和编码器)的作用进行了深入研究。 • 在各种关于12种模态的数据集上,实验结果表明Meta-Transformer取得了出色的性能,验证了Meta-Transformer在统一多模态学习方面的进一步潜力。 • Meta-Transformer开辟了一个有前景的新方向,即开发一个统一所有模态的模态无关框架。

Leave a Comment

“遇见百川-13B:中国的开源大语言模型,与OpenAI匹敌”

中国搜索引擎搜狗的创始人王小川通过其公司百川智能发布了一款名为百川-13B的新型巨型语言模型。目前,该模型仅限程序员和研究人员进行商业使用。搜狗创始人王小川最近在微博上发布了一条消息称“中国需要自己的OpenAI”。这位中国商人在其初创公司百川智能发布了下一代大型语言模型百川-13B之后,离实现自己的愿景又近了一步。百川智能在三个月前推出,并迅速吸引了一批愿意投资5000万美元的投资者。由于创始人在计算机科学方面的非凡技能,他的组织现在被视为中国最有前途的巨型语言模型创造者之一。 百川-13B采用了与GPT和大部分国内中文变体相同的Transformer设计。除了在中文和英文数据上进行训练外,它的130亿个参数(用于文本生成和分析的变量)都是双语的。该模型是开源的,可以用于赢利,并且是使用GitHub上的数据构建的。 在百川-7B取得成功之后,百川智能科技推出了百川-13B,这是一个商业可用的开源大型语言模型,具有130亿个参数。在受人尊敬的中文和英文规范中,它胜过了同等规模的竞争对手。此次发布包括基准(百川-13B-Base)和对话(百川-13B-Chat)两个版本。 特点 百川-13B在百川-7B的基础上将参数数量增加到130亿,并在高质量语料库上训练了1.4万亿个标记,比LLaMA-13B多40%。在开源的13B规模下,它是训练数据最多的模型。它采用了ALiBi位置编码和4096字节的上下文窗口,并且可以同时处理中文和英文。 预训练模型用于开发者的基础版本,而具有对话功能的对齐模型更受常规用户的青睐。因此,这个开源版本中包括了具有强大对话功能、可直接使用并仅需几行代码即可部署的对齐模型(百川-13B-Chat)。 研究人员还提供了int8和int4量化版本,这些版本在推理方面更加高效,以鼓励广泛的用户使用。它们可以在像Nvidia 3090这样的消费级显卡上实现,但非量化版本需要更强大的硬件支持。 公众使用免费,无限制转售或修改:如果开发者通过邮件申请官方商业许可,他们可以免费使用百川-13B进行商业目的。 百川-13B使用了大约14亿个标记进行训练。据OpenAI称,ChatGPT-3据说是在3000亿个标记上进行训练的。百川团队在三个月内扩大了一倍,成员达到了50人,并在上个月公开展示了他们的模型百川-7B,该模型具有70亿个参数。两天前发布的百川-13B版本是最基本的版本。现在,已经获得合法授权的研究人员和程序员可以免费使用它进行商业用途。该模型是否会正式发布供广泛使用的未来尚待发现。 基础模型百川-13B现在对已获得必要法律许可的研究人员和程序员免费提供,并且可以在像Nvidia的3090显卡之类的消费级硬件上运行,这一点尤其值得注意,考虑到最近美国对中国人工智能芯片制造商的限制。 百川智能科技的研究人员确认,他们的团队尚未为任何平台(包括iOS、Android、Web等)创建基于百川-13B的应用程序。我们敦促用户不要将百川-13B模型用于非法或有害的目的,如危害国家或社会安全。同时,我们鼓励用户在没有必要的安全审计和备案的情况下不要将百川-13B模型用于互联网服务。我们指望每个人遵守这个规则,将技术进步限制在法律范围内。

Leave a Comment

Meta AI推出IMAGEBIND:第一个能够同时绑定六种模态数据的开源AI项目,无需明确的监督

人类在接触到仅仅几个实例后就能理解复杂的概念。大多数情况下,我们可以根据书面描述识别动物,并根据视觉猜测未知汽车引擎的声音。这部分是因为一张单独的图片可以“绑定”起本来不相干的感官体验。基于配对数据,标准的多模态学习在人工智能中存在一定的局限性,随着模态数量的增加。 将文本、音频等与图像对齐已成为最近几种方法的重点。这些策略最多只使用两种感官。然而,最终的嵌入只能表示训练的模态及其对应的配对。因此,无法直接将视频音频嵌入转换为图像文本活动,反之亦然。缺乏同时包含所有模态的大量多模态数据是学习真正联合嵌入的一大障碍。 新的元研究引入了IMAGEBIND,这是一个使用多种形式的图像对数据来学习单一共享表示空间的系统。不需要使用同时包含所有模态的数据集。相反,这项工作利用了图像的绑定属性,并展示了将每种模态的嵌入与图像嵌入对齐会导致所有模态的紧密对齐。 网络上大量的图像和相应的文本促使人们对训练图像文本模型进行了大量研究。ImageBind利用了图像经常与其他模态同时出现并可以作为它们之间的桥梁的事实,例如使用在线数据将文本与图像链接,或者使用从佩戴式相机和IMU传感器获得的视频数据将运动与视频链接。 跨模态学习的目标可以是从大量网络数据中学习到的视觉表示。这意味着ImageBind还可以对频繁与图像同时出现的任何其他模态进行对齐。对于与图片高度相关的热度和深度等模态,对齐更简单。 ImageBind通过仅使用成对图像就能整合所有六种模态。该模型能够让各种模态“交流”并发现彼此之间的联系,从而提供更全面的信息解释,即使不能直接观察到这些模态之间的关系。通过这样做,其他模型可以在不需要大量的时间和精力进行训练的情况下“理解”新的模态。ImageBind的强大的可扩展行为使得可以将该模型用于以前不能使用额外模态的许多AI模型的替代或补充。 通过将大规模的图像文本配对数据与自监督数据对四种新模态进行结合,即音频、深度、热度和惯性测量单元(IMU)读数,展示了IMAGEBIND在零样本分类和检索任务上的强大性能。团队表明,加强底层图像表示可以增强这些新出现的特征。 研究结果表明,IMAGEBIND在音频分类和检索基准(如ESC、Clotho和AudioCaps)上的零样本分类性能与通过直接音频-文本监督进行训练的专家模型持平或超过。在少样本评估基准上,IMAGEBIND表示还优于专家监督的模型。最后,他们展示了IMAGEBIND在各种组合任务中的灵活性,包括跨模态检索、嵌入的算术组合、图像中的音频源检测以及通过音频输入生成图像。 由于这些嵌入没有针对特定应用进行训练,所以其效率落后于特定领域的模型。团队认为,了解如何将通用嵌入定制为特定目标(如结构化预测任务,如检测)将非常有帮助。

Leave a Comment

见面提示扩散:一种用于在基于扩散的生成模型中实现上下文学习的人工智能框架

最先进的大型语言模型(LLM),包括BERT、GPT-2、BART、T5、GPT-3和GPT-4,是由最近在机器学习领域,尤其是在自然语言处理(NLP)领域的进展所开发出来的。这些模型已经被有效地应用于各种任务,包括文本生成、机器翻译、情感分析和问答。它们学习上下文的能力,通常被称为上下文学习,是这些LLM的新兴行为之一。像GPT-3这样具有上下文学习能力的LLM,可以通过条件化输入输出样本和新鲜查询输入来完成任务,而无需优化任何模型参数。 多种语言任务的预训练可以与上下文学习和精心设计的提示结构相结合,使得LLM能够成功地推广到它们从未遇到过的活动中。尽管上下文学习在NLP领域已经得到了广泛的研究,但在计算机视觉领域中几乎没有应用。要将上下文学习作为一种用于伟大视觉应用的标准技术来展示其实用性和潜力存在两个重要困难:1)创建一个有效的视觉提示比创建语言任务的提示更困难,因为它需要领域特定的输入输出对作为示例和图片搜索作为标准。2)在计算机视觉中,通常会为专门的任务训练大型模型,包括文本到图像生成、类别条件生成、分割、检测和分类。 这些庞大的视觉模型必须更加灵活以适应新的任务,并不适用于上下文学习。最近的一些尝试通过使用NLP的答案来解决这些问题。具体地说,当将示例照片、查询图像和输出图像融合为一个庞大的整体时,训练基于Transformer的图像修复模型来预测被屏蔽的输出图像。然而,将大尺寸的图像拼接在一起会显著增加计算开销,尤其是在高分辨率的情况下。本研究通过解决这两个问题,来探讨基于文本引导的扩散生成模型的上下文学习潜力。 为了在能够处理各种视觉-语言活动的视觉-语言提示下执行上下文学习,微软和德克萨斯大学奥斯汀分校的研究人员提出了一种新颖的模型架构,称为Prompt Diffusion。Prompt Diffusion在六个单独的视觉-语言任务中并行进行。具体地,他们利用他们的视觉-语言提示来描述一个通用的视觉-语言任务。然后,他们根据Stable Diffusion和ControlNet的设计灵感构建了Prompt Diffusion,它可以使用他们的视觉-语言提示作为输入。他们将Prompt Diffusion视为实现文本引导的扩散模型具备上下文学习能力的第一步。然后,它可以利用这些知识通过将连接重新映射到查询图像并包含语言指令来创建输出图像。更重要的是,跨多个任务的学习赋予了模型上下文学习的能力。Prompt Diffusion可以成功地推广到尚未观察到的多个新功能上。除了在训练期间表现良好的六个任务上,它还在熟悉和新的未见任务上表现出色。 从经验上看,Prompt Diffusion在关于上下文学习的熟悉和新的未见任务上表现出色。预计Prompt Diffusion的有效性将激发并推动更多关于基于扩散的上下文视觉学习的研究。以下是他们的主要贡献的摘要: • 一种先进的视觉-语言提示设计,有效地实现了多种视觉-语言活动的融合。 • 使用Prompt Diffusion模型在学习和新的未见任务上进行高质量的上下文生成,这是第一个具备上下文学习能力的基于扩散的可适应视觉-语言基础模型。 • 在GitHub上可以找到Pytorch代码实现。

Leave a Comment

“遇见P+:文本到图像生成中的扩展文本逆转的丰富嵌入空间”

文本到图像合成是指从文本提示描述中生成逼真图像的过程。这项技术是人工智能领域中生成模型的一个分支,并在近年来越来越受到关注。 文本到图像生成旨在使神经网络能够解释和翻译人类语言为视觉表达,从而实现各种合成组合。此外,除非另有教导,生成网络会为相同的文本描述生成多个不同的图片。这对于收集新的想法或呈现我们心中准确的视觉是非常有用的,而在互联网上找不到。 这项技术在虚拟现实、增强现实、数字营销和娱乐等各个领域都具有潜在的应用。 在最常用的文本到图像生成网络中,我们可以找到扩散模型。 文本到图像扩散模型通过迭代地改进以文本输入为条件的噪声分布来生成图像。他们将给定的文本描述编码为潜在向量,该向量影响噪声分布,并通过扩散过程迭代地改进噪声分布。这个过程产生了与输入文本匹配的高分辨率和多样化的图像,通过捕捉和融合输入文本的视觉特征的U-net架构实现。 这些模型中的条件空间被称为P空间,由语言模型的标记嵌入空间定义。基本上,P代表文本条件空间,在合成过程中,已经通过文本编码器传递给U-net的输入实例“p”被注入到所有注意层中。 下面是去噪扩散模型的文本条件机制概述。 通过这个过程,由于只有一个实例“p”被馈送到U-net架构中,对编码文本的获得的分离和控制是有限的。 因此,作者引入了一个被称为P+的新的文本条件空间。 这个空间由多个文本条件组成,每个条件被注入到U-net的不同层中。这样,P+可以保证更高的表达能力和分离性,提供对合成图像的更好控制。正如作者所描述的,U-net的不同层对合成图像的属性具有不同程度的控制。特别是,粗糙层主要影响图像的结构,而细层主要影响图像的外观。 在介绍了P+空间之后,作者引入了一个相关的过程,称为扩展文本倒置(XTI)。它是经典文本倒置(TI)的重新审视版本,TI的过程是模型学习将几个输入图像中描述的特定概念表示为专用标记。在XTI中,目标是将输入图像反转为一组标记嵌入,每个层一个标记嵌入,即反转为P+。 为了清楚地说明两者之间的区别,想象一下将“绿色蜥蜴”的图片输入到一个两层的U-net中。TI的目标是获得输出“绿色蜥蜴”,而XTI需要输出两个不同的实例,在这种情况下是“绿色”和“蜥蜴”。 作者在他们的工作中证明了P+中扩展倒置过程不仅比TI更具表达能力和精确性,而且速度更快。 此外,增加P+上的分离性能够通过文本到图像生成进行混合,例如对象样式的混合。 下面是来自上述工作的一个示例。 这就是P+的概述,一个用于扩展文本倒置的丰富的文本条件空间。

Leave a Comment

UC Santa Cruz和三星的研究人员推出了ESC:一种利用像ChatGPT这样的LLMs中的常识进行零射击目标导航决策的代理

对象导航(ObjNav)指导一个物理代理前往一个预先确定的目标对象,而这个环境对于它来说是未知的。前往目标对象是代理与之交互的前提条件,因此对于其他基于导航的具身任务来说,这个活动至关重要。 识别环境中的房间和物体(语义场景理解)以及使用常识推理来推断目标物体的位置(常识推理)是成功导航所必需的两个关键技能。然而,现有的零样本对象导航方法经常缺乏常识推理能力,并且没有充分解决这个需求。现有的技术依赖于简单的探索启发式算法或者需要在其他目标导向的导航任务和环境中进行训练。 最近的研究表明,大规模预训练模型在零样本学习和问题解决方面表现出色。受到这些研究的启发,加州大学圣克鲁兹分校和三星研究提出了一种零样本对象导航框架,称为带有软常识约束的探索(ESC)。该框架使用预训练模型自动适应陌生的环境和物体种类。 团队首先使用GLIP,一种视觉和语言基础模型,用于推断当前代理视图的对象和房间信息,作为一种基于提示的开放世界对象定位和场景理解方法。由于GLIP在图像-文本对上进行了广泛的预训练,它可以在最小提示的情况下轻松推广到新的对象。然后,他们使用了一个预训练的常识推理语言模型,该模型使用房间和对象数据作为上下文来推断两者之间的关联。 然而,将从LLMs中推导出的常识知识转化为可操作的步骤仍存在一些空白。事物之间的联系在某种程度上存在一定的不确定性也是很常见的。通过使用概率软逻辑(PSL),一种声明性模板语言,该语言定义了遵守一阶逻辑原则的一部分马尔可夫随机场,ESC方法模拟了“软”常识限制来克服这些障碍。基于前沿的探索(FBE)是一种传统策略,它利用这些温和的常识限制来关注下一个要调查的前沿。虽然之前的方法依靠神经网络训练来隐式灌输常识,但是所提出的方法使用软逻辑谓词来在连续值空间中表达知识,并将其提供给每个前沿以促进更高效的探索。 为了测试系统的有效性,研究人员使用了三个目标导航基准(MP3D,HM3D和RoboTHOR),这些基准具有不同的家庭规模,建筑风格,纹理特征和物体类型。研究结果显示,该方法在MP3D上以SPL加权长度(SPL)和SR(成功率)约为CoW的285%和RoboTHOR的35%和SR(成功率)表现出色。该技术在MP3D上相对于ZSON实现了196%更好的SPL,相对于HM3D实现了85%更好的SPL,而ZSON需要在HM3D数据集上进行训练。在MP3D数据集上,所提出的零样本方法实现了与其他最先进的监督算法相比最高的SPL。

Leave a Comment

见面LLaMaTab:一个在浏览器中完全运行LLM的开源Chrome扩展程序

LLaMaTab – 一个具有洞察力的Chrome扩展 一个名为LLaMaTab New Tab的Chrome附加程序将在每次新建标签页时显示不同的羊驼图片。这是一个愚蠢的附加程序,但在事情变得困难时,它可以让人继续前行。如果你正在使用Chrome并希望为浏览体验注入个性和乐趣,LLaMaTab New Tab是一个绝佳的扩展。此外,它还是保持动力和完成任务的绝佳方法。如果你想让Chrome的体验更有趣,LLaMaTab New Tab扩展正是你所需要的。 LLaMaTab New Tab的优势 使用LLaMaTab New Tab扩展,将一些轻松的元素注入你的日常网络活动中。 你可以通过添加羊驼照片或从一个预先制作的图库中选择照片来自定义LLaMaTab New Tab。 LLaMaTab New Tab是一个轻量级的附加程序,不会影响浏览器的性能。 特点 由于附加程序的代码是公开的,可以轻松修改以提供新的功能。 该附加程序已经翻译成多种语言,让用户可以使用他们偏好的语言工作。…

Leave a Comment