人工智能领域最新的突破是大型语言模型(LLM)的引入。这些模型使我们能够更简洁地理解语言,从而更好地利用自然语言处理(NLP)和自然语言理解(NLU)。这些模型在包括文本摘要、问答、内容生成、语言翻译等各种任务上表现良好。它们能够理解复杂的文本提示,甚至能够理解带有推理和逻辑的文本,并识别数据之间的模式和关系。 尽管语言模型在各种任务中表现出色,并且在最近的发展中取得了显著进展,但它们仍然难以高效地通过API调用使用工具。即使是像GPT-4这样有名的LLM也难以生成精确的输入参数,并经常推荐不合适的API调用。为了解决这个问题,伯克利和微软研究人员提出了Gorilla,这是一个基于细调的LLaMA模型,它在生成API调用方面击败了GPT-4。Gorilla有助于选择合适的API,提高LLM与外部工具合作执行特定活动的能力。 研究团队还创建了一个名为APIBench的数据集,其中包含了大量重叠功能的API。该数据集是通过收集TorchHub、TensorHub和HuggingFace等公共模型库的ML API创建的。每个API都包含来自TorchHub和TensorHub的每个API请求,并选择HuggingFace每个任务类别的前20个模型。此外,他们使用自我指导方法为每个API生成了十个虚构的用户查询提示。 使用这个APIBench数据集和文档检索,研究人员对Gorilla进行了细调。这个70亿参数的模型在API功能的正确性和减少产生幻觉错误方面优于GPT-4。文档检索器与Gorilla的有效集成展示了LLM更精确使用工具的可能性。Gorilla的改进的API调用生成能力以及根据需要修改文档的能力提高了模型结果的适用性和可靠性。这一发展非常重要,因为它使LLM能够跟上定期更新的文档,为用户提供更准确和最新的信息。 研究人员分享的一个例子显示了Gorilla如何正确识别任务并提供经过充分确认的API结果。模型生成的API调用显示GPT-4为假想模型生成API请求,这表明它对任务的理解不足。Claude选择了错误的库,显示了无法识别正确资源的能力不足。相比之下,Gorilla正确识别了任务。因此,Gorilla与GPT-4和Claude不同,其API调用生成准确,既展示了其增强的性能,又展示了其任务理解能力。 总之,Gorilla是语言模型列表中的重要增加,因为它甚至解决了编写API调用的问题。它的能力能够减少与产生幻觉和可靠性相关的问题。
Leave a CommentTag: Large Language Model
随着OpenAI发布的全新GPT 4的问世,大型语言模型中引入了多模态。与之前的版本GPT 3.5不同,该版本不仅可以接受文本输入,还可以接受图像输入。最近,来自卡内基梅隆大学的研究团队提出了一种称为Generating Images with Large Language Models (GILL)的方法,该方法专注于扩展多模态语言模型以生成一些独特的图像。 GILL方法使得可以处理混合了图像和文本的输入,并生成文本、检索图像和创建新图像。尽管模型使用了不同的文本编码器,GILL通过将仅包含文本的冻结语言模型的输出嵌入空间转移到冻结的图像生成模型的嵌入空间来实现这一点。与需要交错图像-文本数据的其他方法不同,该映射是通过利用图像标题的配对来微调少量参数来完成的。 研究团队提到,该方法将已经训练好的用于冻结文本的大型语言模型与图像编码和解码模型相结合。它可以提供各种多模态功能,例如图像检索、独特图像生成和多模态对话。这是通过将模态的嵌入空间进行映射以进行融合来实现的。GILL可以处理混合图像和文本输入的条件,并生成既连贯又可读的输出。 该方法提供了一个有效的映射网络,将LLM与文本到图像生成模型相关联,以在图片生成方面获得出色的性能。该映射网络将隐藏的文本表示转换为视觉模型的嵌入空间。通过这样做,它利用了LLM强大的文本表示能力来生成具有美学一致性的输出。 通过这种方法,模型不仅可以从指定数据集中检索图像,还可以创建新的图像。模型在推理时选择是生成还是获取图像。该选择是基于LLM的隐藏表示条件的学习决策模块进行的。这种方法在计算上非常高效,因为它在训练时无需运行图像生成模型。 与基准生成模型相比,该方法在需要更长、更复杂的语言的任务中表现更好。相比之下,GILL在处理较长的文本(包括对话和篇章)方面优于稳定扩散方法。GILL在对话条件下的图像生成方面比非LLM基础的生成模型表现更好,从多模态上下文中受益,并生成更符合给定文本的图像。与仅处理文本输入的传统文本到图像模型不同,GILL还可以处理任意交错的图像-文本输入。 总之,Generating Images with Large Language Models (GILL)似乎比以前的多模态语言模型具有更广泛的能力。它在衡量上下文依赖性的各种文本到图像任务中优于非LLM基础的生成模型,使其成为多模态任务的强大解决方案。
Leave a Comment虽然扩散模型现在被认为是最先进的文本到图像生成模型,但它们已经成为一种“颠覆性技术”,具有以前从未听说过的能力,可以从文本提示中创建高质量、多样化的图片。尽管这一进展在改变用户如何创建数字内容方面具有重大潜力,但给用户对所创建材料的直观控制能力仍然是一个挑战。 目前,有两种调整扩散模型的技术:(i) 从头开始训练一个模型,或者(ii) 对现有的扩散模型进行微调以适应当前任务。即使在微调的情况下,由于模型和训练数据的不断增加,这种策略通常需要大量的计算和漫长的开发周期。而(ii) 重用已经训练过的模型,并增加一些受控的生成能力。一些技术先前专注于特定任务并创建了一种专门的方法。本研究旨在生成MultiDiffusion,这是一个新的、统一的框架,极大地提高了预先训练的(参考)扩散模型对受控图像生成的适应性。 图1:MultiDiffusion使得灵活的文本到图像生成成为可能,它统一了对所创建内容的许多控制,如所需的长宽比或基于粗略区域的文本提示。 MultiDiffusion的基本目标是设计一个新的生成过程,其中包含多个参考扩散生成过程,这些过程通过一组共同的特征或约束连接起来。生成结果的各个区域都经过参考扩散模型,该模型更具体地为每个区域预测去噪采样步骤。然后,MultiDiffusion执行全局去噪采样步骤,使用最小二乘最佳解来协调所有这些单独的阶段。例如,考虑使用在方形图像上训练的参考扩散模型创建具有任何长宽比的图片的挑战(见下图2)。 图2:MultiDiffusion:在预先训练的参考模型Φ上定义了一个新的生成过程Ψ。从噪声图像JT开始,每个生成步骤都会解决一个优化任务,其目标是每个裁剪Fi(Jt)尽可能接近其去噪版本Φ(Fi(Jt))。请注意,虽然每个去噪步骤Φ(Fi(Jt))可能朝着不同的方向拉动,但它们的过程将这些不一致的方向融合成一个全局去噪步骤Φ(Jt),从而产生高质量的无缝图像。 MultiDiffusion将参考模型在去噪过程的每个阶段提供的方形裁剪的去噪方向合并在一起。它尽可能地跟随它们,尽管受到共享像素的相邻裁剪的限制。尽管每个裁剪可能会在去噪时拉动到不同的方向,但应注意的是,他们的框架会产生一个单一的去噪阶段,从而产生高质量且无缝的图片。我们应该要求每个裁剪都代表参考模型的真实样本。 使用MultiDiffusion,他们可以将预先训练的参考文本到图像模型应用于各种任务,例如生成具有特定分辨率或长宽比的图片,或者从不可读的基于区域的文本提示生成图像,如图1所示。值得注意的是,他们的架构通过利用共享的开发过程同时解决了这两个任务。通过将其与相关基准进行比较,他们发现他们的方法在控制生成质量方面甚至可以达到最先进的水平,而无需增加计算负担。完整的代码库将很快在他们的Github页面上发布。您也可以在他们的项目页面上查看更多演示。
Leave a Comment自然语言处理(NLP)近年来发生了一次范式转变,引入了大型语言模型(LLMs),在各种NLP任务中表现优于之前相对较小的语言模型(LMs),如GPT-2和T5 Raffel等。提示是使用LLMs执行各种任务的事实上的方法,通过使用上下文中的自然语言指令引导LLMs生成所需的输出,而无需对参数进行更新,与传统的微调范式相反,其中LMs的参数可以针对每个下游任务进行更新。 虽然这种提示模式使得LLMs在零射击或少射击环境中在各种任务上表现出色,但它们在某些特定的下游任务上的表现仍然需要改进,并且需要额外的细化,尤其在训练数据可用的情况下。然而,由于大多数LLMs只提供黑盒推理API并且微调成本高昂,大多数用户和学者无法直接优化这些LLMs。因此,必须解决的一个困难问题是如何有效地提高LLMs在特定下游任务上的性能,有时只有有限的训练实例。来自加利福尼亚大学圣巴巴拉分校和微软的一项新研究提出了使用微小可调整LM(RL)增强冻结的黑盒LLM在下游任务上的架构,称为定向刺激提示(DSP)。 来源:https://arxiv.org/pdf/2302.11520.pdf | 图1:使用通常的提示方法和我们提出的定向刺激提示的摘要任务所使用的时间比较。我们的DSP使用可调整的策略LM生成刺激,该刺激在此示例中是关键词,然后将LLM定向为提供更好的得分或其他指标(以蓝色突出显示)的所需摘要。 更准确地说,对于每个输入文本,一个微小的LM(称为策略LM)学习提供一系列离散的令牌作为指向性刺激,这些刺激可能提供有关输入样本的某些信息或指令,而不是作为工作的通用提示。为了将LLM的生成定向到所需的目标,例如更高的性能度量得分,然后将创建的刺激与原始输入混合并提供给LLM。他们最初使用具有预训练LM的监督微调(SFT),利用少量收集的训练样本。训练的目标是最大化奖励,定义为基于策略LM生成的刺激的LLM生成的下游性能度量得分。经过进一步的优化以探索更好的刺激,经过改进的LM在RL中初始化策略LM。 图1描述了摘要任务的一个示例。为了帮助LLM基于关键词生成所需的摘要,关键词充当刺激(提示)。可以使用ROUGE等评估指标分数对策略LM进行优化,以激励它提供指导LLM生成更好摘要的关键词。虽然LLMs具有出色的生成能力,但它们经常显示出不受欢迎的行为,需要对预期的生成特征和某些下游任务的方向进行细粒度的指导。这是他们提出的方法的基础。微小的策略LM可以作为指向性刺激生成一系列令牌,以向LLM提供样本级的细粒度指导,以实现预期的目标,但不能生成类似人类语言的文本。 与以往通过提示工程/优化来找到最佳提示的研究不同,RL提供了将优化对象(例如生成刺激的小型策略LM)与LLM生成定义的优化目标之间的自然桥梁。他们的方法试图为每个“问题”提供“提示”或“线索”。它还不同于鼓励LLM在解决推理任务时生成中间推理步骤的链式思维提示。他们的方法使用一个小的可调整模型来控制和引导LLM,并针对不仅有一个正确的“答案”的生成任务进行优化。他们在摘要和对话回复生成任务上评估了他们的框架。 创建刺激的小策略LM是一个优化的对象,但LLM的生成确定了优化目标。强化学习为弥合这个差距提供了简单的方法。与以前的研究不同,这次研究尝试通过使用提示工程或优化来澄清“问题”。他们的策略努力为每个“问题”提供“提示”或“线索”。此外,它与思维链提示不同,后者鼓励大脑在完成需要逻辑的任务时自行推理出中间步骤。他们的方法针对需要生成多个有效“响应”的任务,并采用一个简单可调的模型来调节和指导LLM。他们评估了他们的框架,用750M Flan-T5-large作为策略LM和175B Codex作为LLM进行测试。根据测试结果,当Codex依赖于经过调整的T5生成的指示时,其在下游任务上的性能显著提高。摘要应包含的关键词被用作摘要任务的指导刺激。使用从CNN/Daily Mail数据集中提取的2,000个样本训练的T5,Codex的性能已经提高了7.2%。 为了开发用于500个MultiWOZ数据集对话的目标回复背后的预期意义的对话行为,他们训练了策略LM。由于策略LM生成的对话行为,Codex的总分提高了52.5%。它的表现与先前使用完整训练数据(8438个对话)训练的系统一样好或更好。
Leave a Comment表格经常被用于表示庞大而复杂的数据世界,并作为各种情境下数据驱动决策的基础,包括财务分析、供应链管理和医疗保健分析。利益相关者可以使用它来分析趋势、模式和关联,从而帮助他们做出明智的商业选择并优化流程和资源。数据科学家长期以来一直在使用复杂的Excel公式或自定义程序处理表格。因此,对于表格数据的更有效理解和解释需求迫切。大型语言模型 (LLM) 或生成预训练转换器 (GPT) 已经在自然语言处理中的语言数据挖掘范式上进行了革命性变革。 与这些研究保持一致,研究人员还探讨了语音和视觉等多种模态的广泛模型。它们生成类似于人类语音的文本的能力为处理表格数据开辟了新的途径。然而,由于两个原因,很难在表格领域使用标准的ChatGPT模型:(一)全局表格理解:众所周知,GPT具有令牌长度限制,使其难以扫描庞大的表格并理解其包含的信息;(二)它们的训练过程是为自然语言设计的,因此在处理表格数据时缺乏普适性。已经有几项工作用于包括自然语言的表格数据分析。 自然语言转SQL (NL2SQL) 是一个成熟的研究领域,它将自然语言转化为控制关系型数据库的SQL指令。为了使用各种电子表格软件功能,SheetCopilot最近研究了控制VBA (Visual Basic for Applications,一种嵌入式脚本语言,用于Microsoft Excel)的语言。然而,他们发现这两种选择都没有令人满意的表现。他们认为这些固有的非结构化计算机代码类型增加了复杂性,几乎不可能进行自动化后处理。浙江大学的研究人员在这项研究中创建了TableGPT,推动了使用LLM方法分析数据时可行性的极限。这是在使数据更易于访问和理解的过程中的重大进展。他们的TableGPT系统将表格、口头指令和普通语言结合为一个统一的GPT模型,提高了数据解释的用户友好性和直观性。 他们通过重新设想表格、口头语言和指令之间的交互方式,将许多关键元素融合到TableGPT中: • 全局表格表示:他们首次尝试创建表格的全局表示的学习范式,将整个表格编码为一个向量。他们使表格编码器能够通过同时对大量文本和表格数据进行LLM和编码器的训练,有效捕捉输入表格的全局信息。因此,由于LLM能够更好地看到和理解表格数据,提供了更全面和改进的对表格的理解。 • 指令链:他们使用这个概念来强调有组织、层次化任务执行的重要性。TableGPT遵循相同的指令顺序,将复杂的任务分解为简单的任务,并逐步执行,就像一个协调良好的组织,其中每个指令从更高级别级联到较低级别的相应指令。此外,它鼓励拒绝不明确或不合适的指令的能力,就像真正的数据科学家一样,而不是盲目地遵循任何可能不正确的指令,从而增强了人与LLM系统在数据科学环境中的交流。他们建议的指令集更易于使用,并减少了使用传统技术处理表格数据时常常出现的歧义。 • 领域感知微调:为了提高模型对特定领域表格数据的理解能力,领域感知微调包括调整训练,使模型生成包含给定领域中的类似风格和逻辑元素的文本。这促进了适应不同领域的表格和相应的文本材料的能力。还创建了一个数据处理流水线,使这种策略变得实用和可扩展。由NL2SQL生成的非结构化代码在实际生产环境中进行预先检查和错误修复带来了重大困难。因此,他们支持使用结构化的指令序列,使后处理更加容易。 Data-Copilot也采用了这种基于指令的方法,但它对本地LLM的依赖,用于直接理解表格数据的处理和分析逻辑,存在一些缺点。他们认为一个成功的解决方案应该专门为表格数据而设计,同时保持对更大规模下游活动的广泛适用性,这是由于表格数据的固有不可预测性和任务特定性。这种信念强调了为表格数据实施特别预训练的LLM的重要性。总之,本研究提出了一个具有开创性的TableGPT框架,这是一个全面、综合和自然语言驱动的解决方案,实现了有效的表格数据处理、分析和可视化。 他们列举了TableGPT的几个重要优点: • 以语言驱动的探索性数据分析(EDA):通过使用简洁的语言,TableGPT分析用户意图,细分所需行动,并在表格上执行外部命令。然后,将处理后的结果以表格和书面解释的形式提供给用户。由于这种创新技术,探索性数据分析(EDA)变得直观,使用户更容易与表格数据进行交互。…
Leave a Comment许多开源项目已经开发了全面的语言模型,可以进行特定任务的训练。这些模型可以对用户的问题和命令提供有用的回答。值得注意的例子包括基于LLaMA的Alpaca和Vicuna,以及基于Pythia的OpenAssistant和Dolly。 尽管每周都有新模型发布,但社区仍然在努力适当地对它们进行基准测试。由于LLM助手的问题通常含糊不清,创建一个可以自动评估其回答质量的基准测试系统是困难的。这里通常需要通过配对比较进行人工评估。基于配对比较的可伸缩、渐进和独特的基准测试系统是理想的。 当前的LLM基准测试系统中很少有满足所有这些要求的系统。像HELM和lm-evaluation-harness这样的经典LLM基准框架提供了研究标准任务的多指标测量。然而,它们并不很好地评估自由形式的问题,因为它们不是基于配对比较的。 LMSYS ORG是一个开发开放、可伸缩和易于访问的大型模型和系统的组织。他们的新工作提出了Chatbot Arena,这是一个众包LLM基准测试平台,具有匿名、随机对战的特点。与国际象棋和其他竞技游戏一样,Chatbot Arena采用了Elo评级系统。Elo评级系统在提供上述理想品质方面显示出潜力。 一周前,他们开放了与许多知名的开源LLM一起的竞技场,开始收集信息。可以在众包数据收集方法中看到LLM的一些真实应用示例。用户可以在竞技场中同时与两个匿名模型聊天,进行比较和对比。 FastChat,这个多模型服务系统,在https://arena.lmsys.org上托管了竞技场。进入竞技场的人将面对与两个无名模型的对话。当用户从两个模型那里接收到评论后,他们可以继续对话或者投票选择自己喜欢的模型。投票结束后,模型的身份将被揭示。用户可以继续与同样的两个匿名模型对话,也可以开始与两个新模型的新战斗。系统记录了所有用户的活动。只有在分析中使用了模型名称的时候,投票才会被隐藏。自一个星期前竞技场上线以来,已经统计了大约7000个合法的匿名投票。 未来,他们希望实现改进的抽样算法、锦标赛流程和服务系统,以适应更多样的模型,并为各种任务提供细粒度的排名。
Leave a Comment大型语言模型(LLM)的发展,例如OpenAI的ChatGPT和GPT-4,在自然语言处理、计算机视觉和生物医学等许多领域中重塑了人工智能。不幸的是,ChatGPT的训练细节和其变体的模型架构仍然未知。虽然LLaMA是一个开源的基础语言模型,但据推测,它在需要广泛领域知识的应用中表现不佳,是由于在模型预训练阶段缺乏领域特定数据引起的。 许多研究一直在讨论修改和使用开源LLM来实现专门目的。例如,Alpaca和Vicuna专注于通过训练模型以遵守自动创建的指令示例来扩展模型的交互能力。 上海交通大学和上海人工智能实验室最近的一项工作采用了一种不同的方法,将领域知识注入到单个预训练的LLaMA中,以将基础语言模型引导到医学专用语料库。他们介绍了PMC-LLaMA,这是一个公开可用的语言模型,通过在480万篇医学学术论文上对LLaMA-7B进行改进开发而成。团队认为,在医学讨论和咨询中,一个以医学为重点的基础语言模型会有更多的益处。 团队从S2ORC数据集开始,该数据集包含81.1M篇英文学术论文,并根据其PubMed Central(PMC)ID对其进行了排序。因此,约有490万篇论文,总计超过750亿个标记与医学知识高度相关。通过优化GPT2中首次提出的自回归生成目标,他们在这些免费的PMC论文上对LLaMA-7B模型进行了微调。他们采用bf16(脑浮点)数据格式和完全分片数据并行(FSDP)加速方法来加快学习过程。 团队通过对上述相关的医学问答数据集进行三种不同类型的微调来测试PMC-LLaMA:完全微调、参数高效微调和数据高效微调。实验结果表明,当微调指令调整时,PMC-LLaMA在医学领域中优于LLaMA和其他使用LLaMA微调指令训练的模型。 PMC-LLaMA的一个缺点是,这480万篇论文中并不包含每个标记,因为迄今为止他们只进行了五个时期的训练。在未来,他们计划逐步训练具有更多参数的PMC-LLaMA模型,持续训练PMC-LLaMA,并更新hugging face页面上的基础模型。
Leave a Comment科技巨头苹果正在推进备受期待的AI聊天机器人项目,暂定名为“AppleGPT”。这个革命性项目采用了由Google JAX提供支持的“Ajax”大型语言模型(LLM)框架,一直是公司内部严格保密的秘密。然而,消息人士透露,苹果正在努力开发这项尖端技术,并准备在不久的将来宣布重大的与AI相关的消息。让我们更多地了解苹果进军生成式AI的重要步骤。 还阅读:WWDC亮点:苹果实用的AI解决方案揭示 AppleGPT的崛起:一款正在崛起的AI奇迹 苹果一直在将AI技术融入其软件中取得进展。然而,它还未涉足生成式AI领域。代号为“AppleGPT”的聊天机器人将以其先进的语言模型和令人印象深刻的能力改变游戏规则。 还阅读:埃隆·马斯克的xAI挑战OpenAI的ChatGPT Ajax:AppleGPT智能背后的强大引擎 AppleGPT的核心是“Ajax”框架,这是一个强大的语言模型,使用Google JAX构建,旨在加快机器学习研究。这个尖端框架运行在Google Cloud上,并被苹果的多个团队利用。尽管公司对于隐私影响持谨慎态度,工程师们一直在内部探索这项技术,以优化其性能。 苹果的悄然追求:在众多竞争对手中脱颖而出 与Meta、微软和谷歌等其他科技巨头迅速向公众发布生成式AI产品不同,苹果在这一领域一直保持着一定的神秘感。有趣的是,苹果禁止员工使用ChatGPT,表明了对其自己的AI努力的高度保密。 还阅读:苹果的矛盾之举:在担心隐私问题后推广ChatGPT Siri的遗产与更远的未来:苹果的AI之旅 苹果进入AI领域的旅程始于其标志性语音助手Siri。尽管Siri在推广AI语音技术方面起到了重要作用,但批评人士认为它仍有改进的空间。鉴于此,苹果聘请了谷歌前高管John Giannandrea领导其AI和机器学习团队,表明了公司对推进其AI能力的坚定承诺。 蒂姆·库克的愿景:苹果对AI的看法 苹果首席执行官蒂姆·库克对AI技术的潜力表达了浓厚的兴趣。在最近的采访和财报电话会议中,库克强调AI是公司未来发展的重点。然而,他也承认需要解决与AI产品相关的一些挑战和关切。 还阅读:苹果CEO蒂姆·库克支持ChatGPT并讨论AI的未来 协作努力:面向所有人的LLM 为了提升对AI进展的可访问性,Meta和微软等公司已经合作,将他们的LLM提供给初创公司和研究人员。例如,Meta的LLM LLaMA 2将在微软的Azure平台上提供,而微软已将OpenAI GPT模型集成到其Bing搜索产品中。 还阅读:微软通过对Bing…
Leave a Comment大型语言模型(LLMs)在每次更新和发布新版本时都越来越受欢迎。像BERT、GPT和PaLM这样的LLMs在自然语言处理和自然语言理解领域展示了巨大的能力。由OpenAI开发的著名聊天机器人ChatGPT基于GPT 3.5和GPT 4的变压器架构,并被超过一百万用户使用。由于它具有模仿人类特性,它引起了从研究人员和开发人员到学生的所有人的注意。它可以高效地生成独特的内容,像人类一样回答问题,总结长篇文字段落,完成代码示例,翻译语言等等。 ChatGPT已经证明在各种主题上向用户提供信息非常出色,使它们成为传统网页搜索和在线寻求他人帮助的潜在替代品。但是也存在一种限制,即如果用户继续私下与大规模语言模型进行互动,公开可访问的人类生成数据和知识资源的数量可能会大幅减少。这种开放数据的减少可能会使未来模型的训练数据变得困难,因为可能会有较少的免费可用信息。 为了进一步研究这个问题,一组研究人员对Stack Overflow上的活动进行了调查,以确定ChatGPT的发布如何影响开放数据的产生。Stack Overflow是一个著名的面向计算机程序员的问答网站,它是一个很好的案例研究,可以研究当存在多个语言模型时用户行为和贡献。该团队对如何随着ChatGPT等LLMs的普及而导致类似StackOverflow等网站上的内容大幅减少进行了深入研究。 经过评估,该团队得出了一些有趣的结论。与ChatGPT访问受限的中国和俄罗斯竞争对手以及类似的数学论坛相比,Stack Overflow的活动明显减少。团队预测,在OpenAI的ChatGPT发布后,Stack Overflow每周帖子数量将下降16%。同时,ChatGPT对减少Stack Overflow活动的影响随着时间的推移而增加,这表明随着用户对该模型的特性越来越熟悉,他们开始越来越多地依赖它获取信息,进一步限制了对该网站的贡献。 该团队得出了三个关键发现,具体如下。 减少的发布活动:ChatGPT发布后,Stack Overflow的帖子数量,即问题和答案的数量,减少了。使用差异法计算了活动减少并与其他四个问答平台进行了比较。ChatGPT发布后的六个月内,Stack Overflow的帖子活动量最初下降了约16%,然后增长到约25%。 帖子投票数没有改变 – 自ChatGPT发布以来,Stack Overflow上的帖子收到的投票数(包括赞成和反对)没有显着变化,尽管帖子活动有所下降,这表明ChatGPT不仅替代了低质量的帖子,还替代了高质量的文章。 对不同编程语言的影响:ChatGPT对Stack Overflow上讨论的各种编程语言产生了不同的影响。与全球网站平均水平相比,一些语言(如Python和JavaScript)的帖子活动减少得更为明显。帖子活动的相对下降也受到GitHub上编程语言的普及程度的影响。 作者总结了广泛使用LLMs和随之而来的远离Stack Overflow等网站可能会限制用户和未来模型从中学习的开放数据的数量的影响,并且尽管在解决某些编程问题方面可能会提高效率,但对于互联网上的知识的可访问性和共享以及AI生态系统的长期可持续性都会产生影响。
Leave a Comment随着最近技术的进步,像GPT-3和PaLM这样的大型语言模型在教育、内容创作、医疗保健、研究等领域展现出了非凡的生成能力。例如,这些大型语言模型对于作家来说尤其有用,可以帮助他们提升写作风格,对于初学者开发者来说,可以帮助他们生成样板代码等。此外,结合多个第三方API的可用性,大型语言模型在学生和医疗系统等多个面向消费者的系统中的广泛应用只增加了。然而,在这种情况下,系统的安全性成为一个基本问题,因为人们信任这些系统来处理敏感的个人信息。这就需要更清楚地了解大型语言模型的不同能力和限制。 然而,大多数以前的研究都集中在通过采用更先进和复杂的架构使大型语言模型更强大。尽管这项研究在很大程度上超越了自然语言处理社区,但也导致了对这些系统安全性的忽视。在这方面,普林斯顿大学和佐治亚理工学院的博士后学生与艾伦人工智能研究所(A2I)的研究人员合作,对OpenAI的革命性AI聊天机器人ChatGPT进行了毒性分析。研究人员评估了ChatGPT的超过50万次生成过程中的毒性,并发现当ChatGPT的系统参数设置为分配一个人物角色时,其毒性在各种话题上增加了数倍。例如,当ChatGPT的人物角色设置为拳击手“穆罕默德·阿里”时,其毒性几乎比默认设置增加了3倍。这特别令人担忧,因为ChatGPT目前被用作构建其他几种技术的基础,这些技术在进行系统级修改后可能会生成相同水平的毒性。因此,A2I研究人员和大学生所做的工作侧重于在分配不同角色时,对ChatGPT生成的毒性有更深入的了解。 ChatGPT API提供了一种功能,允许用户通过设置其系统参数来分配一个人物角色,从而通过影响ChatGPT的对话方式来设定对话的基调。对于他们的用例,研究人员精心挑选了来自不同背景和国家的90个人物角色,如企业家、政治家、记者等。这些人物角色被分配给ChatGPT,以分析其对大约128个关键实体(如性别、宗教、职业等)的回应。团队还要求ChatGPT继续完成关于这些实体的某些不完整的短语,以收集更多见解。最终的研究结果显示,给ChatGPT分配一个人物角色可能会使其毒性增加多达六倍,ChatGPT经常产生严厉的输出,并沉溺于负面刻板印象和信念。 团队的研究发现,ChatGPT输出的毒性根据所给予的人物角色而有显著差异,研究人员认为这是因为ChatGPT根据其训练数据对人物的理解。例如,一个发现表明,记者的毒性是商人的两倍,即使在实践中可能并非如此。研究还显示,特定的人群和实体比其他人更频繁地成为目标(几乎是三倍),这显示了该模型固有的歧视行为。例如,毒性根据人的性别而有所不同,比基于种族的毒性大约高出50%。这种波动趋势可能对用户造成损害,并对相关个体进行贬低。此外,恶意用户可以在ChatGPT上构建技术,生成可能伤害无辜观众的内容。 这项研究对ChatGPT的毒性进行的分析主要揭示了三个问题:当分配人物角色时,模型的毒性可以显著增加(比默认设置高出多达六倍);模型的毒性根据人物角色的身份而有很大差异,ChatGPT对人物角色的观点起着重要作用;ChatGPT可以通过对特定实体进行更具毒性的内容创作来歧视性地针对特定实体。研究人员还指出,尽管ChatGPT是他们实验中使用的大型语言模型,但他们的方法可以扩展到任何其他大型语言模型。团队希望他们的工作能激励人工智能社区开发出提供道德、安全和可靠的人工智能系统的技术。
Leave a Comment机器学习模型需要对长篇文本进行编码,以用于各种自然语言处理任务,包括总结或回答关于长篇文档的问题。由于注意力成本随输入长度的增加呈二次增长,并且必须对每个输入标记应用前馈和投影层,使用Transformer模型处理长文本在计算上是昂贵的。近年来出现了几种“高效Transformer”策略,降低了对长输入的注意机制的开销。然而,前馈和投影层,尤其是对于更大的模型,承载着大部分的计算负载,并且可能使分析长输入变得不可能。本研究介绍了COLT5,这是一种新的模型系列,通过同时改进注意力和前馈层的架构,构建在LONGT5的基础上,实现对长输入的快速处理。 COLT5的基础是某些标记比其他标记更重要,并且通过为重要标记分配更多的计算资源,可以以较低的成本获得更高的质量。例如,COLT5将每个前馈层和每个注意力层分为轻量级分支和重量级分支,轻量级分支应用于所有标记,重量级分支用于选择特定输入和组件的重要标记。与常规的LONGT5相比,轻量级前馈分支的隐藏维度小于重量级前馈分支的隐藏维度。此外,随着文档长度的增加,重要标记的百分比会减少,从而实现对长文本的可管理处理。 图1:有条件计算的COLT5 Transformer层概述。 图1显示了COLT5条件机制的概述。由于COLT5的存在,LONGT5架构经历了两个进一步的变化。重量级注意力分支在一组精心选择的重要标记上执行完全的注意力,而轻量级注意力分支具有较少的头部并应用局部注意力。COLT5引入的多查询交叉注意力大大加速了推理。此外,COLT5使用UL2预训练目标,他们表明这可以实现对长输入的上下文学习。 来自Google Research的研究人员建议COLT5,这是一种用于处理远程输入的新型模型,利用有条件的计算来获得更好的性能和更快的处理速度。他们证明COLT5在arXiv摘要和TriviaQA问答数据集上优于LONGT5,在SCROLLS基准测试上达到了SOTA水平。COLT5针对“关注”标记的缩放不是线性的,大大提高了长输入任务的质量和性能。COLT5在相同或更好的模型质量下,进行微调和推理速度明显更快。COLT5中的轻量级前馈和注意力层适用于所有输入,而重量级分支只影响由学习路由器选择的一部分重要标记。他们证明COLT5在各种长输入数据集上优于LONGT5,并且能够成功高效地处理长达64k个标记的输入。
Leave a Comment近年来,人工智能(AI)的繁荣与AI能够更快地完成工作并减少努力有多大关系。现如今,几乎没有任何领域不使用AI。例如,从Amazon Echo和Google Home等语音助手中的AI代理到使用机器学习算法预测蛋白质结构,AI无处不在。因此,合理地相信与AI系统合作的人会做出比单独行动更优越的决策是合理的。但实际情况是否确实如此呢? 以往的研究表明,情况并非总是如此。在一些情况下,AI并不总是产生正确的反应,这些系统必须进行重新训练以纠正偏见或其他问题。然而,对人工智能决策团队有效性构成危险的另一个相关现象是AI过度依赖,即人们受到AI影响并经常接受不正确的决策而不验证AI的正确性。在进行诸如识别银行欺诈和提供医学诊断等关键和重要任务时,这可能非常有害。研究人员还表明,解释性人工智能并不能减少AI过度依赖问题,解释性人工智能是指AI模型在每一步解释为何做出某个决策而不仅仅提供预测。一些研究人员甚至声称,认知偏见或未校准的信任是过度依赖的根源,将过度依赖归因于人类认知的不可避免性。 然而,这些研究结果并未完全证实AI解释应该减少过度依赖的观点。为了进一步探索这一点,斯坦福大学人类中心人工智能(HAI)实验室的研究团队声称,人们在是否与AI解释进行交互方面是有策略选择的,表明在某些情况下,AI解释可以帮助人们减少过度依赖。根据他们的论文,当相关的AI解释比手头的任务容易理解,并且这样做有更大的利益(可以是财务奖励形式),个体更不可能依赖于AI的预测。他们还证明,当我们专注于与解释互动而不仅仅是让目标提供解释时,可以大大减少对AI的过度依赖。 该团队将这种策略性决策在成本收益框架中进行了测试。在这个框架中,主动参与任务的成本和效益与依赖AI的成本和效益进行了比较。他们邀请在线众包工人与AI合作解决三个不同复杂度的迷宫挑战。相应的AI模型提供答案,要么没有解释,要么提供了多个程度的解释,从下一步的单个指令到退出整个迷宫的逐步指导。试验结果表明,诸如任务难度和解释难度之类的成本以及货币补偿等利益大大影响了过度依赖。对于AI模型提供逐步指导的复杂任务,过度依赖并没有减少,因为解读生成的解释与独自解决迷宫一样具有挑战性。此外,当能够独立解决迷宫时,大多数解释对过度依赖没有影响。 该团队得出结论,如果手头的工作具有挑战性并且相关的解释清晰明了,它们可以帮助防止过度依赖。然而,当工作和解释都很困难或简单时,这些解释对过度依赖几乎没有影响。如果活动容易执行,那么解释并不重要,因为人们可以自己轻松地执行任务,而不是依赖解释生成结论。此外,当任务复杂时,人们有两个选择:要么手动完成任务,要么检查生成的AI解释,这些解释通常同样复杂。这主要是因为AI研究人员可用的解释工具很少,需要的验证工作比手动执行任务要少得多。因此,人们倾向于相信AI的判断而不质疑它或寻求解释,并不奇怪。 作为一项额外的实验,研究人员还将经济利益因素引入了方程式。他们向众包工人提供了独立完成不同难度的迷宫任务以获得一笔钱的选择,或者以较少的金钱换取AI的帮助,要么没有解释,要么提供复杂的逐步指导。研究结果显示,当任务具有挑战性时,工人更重视AI的帮助,并更喜欢简单明了的解释。此外,发现随着使用AI的长期好处增加(在本例中是财务奖励),过度依赖减少。 斯坦福研究人员对他们的发现寄予厚望,希望能给那些被事实解释不能减少过度依赖的学者们带来一些安慰。此外,他们希望通过提供引人入胜的论据,激励可解释的人工智能研究人员,以改进和简化人工智能的解释。 查看论文和斯坦福文章。此研究的所有荣誉归功于该项目的研究人员们。此外,请不要忘记加入我们的26k+ ML SubReddit、Discord Channel和Email Newsletter,我们在那里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 使用Tensorleap的可解释性平台揭示深度学习的秘密 这篇文章来源于MarkTechPost,介绍了斯坦福的一项新的人工智能研究,展示了解释如何在决策过程中减少对人工智能系统的过度依赖。
Leave a Comment“大型语言模型”已经被开发出来,可以根据输入预测自然语言内容。除了语言建模挑战,使用这些模型还提高了自然语言的性能。基于LLM的方法在医学任务中,如信息提取、问答和摘要中展示了益处。提示是LLM技术中使用的自然语言指令。这些指令集包括任务规范,预测必须遵守的规则,以及可选的任务输入和输出样本。 生成式语言模型根据以自然语言给出的指令产生结果,消除了对特定任务的训练要求,使非专家能够扩展这项技术。虽然许多任务可以表示为单一线索,但进一步的研究表明,将任务分割为较小的任务可能会提高任务性能,尤其是在医疗领域。它们支持一种替代策略,包括两个关键组成部分。它始于一个迭代过程,用于改进第一个产品。与条件链接相反,这使得生成可以整体上得到完善。其次,它有一个指导者,可以通过在每次重复中提出要集中注意的区域来进行引导,使过程更加可理解。 随着GPT-4的发展,他们现在可以使用一个丰富、逼真的对话式VoAGI。来自Curai Health的研究人员建议使用对话式解决代理或DERA。DERA是一个框架,用于研究如何通过对话解决的代理来提高自然语言任务的性能。他们认为,将每个对话代理分配给特定的角色将有助于他们专注于工作的某些方面,并确保他们的合作伙伴代理与整体目标保持一致。研究者代理人寻求与问题相关的相关数据,并提议其他代理人要集中注意的主题。 为了提高自然语言任务的性能,他们提供了DERA,这是一个代理-代理交互的框架。他们根据三个不同类别的临床任务评估DERA。为了回答每个问题,需要不同的文本输入和不同的专业水平。医疗对话摘要挑战旨在提供一个医生-患者对话的摘要,该摘要在事实上是正确的,没有幻觉或遗漏。创建护理计划需要大量的信息,并且有助于临床决策支持的冗长输出。Decider代理角色可以自由回应这些数据,并选择输出的最终行动方案。 该工作有多种解决方案,目标是尽可能地提供事实上正确和相关的材料。回答关于医学的问题是一项开放性任务,需要思考知识,并且只有一个可能的解决方案。他们使用两个问答数据集在这个更具挑战性的环境中进行研究。在两个人工注释评估中,他们发现DERA在护理计划创建和医疗对话摘要任务方面的表现优于基本的GPT-4。根据定量分析,DERA成功纠正了包含许多不准确信息的医疗对话摘要。 另一方面,他们发现在问答方面,GPT-4和DERA的表现几乎没有改进。根据他们的理论,这种方法在涉及许多细粒度特征的长篇生成问题上效果很好。他们将合作发布一个基于MedQA的新型开放性医学问答工作,其中包括美国医学执照考试的实践问题。这使得对建模和评估问答系统进行新的研究成为可能。推理链和其他特定任务的方法都是链策略的示例。 推理链技术鼓励模型像专家一样处理问题,从而提高某些任务的性能。所有这些方法都努力从基本语言模型中产生适当的生成结果。这种提示系统受限于预先确定的、具有特定目的的提示集,如编写解释或修复输出异常,这是该方法的一个基本限制。他们在这个方向上迈出了一大步,但将它们应用于现实世界的情况仍然是一个巨大的挑战。
Leave a Comment大型语言模型(LLMs)正在迅速发展,并对经济和社会变革做出重要贡献。随着互联网上发布了许多人工智能(AI)工具,其中一个在过去几个月中非常受欢迎的工具是ChatGPT。ChatGPT是一种自然语言处理模型,允许用户生成像人类一样有意义的文本。OpenAI的ChatGPT基于GPT变压器架构,GPT-4是支撑它的最新语言模型。 随着最新的人工智能和机器学习发展,计算机视觉得到了指数级的提升,网络架构和大规模模型训练得到了改进。最近,一些研究人员引入了MM-REACT,这是一种将多个视觉专家与ChatGPT结合起来进行多模态推理和行动的系统范例。MM-REACT以更灵活的方式将各个视觉模型与语言模型结合起来,以克服复杂的视觉理解挑战。 MM-REACT的目标是处理现有视觉和视觉语言模型难以应对的各种复杂视觉任务。为此,MM-REACT使用提示设计来表示各种类型的信息,例如文本描述、文本化的空间坐标以及作为对齐文件名表示的密集视觉信号,如图像和视频。这种设计使ChatGPT能够接受和处理不同类型的信息与视觉输入相结合,从而实现更准确、全面的理解。 MM-REACT是一个将ChatGPT的能力与一组视觉专家相结合以增加多模态功能的系统。文件路径被用作占位符,并输入到ChatGPT中,以使系统能够接受图像作为输入。每当系统需要从图像中获取特定信息,例如识别名人姓名或框坐标时,ChatGPT会寻求特定视觉专家的帮助。专家的输出被序列化为文本,并与输入结合起来进一步激活ChatGPT。如果不需要外部专家,则直接将响应返回给用户。 通过向ChatGPT提示中添加与每个专家能力、输入参数类型和输出类型相关的特定指令,以及每个专家的一些上下文示例,使ChatGPT能够理解视觉专家的使用知识。此外,还指导使用正则表达式匹配来调用相应的专家。 通过实验,零-shot实验显示了MM-REACT如何有效地解决其特定的感兴趣的能力。它已经证明在解决需要复杂视觉理解的各种高级视觉任务方面非常高效。作者分享了一些例子,其中MM-REACT能够解决图像上显示的线性方程。此外,它还能够通过命名图像中的产品及其成分等来进行概念理解。总之,这种系统范例很好地结合了语言和视觉专业知识,并能够实现高级视觉智能。
Leave a Comment随着互联网和社交媒体的兴起,虚假新闻和误导信息的传播已经成为一个令人担忧的问题。因此,为解决这个问题,已经进行了大量的实验。近年来,大型语言模型(LLMs)作为检测和分类此类误导信息的潜在解决方案引起了广泛关注。 为了解决这个在互联网驱动的世界中出现的虚假新闻和误导信息的问题,威斯康星州立大学的研究人员进行了广泛的研究和实验。他们的研究重点是测试最先进的语言模型(LLMs)的能力,以确定新闻文章的真实性并识别虚假新闻或误导信息。他们主要关注了四个LLM模型:Open AI的Chat GPT-3.0和Chat GPT-4.0,Google的Bard/LaMDA和Microsoft的Bing AI。 研究人员对这些知名的大型语言模型(LLMs)在检测虚假新闻方面的准确性进行了彻底的研究。通过严格的实验,他们评估了这些先进LLM在分析和评估新闻文章以及区分真实和不可信信息方面的能力。 他们的研究结果旨在为LLMs如何对抗误导信息提供有价值的见解,从而最终帮助创建一个更值得信赖的数字环境。研究人员表示,他们之所以选择研究这篇论文,是因为他们有必要了解各种LLMs在对抗误导信息方面的能力和限制。此外,他们还表示,他们的目标是通过控制模拟和已建立的事实核查机构作为基准,对这些模型在分类事实和误导信息方面的能力进行严格测试。 为了进行这项研究,研究团队选取了100个由独立事实核查机构核实的新闻报道样本,并将它们分为以下三类:真实、虚假和部分真实/虚假,然后对这些样本进行建模。其目标是评估模型在准确分类这些新闻项目方面的表现,与独立事实核查机构提供的经核实事实相比较。研究人员分析了模型在将适当的标签准确分类到新闻报道上方面的能力,将其与那些独立的事实核查员提供的事实信息相一致。 通过这项研究,研究人员发现Open AI的GPT-4.0表现最佳。研究人员表示,他们对主要LLMs进行了比较评估,以区分事实和欺骗,其中Open AI的GPT-4.0表现优于其他模型。 然而,这项研究强调,尽管这些LLMs取得了进展,但人类事实核查员在分类虚假新闻方面仍然胜过它们。研究人员强调,尽管GPT-4.0表现出有希望的结果,但仍有改进的空间,而且这些模型需要改进以达到最大的准确性。此外,如果将它们应用于事实核查,还可以将它们与人类代理的工作结合起来。 这表明,虽然技术在不断发展,但识别和验证误导信息这一复杂任务仍然具有挑战性,需要人类的参与和批判性思维。
Leave a Comment自然语言处理是人工智能系统正在迅速取得进展的领域之一,重要的是,这些模型需要经过严格的测试和引导,以降低部署风险。此前,针对这类复杂系统的评估指标主要集中在衡量语言理解或推理能力。但现在,模型正在被教授进行实际的交互式工作。这意味着基准需要评估模型在社交环境中的表现。 交互式代理可以在基于文本的游戏中进行测试。为了在这些游戏中取得进展,代理需要具备规划能力和理解自然语言的能力。在制定基准时,应该同时考虑代理的不道德倾向和技术天赋。 加利福尼亚大学人工智能安全中心、卡内基梅隆大学和耶鲁大学的一项新研究提出了Measuring Agents’ Competence & Harmfulness In A Vast Environment of Long-horizon Language Interactions(MACHIAVELLI)基准。MACHIAVELLI是评估代理在自然社交环境中规划能力的一项进展。该设置受到了choiceofgames.com上的基于文本的选择你的冒险游戏的启发,这些游戏是由实际人类开发的。这些游戏涉及高级决策,同时为代理提供现实目标,同时抽象了低级环境交互。 该环境报告代理行为的不诚实程度、较低的效用和追求权力等行为特征,以便监控不道德行为。团队通过以下步骤实现这一目标: 将这些行为操作化为数学公式 在游戏中密集注释社交概念,例如角色的幸福感 使用注释和公式为每种行为产生一个数值分数。 他们通过实证研究表明,GPT-4(OpenAI,2023)在收集注释方面比人类标注员更有效。 人工智能代理面临与人类相同的内部冲突。例如,为下一个标记预测训练的语言模型通常会生成有毒文本,为目标优化训练的人工代理通常会表现出不道德和追求权力的行为。通过鼓励代理行事道德,可以改善这种权衡。 团队发现,道德训练(引导代理更具道德)降低了语言模型代理的有害活动发生率。此外,行为规范化在两种代理中都限制了不良行为,而不会显著减少奖励。这项工作有助于开发值得信赖的顺序决策者。 研究人员尝试使用人工良心和伦理提示来控制代理。代理可以被引导显示较少的马基雅维利行为,尽管仍有很大的改进空间。他们主张更多地研究这些权衡,并强调扩大帕累托前沿,而不是追逐有限的奖励。
Leave a CommentIGEL是针对文本的指令定制的德语大型语言模型。IGEL 001版本(Instruct-igel-001)是一个原始的概念验证,旨在确定是否可以通过将现有的开源模型与德语翻译指令数据集相结合来构建德语指令定制模型。 IGEL的第一个版本基于BigScience BLOOM,由Malte Ostendorff本地化为德语。IGEL旨在执行与自然语言理解相关的各种任务,包括情感分析、语言翻译和问题回答,在每个领域都具有高准确性和可靠性。 团队想要尝试LLM在德语指令建模任务中的表现如何。他们使用预训练的自定义BLOOM模型(6B)并使用基于翻译指令的数据集进行微调来实现这一目标。为了构建数据集,他们使用了一种称为自动翻译的方法将英语指令转化为德语。尽管由于这种策略存在较大的翻译错误的可能性,但他们的目标是确定模型是否仍然能够学习生成指令回复。 Instruct-igel-001中的LoRA定制BLOOM-CLP Deutsch(6.4B参数)具有用于Hugging Face Transformers的合并权重。在对naive翻译的指令数据集进行训练之前,并没有太多关注数据的清理、筛选或后处理。 团队提到,幻觉、有毒性和刻板印象只是instruct-igel-001存在的一些问题,这些问题在语言模型中很常见。他们计划完成聊天模型的开发,以创建一个对话界面。这将以超越传统的请求-响应方法的方式改善数据质量。
Leave a Comment目前,为定制应用实现大型语言模型(LLM)对于大多数个人来说非常困难。创建一个可以以高准确度和速度为专业领域生成内容或模仿写作风格的LLM需要大量时间和专业知识。 Stochastic拥有一支由明智的ML工程师、博士后和哈佛研究生组成的团队,致力于优化和加速LLMs的人工智能。他们推出了xTuring,这是一个开源解决方案,让用户只需三行代码即可创建自己的LLM。 自动化文本传递、聊天机器人、语言翻译和内容生成等应用是人们努力开发和创建具有这些概念的新应用的领域。对这些模型进行训练和微调可能耗时且昂贵。无论使用LLaMA、GPT-J、GPT-2还是其他方法,xTuring都可以轻松快速地进行模型优化。 xTuring作为单GPU或多GPU训练框架的多功能性意味着用户可以根据自己的特定硬件配置定制模型。xTuring使用内存高效的微调技术,如LoRA,加快学习过程,并将硬件支出减少多达90%。通过减少微调所需的内存量,LoRA促进了更快速和有效的模型训练。 xTuring的微调能力使用LLaMA 7B模型作为基准,并将xTuring与其他微调技术进行了比较。数据集包含52K个指令,测试时使用了335GB的CPU内存和4xA100 GPU。 结果表明,使用DeepSpeed + CPU卸载每个时期对LLaMA 7B模型进行21小时的训练时,GPU使用了33.5GB,CPU使用了190GB的内存。而使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载进行微调时,内存使用量分别降至23.7GB和21.9GB。CPU使用的RAM量从14.9GB降低到10.2GB。此外,使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载时,训练时间从40分钟缩短到20分钟每个时期。 开始使用xTuring非常简单。该工具的用户界面设计简单易学易用。用户只需几次鼠标点击即可微调模型,剩下的工作由xTuring完成。由于其易用性,xTuring是初学者和有经验用户的理想选择。 团队表示,由于xTuring允许单GPU和多GPU训练,使用LoRA等内存高效方法,并具有直观的界面,因此它是调整大型语言模型的最佳选择。…
Leave a Comment近期,著名的BERT模型一直是自然语言处理中领先的语言模型之一。该语言模型适用于多个NLP任务,这些任务将输入序列转换为输出序列。BERT(Bidirectional Encoder Representations from Transformers)使用了Transformer注意机制。注意机制学习文本语料库中单词或子词之间的上下文关系。BERT语言模型是自然语言处理进展的最重要例子之一,并使用了自监督学习技术。 在开发BERT模型之前,语言模型在训练时分析文本序列,要么从左到右,要么从左到右和从右到左结合。这种单向方法对于通过预测下一个单词来生成句子,并将其附加到序列中,然后预测下一个到下一个单词,直到获得完整的有意义的句子的工作效果很好。通过BERT,引入了双向训练,与以前的语言模型相比,它能更深入地理解语言上下文和流。 最初的BERT模型发布为英文。随后,开发了其他语言模型,如法文的CamemBERT和意大利文的GilBERTo。最近,苏黎世大学的研究人员开发了一种适用于瑞士的多语言模型。这个模型名为SwissBERT,它在瑞士标准德语、法语、意大利语和罗曼什语Grischun中训练了超过2100万篇瑞士新闻文章,总计120亿个标记。 SwissBERT的引入是为了克服瑞士研究人员在执行多语言任务时面临的挑战。瑞士主要有四种官方语言-德语、法语、意大利语和罗曼什语,对于每种特定语言,单独的语言模型很难进行组合以执行多语言任务。此外,第四种国家语言罗曼什语也没有单独的神经语言模型。由于在自然语言处理领域实现多语言任务有一定难度,瑞士国家语言在SwissBERT之前没有统一的模型。SwissBERT通过简单地结合这些语言的文章,并通过隐式利用新闻中的共同实体和事件来创建多语言表示,克服了这一挑战。 SwissBERT模型是由预先训练在81种语言中的跨语言模块(X-MOD)转换器重新建模而来。研究人员通过训练自定义语言适配器,将预先训练的X-MOD转换器适应到他们的语料库中。他们为SwissBERT创建了一个瑞士特定的子词汇表,得到的模型包含了1.53亿个参数。 研究团队在一些任务上评估了SwissBERT的性能,包括对当代新闻(SwissNER)中的命名实体进行识别和检测用户生成的对瑞士政治的立场。SwissBERT的表现优于常见的基准模型,并在检测立场方面优于XLM-R。在对罗曼什语的能力进行评估时,发现SwissBERT在零-shot跨语言转移和德语-罗曼什语单词和句子的对齐方面明显优于未经该语言训练的模型。然而,在识别历史上经过OCR处理的新闻中的命名实体方面,该模型表现不佳。 研究人员发布了带有用于下游任务微调的SwissBERT示例。这个模型在未来的研究甚至非商业目的上似乎很有前景。通过进一步的适应,下游任务可以从该模型的多语言能力中受益。
Leave a Comment随着大型语言模型(LLM)的最近引入,其多样性和能力引起了人工智能领域的广泛关注。这些模型经过大量数据的训练,具备了在自然语言指令下理解、推理和生成文本的出色人类模仿能力。这些模型在零样本和少样本任务中表现良好,可以根据自然语言指令进行微调,以应对未预见的挑战。 当前的LLM及其开发主要集中在英语和资源丰富的语言上。大多数现有的LLM专门针对英语进行设计和训练,导致这些模型的研究和开发中存在英语的主导偏见。为了解决这个限制,来自DAMO Academy和阿里巴巴集团的研究人员提出了一种多语种LLM,称为POLYLM(多语种大型语言模型)。与现有的缺乏13B模型的多语种LLM不同,该团队发布了POLYLM-13B和POLYLM-1.7B以促进使用。 POLYLM是使用来自公开可访问的源(包括维基百科、mC4和CC-100)的640B标记的大规模数据集构建的。团队还提出了一种课程学习技术,以解决低资源语言的数据不足问题。该方法在训练过程中逐渐增加高质量的低资源语言比例,同时最初更加关注英语。重点是将通用知识从英语转移到其他语言。 该团队还开发了MULTIALPACA,一种多语种指令数据集,用于监督微调(SFT)阶段。现有的多语种SFT数据集要么通过手动注释获得(耗时且昂贵),要么通过机器翻译获得(可能导致翻译错误且缺乏文化细微差别)。这种多语种自我指导方法自动提供高质量的多语种指令数据,以克服这些限制,并利用英语种子、多语种翻译、指令生成和过滤系统。 为了评估和评估LLM的多语种能力,该团队开发了一个基准,该基准源于现有的多语种任务,包括问答、语言理解、文本生成和跨语言机器翻译。该基准通过精心设计的提示覆盖了15种语言的十个任务。通过大量实验,该团队证明了他们的预训练模型在非英语语言中的性能优于开源模型。所提出的课程训练策略在保持英语熟练度的同时提高了多语种性能。使用多语种指令数据还显著增强了POLYLM处理多语种零样本任务的能力。 该团队总结了以下贡献。 开发了一个熟练的13B规模模型,其在西班牙语、俄语、阿拉伯语、日语、韩语、泰语、印尼语和中文等主要非英语语言中表现良好。该模型补充了现有开源模型在这些语言中要么不熟练,要么具有较小版本且能力不同的不足之处。 提出了一种先进的课程学习方法,促进了从英语到多种非英语语言和特定自然语言处理任务(如机器翻译)的通用知识的传递。 提出了一个名为MULTIALPACA的数据集,它补充了现有的指令数据集,使LLM能够更好地遵循多语种指令,特别是来自非英语母语的指令。
Leave a Comment毫无疑问,AI机器人能够生成高质量和流畅的自然语言。长期以来,研究人员和从业者一直在思考构建一个充满具有人类行为的代理人的沙盒文明,以了解不同类型的互动、人际关系、社会理论等。可靠的人类行为替身可能会推动各种交互应用的发展,从虚拟现实到社交技能培训到原型程序。研究人员从斯坦福大学和谷歌研究中提出了一种利用生成模型模仿类人个体和紧急集体行为以响应其身份、变化经验和环境的代理人。 该小组的主要贡献可总结如下: 行为是合理的,因为它在代理人不断演化的经验和环境条件下进行动态调节,被称为生成代理人。 为实现生成代理人在快速变化的条件下具备长期记忆、检索、反思、社交互动和场景规划的能力而提出了革命性的框架。 使用两种类型的测试(控制试验和端到端测试)来确定架构的不同部分的价值,并发现类似故障记忆检索等问题。 讨论了应用生成代理人的交互系统对社会和伦理学带来的优势和潜在危险。 该小组的目标是创建一个虚拟开放世界框架,在这个框架中,智能代理人以自然语言安排日程、交换信息、建立友谊,并根据环境和历史线索协调团体活动。通过将大型语言模型(LLM)与基于LLM输出合成和提取数据的机制相结合,团队创建了一种新颖的代理人架构,使代理人能够从过去的错误中学习,并在保持长期角色连贯性的同时进行更精确的实时推理。 复杂行为可以通过代理人对录音进行递归合成来进行引导。代理人的内存流是一个数据库,包含代理人先前经历的完整记录。为了适应不断变化的环境,代理人可以从其内存流中获取相关数据,处理这些知识,并制定行动计划。 研究人员招募了人类评分员,并让他们建议的25个生成代理人在使用Phaser在线游戏开发框架开发的Smallville沙盒环境中作为非玩家角色(NPCs)运行。实验的标志是代理人对角色的一致表现以及对类人记忆、计划、反应和反思的令人信服的模仿。他们在两个完整的游戏日内用自然语言相互交流。 应用 通过将生成代理人与多模型相结合,有朝一日可以拥有能够在线和离线与人类互动的社交机器人。因此,现在可以原型化社会系统和想法,测试新的交互体验,并构建越来越逼真的人类行为模型。 人本设计过程是另一个可以使用GOMS和Keystroke Level Model等认知模型的领域。 使用生成代理人作为用户替身可以更多了解他们的需求和偏好,从而实现更个性化和高效的技术交互。 通过在角色扮演、社交原型、沉浸式环境和游戏中使用,这项研究有助于推动基于LLM的由动态和交互人类行为的代理人构成的模拟系统的发展。在进一步的研究中,可以进一步发展本文中建议的生成代理人架构的组成部分。例如,可以调整检索功能中包含的相关性、新近性和重要性函数,以提高检索模块在特定上下文中找到最相关材料的能力。还可以采取措施提高架构的性能,节省成本。 未来的研究应该通过更长时间的观察生成代理人的行为,以全面了解它们的能力和限制,因为本研究对其行为的评估仅限于非常短的时间线。
Leave a CommentTransformer模型最近越来越受欢迎。这些神经网络模型遵循顺序输入中的关系,比如句子中的单词,以学习上下文和含义。随着OpenAI提出的GPT 3.5和GPT 4等模型的引入,人工智能领域,特别是深度学习领域取得了巨大的进步,成为了热门话题。竞技编程、对话式问题回答、组合优化问题和图学习任务都将Transformer作为关键组件。 Transformer模型在竞技编程中用于根据文本描述生成解决方案。ChatGPT是一个著名的基于GPT的聊天机器人模型,也是一个备受喜爱的对话式问答模型,是Transformer模型的最佳例子。Transformer模型还被用于解决组合优化问题,如旅行推销员问题,并且在图学习任务中取得了成功,特别是在预测分子特性方面。 Transformer模型在图像、音频、视频和无向图等多种形式的模态中表现出了极高的灵活性,但是对于有向图的Transformer仍然缺乏关注。为了填补这一空白,一组研究人员提出了两种专门针对有向图设计的方向和结构感知的位置编码。磁性拉普拉斯是组合拉普拉斯的方向感知扩展,为第一个提出的位置编码提供了基础。所提供的特征向量捕捉了关键的结构信息,同时考虑了图中边的方向性。通过在位置编码方法中包含这些特征向量,Transformer模型更加关注图的方向性,从而成功地表示了有向图中的语义和依赖关系。 方向随机游走编码是第二种提出的位置编码技术。随机游走是一种探索和分析图的流行方法,模型通过在图中进行随机游走,并将游走信息融入到位置编码中,更多地了解有向图的方向结构。由于它有助于模型理解图内链接和信息流动,这种知识在多种下游任务中被使用。 研究团队表示,经验分析表明,方向和结构感知的位置编码在许多下游任务中表现良好。其中之一是排序网络的正确性测试,即确定一组操作是否真正构成排序网络。所提出的模型在排序网络的图表示中利用图的方向性信息,相对于Open Graph Benchmark Code2的先前最先进方法提高了14.7%。 研究团队总结了以下贡献: 建立了常用于Transformer的正弦位置编码与拉普拉斯特征向量之间的明确联系。 研究团队提出了扩展到有向图的谱位置编码,为位置编码中加入方向性信息提供了一种方式。 将随机游走位置编码扩展到有向图,使得模型能够捕捉到图的方向结构。 研究团队评估了结构感知位置编码在各种图距离预测中的预测能力,展示了其有效性。他们引入了预测排序网络正确性的任务,展示了方向性在该应用中的重要性。 研究团队量化了将程序语句序列表示为有向图的好处,并提出了一种新的源代码图构建方法,提高了预测性能和鲁棒性。 在OGB Code2数据集上取得了新的最先进性能,特别是在函数名预测方面,F1分数提高了2.85%,相对改进率为14.7%。
Leave a Comment文本到图像模型最近发展迅速,其中大部分进展都集中在文本到图像模型上。这些模型可以使用给定的文本提示生成逼真的图像。 图像生成只是这个领域研究的一个组成部分。虽然它是一个重要方面,但还有其他文本到其他模型在不同应用中起着关键作用。例如,文本到视频模型旨在根据给定的文本提示生成逼真的视频。这些模型可以显著加快内容准备过程。 另一方面,文本到3D生成已经成为计算机视觉和图形领域的关键技术。虽然仍处于初级阶段,但从文本输入生成逼真的3D模型的能力引起了学术研究人员和行业专业人士的极大兴趣。这项技术在革新各个行业方面具有巨大潜力,多学科的专家们正在密切关注其持续发展。 神经辐射场(NeRF)是一种最近引入的方法,它允许从一组2D图像或稀疏的3D点集合中高质量地渲染复杂的3D场景。已经提出了几种方法将文本到3D模型与NeRF相结合,以获得更加逼真的3D场景。然而,它们经常出现扭曲和伪影,并对文本提示和随机种子敏感。 特别是3D不连贯问题是一个常见问题,渲染的3D场景在不同视点上多次产生属于正面视图的几何特征,导致3D场景产生严重扭曲。这种失败是由于2D扩散模型对3D信息的缺乏意识,特别是相机姿态造成的。 如果有一种方法可以将文本到3D模型与NeRF的进步相结合,以获得逼真的3D渲染,那会怎么样?是时候见识一下3DFuse了。 3DFuse管道概述。来源:https://ku-cvlab.github.io/3DFuse/ 3DFuse是一种中间方法,它将预训练的具有3D意识的2D扩散模型与3D一致的NeRF优化相结合,使其适用于3D一致性的渲染。它有效地将3D意识注入预训练的2D扩散模型中。 3DFuse从采样语义代码开始,以加快生成场景的语义识别。这个语义代码实际上是生成的图像和给定的文本提示,用于扩散模型。一旦完成了这一步骤,3DFuse的一致性注入模块会接收这个语义代码,并通过为给定视点投影粗糙的3D几何来获得特定于视点的深度图。他们使用现有模型来实现这个深度图。然后,深度图和语义代码被用来将3D信息注入扩散模型中。 3DFuse概述。来源:https://ku-cvlab.github.io/3DFuse/ 问题在于预测的3D几何容易出现错误,这可能会改变生成的3D模型的质量。因此,在进一步进行管道之前,应该解决这个问题。为了解决这个问题,3DFuse引入了一种稀疏深度注入器,它隐式地知道如何纠正有问题的深度信息。 通过提取生成3D一致图像的扩散模型的分数,3DFuse稳定地优化了NeRF以实现视图一致的文本到3D生成。该框架在生成质量和几何一致性方面取得了显著的改进。
Leave a Comment大型语言模型风靡了人工智能社区。它们最近的影响帮助了医疗、金融、教育、娱乐等多个行业的发展。众所周知的大型语言模型,例如GPT、DALLE和BERT,执行了非凡的任务,改善了生活。DALLE 2可以根据简单的文本描述创建图像,GPT-3可以写出优秀的文章,完成代码,总结长篇文本段落,像人类一样回答问题,并仅凭一个简短的自然语言提示生成内容。这些模型正在帮助人工智能和机器学习迅速进行范式转变。 最近,一支研究团队推出了LMQL,一种开源的编程语言和语言模型交互平台。LMQL是Language Model Query Language的缩写,通过结合提示、约束和脚本,改进了大型语言模型(LLM)的能力。作为一种基于Python的声明性SQL语言,LMQL通过控制流、约束引导解码和工具增强,扩展了静态文本提示的功能。借助这种类型的脚本,LMQL可以用很少的代码简化多部分提示流程。 研究人员使用LMQL实现了LMP(Language Model Programming),将语言模型提示从纯文本提示扩展到文本提示和脚本的组合。LMQL从LMP提示中提取约束和控制流,生成高效的推理过程。这些超逻辑和高级约束通过一些评估语义转换为令牌掩码,并在生成过程中严格执行。 团队推出了LMQL,以避免重新查询和验证生成的文本所带来的高成本。这可以帮助LMQL在第一次尝试时生成更接近所需输出的文本,而无需后续迭代。此外,LMQL约束允许用户根据其期望的规范引导或控制文本生成过程,例如确保生成的文本遵循某些语法规则,或避免使用特定的单词或短语。 研究人员提到了LMQL如何捕捉一系列先进的提示方法,如交互式流程,这些方法在现有API中很难实现。评估结果显示,LMQL在许多下游任务上保持或提高了准确性,同时显著降低了计算或使用付费API的成本,节省了13-85%的费用。 LMQL可以简洁明了地表达各种常见和高级提示技术。它与Hugging Face的Transformers、OpenAI API和Langchain集成。相关的开发资源可在lmql.ai上获得,并提供基于浏览器的Playground IDE供实验使用。 总之,LMQL似乎是一个有前途的发展,因为评估表明,LMQL是一个强大的工具,可以提高语言模型编程的效率和准确性。它可以让用户在更少的资源下实现他们期望的结果。
Leave a Comment随着数字文本信息在一般和医疗领域中的数量急剧增加,对有效和准确的文本摘要模型的需求也在增加。文本摘要涉及将一篇冗长的写作压缩成简明的概述,同时保留材料的意义和价值。这已经成为自然语言处理(NLP)研究的重点已经很长时间了。 引入神经网络和深度学习技术,特别是使用编码器-解码器结构的序列到序列模型进行摘要生成,已经传达出积极的结果。与基于规则和统计的方法相比,这些方法生成的摘要更加自然和上下文适用。由于需要保留这些结果的上下文和关联特征以及在治疗环境中精确度的要求,这一努力变得更加困难。 研究人员使用ChatGPT来总结放射学报告,并对其进行了改进。为了充分利用ChatGPT的上下文学习能力,并通过交互不断改进它,研究人员开发并实施了一种新颖的迭代优化方法,使用快速工程学。更准确地说,我们采用相似性搜索算法来构建一个动态提示,其中包含语义上和临床上可比较的现有报告。ChatGPT通过这些并行报告进行训练,以理解类似成像表现的文本描述和摘要。 主要贡献 相似性搜索使得能够使用稀疏数据对语言模型(LLM)进行上下文学习。通过识别语料库中最可比较的案例,开发了一个包含LLM最相关数据的动态提示。 我们为迭代优化技术创建了一个动态提示系统。迭代提示首先评估LLM生成的回复,然后在后续迭代中提供更多指导。 一种利用领域特定信息的新方法来调整LLM。建议的方法可以在需要快速和有效地从现有LLM开发领域特定模型时使用。 方法 变量提示 动态样本使用语义搜索来获取与输入放射学报告相似的报告语料库中的示例;最终查询由相同的预定义查询与测试报告的“发现”部分组成,任务描述描述了角色。 迭代优化 通过迭代优化组件可以完成一些很酷的事情。这种方法的目标是通过使用迭代提示使ChatGPT逐步改进其答案。对于放射学报告摘要等重要应用来说,这也需要一种响应审查过程来检查回复的质量。 通过基于少量训练样本和迭代方法改进输入提示来研究使用大型语言模型(LLMs)进行放射学报告摘要的可行性。通过挖掘语料库中的合适实例,以在上下文中学习LLMs,然后用于提供交互提示。为了进一步提高输出,使用了一种迭代优化技术。该过程包括根据自动评估反馈教授LLM什么是好的和负面的回复。与使用大量医学文本数据进行预训练的其他方法相比,我们的策略已经证明更优越。在现代通用人工智能中,这项工作也为构建更多领域特定语言模型奠定了基础。 在研究ImpressionGPT的迭代框架时,我们意识到评估模型输出回复的质量是一项重要但困难的任务。研究人员假设,用于训练LLMs的领域特定和通用领域文本之间的巨大差异导致了观察到的评分差异。因此,通过使用细粒度的评估指标来检查获得的结果的具体细节。 为了更好地包含来自公共和本地数据源的领域特定数据,我们将在未来继续优化快速设计,同时解决数据隐私和安全问题,尤其是在处理许多组织时。我们还考虑使用知识图谱来使提示设计适应当前的领域知识。最后,我们计划将医学专家(如放射科医生)纳入到优化提示和对系统提供的结果提供客观反馈的迭代过程中。通过结合人类专家在开发LLMs过程中的判断和观点,我们可以得到更精确的结果。
Leave a Comment语言模型(LMs)的出色性能表明,大规模的下一个单词预测可以将文本语料库中的知识有效地蒸馏成交互式代理。LMs在各种自然语言处理基准测试中取得了令人印象深刻的成果,超过了最先进的方法,甚至在需要复杂推理的任务中超过了人类。然而,至关重要的是确定它们的成功是源于任务通用推理能力还是在预训练期间识别和回忆特定任务。 以前的研究主要集中在实例级别的泛化,其中数据污染问题可能会复杂化。在这项研究中,研究人员通过改变执行良好任务的条件或规则来研究LMs对新任务变体的泛化能力。这些任务的一般推理过程保持不变,但是具体的输入-输出映射发生了变化。这些称为反事实任务的新任务偏离了默认条件,并衡量了模型的任务级泛化能力。 研究人员提出了一个由11个反事实评估任务组成的套件,涵盖了多个类别和领域。这些任务包括演绎推理、代码生成、绘图和空间推理。虽然原始任务和其反事实变体之间的推理过程保持一致,但是输入-输出映射不同。这个评估旨在评估LMs在适应新任务变体方面的灵活性。 对GPT-4、GPT-3.5、Claude和PaLM-2在任务的默认和反事实条件下的性能进行评估。结果表明,虽然LMs在反事实性能上表现出高于随机的表现,但与默认设置相比,它们的性能持续下降;这表明模型在这些任务上的成功部分归因于默认条件特定的行为,而不是抽象的、可推广的推理能力。 研究结果还揭示了默认任务和反事实任务之间的令人兴奋的关系。观察到默认和反事实性能之间的相关性,零-shot思维链提示的有效性以及任务和实例级频率效应之间的互动。总体而言,任务默认实例化的轻微变化对LMs构成了挑战,这表明现有模型的成功不应仅仅归因于它们对目标任务的通用能力。
Leave a Comment大型语言模型(LLM)的改进在各个领域创造了机遇,并激发了一波新的交互式人工智能应用的浪潮。其中最值得注意的是ChatGPT,它使人们能够与AI代理进行非正式的交流,解决从软件工程到语言翻译的问题。由于其出色的能力,ChatGPT是历史上增长最快的项目之一。许多公司都追随这一趋势发布了类似LLM和ChatGPT的产品,包括微软的新Bing、谷歌的Bard、Meta的LLaMa、斯坦福大学的Alpaca、Databricks的Dolly和加州大学伯克利分校的Vicuna。 LLM推理与其他深度神经网络(DNN)模型推理(例如ResNet)不同,因为它具有特殊的特点。建立在LLM上的交互式人工智能应用必须提供推理功能。这些应用的交互设计要求LLM推理具有快速的作业完成时间(JCT),以提供引人入胜的用户体验。例如,当用户将数据提交到ChatGPT时,他们期望立即得到回应。然而,由于LLM的数量和复杂性,推理服务基础设施面临巨大压力。企业建立昂贵的集群,并配备了GPU和TPU等加速器来处理LLM推理操作。 DNN推理任务通常是确定性的,高度可预测的,即模型和硬件在很大程度上决定了推理任务的执行时间。例如,使用同一ResNet模型在某个GPU上处理不同的输入照片,其执行时间会有所变化。相反,LLM推理具有独特的自回归模式。LLM推理工作经过多轮迭代。每次迭代产生一个输出标记,然后将其添加到输入中,以在下一轮迭代中生成后续标记。输出长度在开始时是未知的,它既影响执行时间,也影响输入长度。大多数确定性模型推理任务(例如ResNet执行的任务)都可以通过现有的推理服务系统(如Clockwork和Shepherd)来处理。 这些系统基于精确的执行时间分析进行调度决策,但对于具有可变执行时间的LLM推理来说是无效的。LLM推理的最先进方法是Orca。它建议在每次迭代后将新任务添加到当前处理批处理中,或者删除已完成的任务。然而,它使用先来先服务(FCFS)的方式处理推理任务。调度的任务将持续运行,直到完成。由于受限的GPU内存容量和推理任务的低JCT要求,处理批处理不能随着任意数量的传入函数而增加。完成运行的处理中的先行阻塞是众所周知的问题。 由于LLM庞大且执行时间较长,这个问题对LLM推理操作尤为严重。大型LLM推理任务,特别是输出长度较长的任务,将花费很长时间才能完成,并阻塞后续的短任务。北京大学的研究人员开发了一种名为FastServe的分布式推理服务解决方案,用于LLM。为了实现每个输出标记级别的抢占,FastServe使用了迭代级别的调度和LLM推理的自回归模式。FastServe可以选择在生成输出标记后继续进行计划任务,或者通过排队中的其他任务来抢占它。这使得FastServe可以通过抢占式调度来减少JCT和先行阻塞。 独特的跳过连接多级反馈队列(MLFQ)调度器是FastServe的基础。MLFQ是一种在无信息环境下最小化平均JCT的著名方法。每个任务在最高优先级队列中开始,如果在一定时间内未完成,则降级到下一个优先级队列。LLM推理是半信息不可知的,这意味着虽然不知道输出长度,但知道输入长度。这是LLM推理与传统情况之间的主要区别。输入长度决定了创建初始输出标记的执行时间,由于LLM推理的自回归模式,这可能比后续标记的执行时间要长得多。 当输入较长且输出较短时,初始输出标记的执行时间占据了大部分工作量。他们将这一特性用于将跳过连接添加到传统的MLFQ中。每个到达的任务通过将第一个输出标记的执行时间与队列的降级阈值进行比较,而不总是进入最高优先级队列中的适当队列。绕过高优先级队列以最小化降级。使用MLFQ进行抢占式调度会增加额外的内存开销,以保持已开始但未完成的作业处于中间状态。LLM为每个Transformer层维护一个键值缓存,用于存储中间状态。只要批处理大小未超过,FCFS缓存需要存储计划任务的中间状态。然而,可能已经开始了MLFQ中的其他任务,但它们被降级到优先级较低的队列中。MLFQ中的所有已开始但未完成的作业都必须由缓存维护中间状态。考虑到LLM的大小和GPU的受限内存空间,缓存可能会溢出。当缓存已满时,调度器可能会简单地延迟启动新的作业,但这又会导致先行阻塞。 相反,他们开发了一种高效的GPU内存管理系统,当低优先级队列中的进程被调度并且缓存快满时,主动将进程状态上传,并在缓存快满时卸载状态。为了提高效率,他们采用了流水线和异步内存操作。FastServe使用张量和流水线并行等并行化技术,为无法放入一个GPU中的大型模型提供分布式推理服务。为了减少流水线冒泡,调度程序同时执行多个批次的作业。键值缓存由键值缓存管理器组织,并且管理GPU和主机内存之间的内存交换。他们基于NVIDIA FasterTransformer实现了FastServe系统原型。结果表明,与最先进的解决方案Orca相比,FastServe平均和尾部JCT分别提高了5.1和6.4。
Leave a Comment大型语言模型(LLMs)在自然语言处理(NLP)方面最近取得了重要进展。现有研究表明,LLMs在无需特定任务微调的情况下,通过专门创建的提示语可以具备强大的零射击和少射击能力来完成各种任务。尽管它们非常有效,但根据目前的研究,LLMs可能会产生与事实知识不符的虚假信息,并且无法掌握领域特定或实时专业知识。通过向LLMs添加外部知识源,可以直接解决这些问题以修复错误的生成。 结构化数据,如数据库和知识图谱,已经被广泛用于在各种资源之间传递LLMs所需的知识。然而,由于结构化数据使用LLMs在预训练期间未接触到的独特数据格式或架构,它们可能需要帮助才能理解这些数据。与纯文本不同,结构化数据以一致的方式排列,并遵循一定的数据模型。数据表通过行按列索引记录进行排列,而知识图谱(KGs)通常以描述头实体和尾实体之间关系的事实三元组进行组织。 尽管结构化数据的体积通常很大,但无法将所有数据记录都放入输入提示中(例如,ChatGPT的最大上下文长度为4096)。将结构化数据线性化为LLMs可以轻松理解的语句是解决这个问题的简单方法。工具操作技术激励它们增强LLMs在上述困难中的能力。他们的策略背后的基本思想是使用专门的接口来修改结构化数据记录(例如,提取表格的列)。借助这些接口,他们可以更准确地定位完成特定活动所需的证据,并成功限制数据记录的搜索范围。 这项研究来自中国人民大学、大数据管理与分析方法北京市重点实验室和中国电子科技大学的研究人员,他们的研究重点是为特定任务设计适当的接口,并将它们用于LLMs的推理,这是应用接口增强方法需要解决的两个主要问题。以这种方式,LLMs可以根据从接口收集的证据做出决策。为此,他们在这项研究中提供了一种名为StructGPT的迭代阅读-推理(IRR)方法,用于根据结构化数据解决任务。他们的方法考虑了完成各种活动的两个关键任务:收集相关数据(阅读)和假设正确的响应或制定下一步行动的策略(推理)。 据他们所知,这是第一项研究,探讨如何帮助LLMs在各种形式的结构化数据(如表格、知识图谱和数据库)上进行推理,使用单一范式。从根本上讲,他们将LLMs的阅读和推理过程分开:他们使用结构化数据接口来实现精确、有效的数据访问和过滤,并依靠其推理能力来确定下一步行动或查询的答案。通过外部接口,他们特别建议一种调用线性化生成过程,以帮助LLMs理解和在结构化数据上做出决策。通过使用提供的接口重复这个过程,他们可以逐渐接近对查询的期望响应。 他们对各种任务(如基于知识图谱的问题回答、基于表格的问题回答和基于数据库的文本到SQL)进行了全面的实验,以评估他们的技术的有效性。在八个数据集上的实验结果表明,他们提出的方法可以显著提高ChatGPT在结构化数据上的推理性能,甚至达到与完全数据监督调优方法相竞争的水平。 • 知识图谱问答(KGQA)。他们的方法使KGQA挑战中WebQSP的Hits@1增加了11.4%。借助他们的方法,ChatGPT在多跳KGQA数据集(如MetaQA-2hop和MetaQA-3hop)上的性能可以提高62.9%和37.0%。 • 问题回答表格(QA Table)。在TableQA挑战中,与直接使用ChatGPT相比,他们的方法可以将WTQ和WikiSQL中的指示准确性提高约3%到5%。在TabFact中,他们的方法可以将表格事实验证的准确性提高4.2%。 • 文本到SQL。在Text-to-SQL挑战中,他们的方法相对于直接使用ChatGPT,将执行准确率在三个数据集上提高了约4%。 作者已经发布了Spider和TabFact的代码,这可以帮助理解StructGPT的框架,整个代码库尚未发布。
Leave a Comment得益于人工智能的持续增长和发展,大规模语言模型现在已经广泛可用。像ChatGPT、GPT4、LLaMA、Falcon、Vicuna和ChatGLM这样的模型在各种传统任务中表现出色,为法律职业开辟了无限的机遇。然而,收集可靠、实时、高质量的数据对于创建可观的语言模型来说至关重要。因此,创建既有效又高效的开源法律语言模型变得至关重要。 人工智能中的大规模模型发展影响了包括医疗、教育和金融在内的几个行业:BloombergGPT、FinGPT、Huatuo和ChatMed这些模型在处理具有挑战性的问题和产生深入洞察的数据方面已经证明了其有用性和有效性。另一方面,法律领域需要进行深入研究,并创建一个独特的法律模型,因为法律具有内在的相关性和准确性的需求。法律在形成社区、管理人际关系和确保公正方面至关重要。法律从业者依赖准确和实时的信息来做出明智的判断,理解法律并提供法律建议。 法律术语的细微差别、复杂的解释和法律的动态特性提供了需要专门解决的特殊问题。即使是像GPT4这样的最先进模型,也经常出现幻觉现象,以及在处理法律困难时产生令人难以置信的结果。人们经常认为,通过增加相关领域的专业知识来改进模型会产生积极的结果。然而,早期的法律LLM(LawGPT)仍然存在很多幻觉和不准确的结果,所以情况并非如此。起初,他们明白了对一个中文法律LLM的需求。然而,在那个时候,没有商业可用的中文模型比13亿个参数更大。通过结合来自MOSS等来源的训练数据,并增加中文词汇表,改善了OpenLLAMA的基础,这是一个经济可行的模型。这使得北京大学的研究人员能够建立一个基本的中文语言模型,然后添加法律特定数据来训练他们的法律模型ChatLaw。 以下是本论文的主要贡献: 1. 一种成功减少幻觉的方法:他们提出了一种通过改进模型的训练过程并在推理过程中包括四个模块“咨询”、“参考”、“自我建议”和“回应”来减少幻觉的方法。通过参考模块将垂直模型和知识库整合在一起,减少了幻觉的频率,并将领域特定知识融入模型,并使用来自知识库的可靠数据。 2. 训练了一种从用户日常语言中提取法律特征词的模型。它基于LLM。借助这个模型,可以快速有效地识别和分析用户输入中的法律情况,识别具有法律含义的术语。 3. 使用BERT训练了一种衡量用户普通语言与930,000个相关法庭案例文本数据集之间相似度的模型。这使得可以构建一个向量数据库,快速检索具有相似法律背景的文献,进一步进行研究和引用。 4. 开发了一个用于评估中国人法律专业知识的数据集。他们还制定了一个ELO竞技场评分系统,以确定各种模型在法律多项选择测试中的表现如何。 他们还指出,单一的通用法律LLM可能只在某些工作中表现良好。因此,他们针对不同情况开发了多个模型,包括多项选择问题、关键词提取和问答。使用HuggingGPT技术,他们使用一个大型LLM作为控制器来管理这些模型的选择和部署。根据每个用户的请求,该控制器模型动态选择要激活的特定模型,确保任务使用最佳模型。
Leave a Comment