近来,由于其强大的文本生成和理解能力,大型语言模型(LLMs)引起了人们的广泛关注。这些模型具有显著的交互能力,并且通过进一步将指令与用户意图对齐,有潜力作为智能助手来提高生产力。然而,原生的大型语言模型仅限于纯文本领域,无法处理其他广泛使用的模态,如图片、音频和视频,严重限制了模型的应用范围。为了克服这一限制,研究人员开发了一系列大型视觉语言模型(LVLMs),以提高大型语言模型对视觉信息的识别和理解能力。 这些扩展的视觉语言模型在解决实际的视觉中心问题方面显示出了巨大的潜力。阿里巴巴集团的研究人员推出了开源的Qwen系列最新成员——Qwen-VL系列模型,以促进多模态开源社区的发展。Qwen-VL系列的大规模视觉语言模型有两种类型:Qwen-VL和Qwen-VL-Chat。预训练模型Qwen-VL将视觉编码器与Qwen-7B语言模型连接起来,提供了视觉能力。在完成三个训练阶段后,Qwen-VL可以在多个层次的尺度上感知和理解视觉信息。此外,Qwen-VL-Chat是基于Qwen-VL的交互式视觉语言模型,使用对齐方法,提供更灵活的交互方式,如多张图片输入、多轮讨论和定位能力。如图1所示。 图1:Qwen-VL-Chat生成的一些定性样本如图1所示。Qwen-VL-Chat支持多张图片输入、轮流对话、多语言对话和定位能力。 该模型的特点包括: • 强大的性能:在多个评估基准测试中,包括零样本字幕生成、视觉问答、文档问答和定位等,它在相同模型层次上远远超过当前开源的大型视觉语言模型(LVLM)。 • 多语言LVLM促进中英文双语文本和图像实例的端到端识别和对齐:Qwen-VL自然支持英文、中文和多语言对话。 • 多图像交错对话:这个功能可以比较多张图片,对图片提出问题,并参与多图像叙事。 • 准确的识别和理解:与竞争的开源LVLM当前采用的224×224分辨率相比,448×448分辨率有助于精细的文本识别、文档质量保证和边界框识别。
Leave a CommentTag: Tech News
自主代理代表展示不同程度独立的自我运作系统。最近的研究突出了大型语言模型(LLMs)模仿人类智能的显著能力,这是通过广泛的训练数据集和大量的模型参数组合实现的。本研究论文对利用LLMs的自主代理的架构、构建技术、评估方法和挑战进行了全面的研究。 https://arxiv.org/abs/2308.11432v1 LLMs已被广泛应用于自主代理的核心协调器,旨在复制人类决策过程并增强人工智能系统。上述图像展示了基于LLMs的自主代理领域的增长趋势。值得注意的是,第三个点之后X轴从年份切换到月份。从本质上讲,这些基于LLMs的代理正在从被动的语言系统转变为具有推理能力的主动目标导向代理。 基于LLMs的自主代理构建 为了有效展示类似人类的能力,需要注意两个重要方面: 架构设计: 选择最合适的架构对于最大程度地发挥LLMs的能力至关重要。现有研究已经进行了系统综合,形成了一个全面统一的框架。 学习参数优化: 为了提高架构的性能,出现了三种广泛采用的策略: 从例子中学习: 这种方法涉及使用精心策划的数据集对模型进行微调。 从环境反馈中学习: 利用实时互动和观察来提高模型的能力。 从人类反馈中学习: 利用人类专业知识和干预来改进模型的响应。 基于LLMs的自主代理应用 基于LLMs的自主代理在各个领域的应用标志着我们在问题解决、决策制定和创新方面的根本转变。这些代理具备语言理解、推理和适应性,通过提供无与伦比的见解、支持和解决方案产生深远影响。本节主要探讨了基于LLMs的自主代理在社会科学、自然科学和工程领域的变革效果。 基于LLMs的自主代理评估 为了评估基于LLMs的自主代理的有效性,引入了两种评估策略: 主观评估和客观评估。 主观评估: 某些潜在属性,如代理的智能和用户友好性,无法通过定量指标来衡量。因此,主观评估对当前的研究至关重要。 客观评估: 与人类评估相比,利用客观评估具有诸多优势。定量指标有助于在各种方法之间进行直接比较,并监测随时间推移的进展。进行广泛的自动化测试的可行性使得可以评估大量任务,而不仅仅是少数任务。 最后,虽然之前的工作已经展示了许多有希望的方向,但这个领域仍处于初级阶段,存在许多挑战,包括角色扮演能力、广义人类对齐、提示鲁棒性等。总之,本调查研究为我们提供了关于基于LLMs的自主代理的一切知识,并对此进行了系统总结。
Leave a Comment在科学探索中,一个引人入胜的谜题等待着解决——蛋白质复杂而多样的结构。这些分子工作马在生物过程中起着关键作用,以令人着迷和神秘的方式发挥着影响力。然而,由于当前分析方法的局限性,解读蛋白质复杂的三维(3D)结构长期以来一直是一个挑战。在这个复杂的谜题中,一个研究努力展开,旨在利用几何神经网络的潜力来理解这些大分子的复杂形态。 揭示蛋白质结构的现有方法是一段艰辛的旅程。这些结构存在于指导其生物功能的三维领域中,使其捕捉成为一项艰巨的任务。传统方法面临着需要更多结构数据的需求,通常在我们的理解中留下了空白。与此同时,另一条探索之路蓬勃发展——蛋白质语言模型。这些模型以氨基酸的线性一维(1D)序列为基础,展现出在各种应用中的卓越能力。然而,它们在理解蛋白质复杂的3D性质方面的局限性促使了一种创新方法的诞生。 https://www.nature.com/articles/s42003-023-05133-1 研究的突破在于将这两个看似不相关的领域融合起来:几何神经网络和蛋白质语言模型。这种巧妙而简洁的方法旨在将几何网络注入到语言模型所获得的见解中。挑战在于弥合1D序列理解和复杂的3D结构理解之间的差距。解决方案是寻求经过良好训练的蛋白质语言模型的帮助,例如著名的ESM-2,以解读蛋白质序列中的微妙之处。这些模型解开了序列的密码,产生了包含重要信息的每个残基表示。这些表示是与序列相关的见解的宝库,它们被融入到先进的几何神经网络的输入特征中。通过这种结合,网络被赋予了理解3D蛋白质结构复杂性的能力,同时又从嵌入在1D序列中的庞大知识库中汲取养分。 所提出的方法通过组织1D序列分析和3D结构理解的两个重要步骤,实现了和谐地融合。旅程从蛋白质序列开始,它们进入蛋白质语言模型的领域。在这个领域中,ESM-2是一座灯塔,它解读了氨基酸序列的神秘语言,产生了每个残基的表示。这些表示类似于拼图碎片,捕捉了序列的复杂性的本质。这些碎片无缝地编织到先进的几何神经网络的结构中,丰富了它们的输入特征。这种共生的融合赋予了网络超越3D结构分析的能力,踏上一段旅程,无缝地融入1D序列中嵌入的智慧。 在科学进步的历史中,几何神经网络和蛋白质语言模型的结合呼唤着一个新时代。这项研究旅程应对了蛋白质结构分析所带来的挑战,提供了超越当前方法局限性的新颖解决方案。随着序列和结构的融合,机遇的全景展现。所提出的方法作为1D序列和3D结构世界之间的桥梁,不仅丰富了蛋白质结构分析,还有望揭示分子生物学更深层次的奥秘。通过这种融合,一个变革性的叙事开始形成,全面的蛋白质分析成为一个灯塔,照亮了以前未知的理解领域。
Leave a Comment使用语言模型和检索模型可以轻松解决各种复杂任务。语言模型(如GPT-3)旨在根据接收到的输入生成类似人类的文本。另一方面,检索模型用于从数据库或文档集合中检索相关信息。明确定义要解决的任务,确定任务是否需要生成新文本还是从现有资源中检索数据。 使用GPT-3或类似模型,需要提供描述任务的提示,并让模型基于此生成文本。需要通过实验提示的措辞和结构来获得所需的输出。它涉及将语言模型生成的文本与从数据库中检索到的信息相结合。这可能包括根据检索到的信息生成摘要或洞察。 斯坦福大学的研究人员构建了一个用于使用语言模型(LM)和检索模型(RM)解决高级任务的框架。他们称之为DSPy。 DSPy包含了各种用于提示和微调LM以及改进它们的推理和检索增强的技术。 DSPy基于Pythonic语法,提供了可组合和声明性的模块,用于指导LM的操作。 DSPy还有一个自动编译器,用于训练LM以运行程序中的声明性步骤。这个编译器可以在没有手动中间阶段标签的情况下,从最少的数据中进行微调。它使用可训练的模块化组件的系统空间,而不是字符串操作。 DSPy使用两个简单的概念“签名”和“电视台”来编译您编写的任何程序。签名是DSPy模块的输入/输出行为的声明性规范。相比之下,电视台是功能强大的优化器(包含在DSPy中),它可以学会为任何程序的模块选择有效的提示。 签名包括对子任务的最小描述以及将向LM提问的一个或多个输入问题。它还解释了我们期望从LM获得的问题的答案。电视台是远程自动提示。他们说,与其他方法相比,DSPy需要非常少的标记。它将引导任何需要支持用户流水线的中间标签,其中包括多个复杂步骤。 由于DSPy框架与其他库有很大的区别,因此很容易根据我们的用例来解释何时使用它。研究人员表示,这个统一的框架对于NLP / AI研究人员或正在探索新的流水线或新任务以解决高级和复杂问题的人来说非常有用。为了使它适用于每个人,他们发布了安装用户手册。他们还表示,未来将发布各种入门教程和演示以及参考资料。
Leave a CommentHugging Face Transformer是Python中非常受欢迎的库,为各种自然语言处理任务提供了非常有用的预训练模型。它以前只支持PyTorch,但现在也支持Tensorflow。Nous-Hermes-Llama2-70b是NLP语言模型,使用了数十万条指令。该模型使用与旧的Hermes模型相同的数据集,以确保在训练模型时没有严重的广泛变化,并且过程变得更加顺利。该模型仍然存在一些缺陷,如较低的幻觉率和缺乏OpenAI审查。 模型训练是在大型数据集上完成的,这些数据集在处理的数据量和样式方面非常高。数据来自不同的来源,并合并为一个数据集,从而在处理的数据集中获得了多样的知识。数据集收集了来自Teknium、Karan4D、Emozilla、Huemin Art和Pygmalion AI等不同来源的数据。模型使用了Alpaca模型进行训练。研究团队对来自自我指导评估数据集的输入进行了人工评估,以评估Alpaca。研究人员收集了这个评估集,并包含了几乎涵盖了所有内容的多样化用户指令的列表。 研究人员还表示,Prompt工程师也将受益于这个已执行的模型。研究人员相信,发布上述资产将使学术界能够对指令跟踪语言模型进行控制科学研究,并最终导致解决该模型中存在的现有缺陷的新技术的出现。部署Alpaca的交互式演示还存在潜在风险,例如更广泛地传播有害内容并降低垃圾邮件的机会。NLP中的垃圾邮件检测技术在这个模型中也起着重要的作用。研究人员了解到,一旦发布模型权重或用户训练其指令跟踪模型,这些缓解措施就可以得到实现。 该项目的未来计划还包括迭代高质量数据并应用技术来去除低质量数据。研究人员还需要对Alpaca进行更严格的评估。他们还将从HELM模型开始,希望能够捕捉更多生成信息。研究人员还希望研究Alpaca的风险,并努力进一步提高其安全性。
Leave a CommentChatGPT – GPT-4 GPT-4是OpenAI的最新LLM,比其前身更有创造力、准确性和安全性。它还具有多模态能力,即它能够处理图像、PDF、CSV等。通过引入代码解释器,GPT-4现在可以运行自己的代码,以避免幻觉并提供准确的答案。 Bing AI Bing AI由OpenAI的GPT-4模型提供动力,可以遍历网络提供准确的答案。它还具有根据用户提示生成图像的能力。 GitHub Copilot GitHub Copilot是一个AI代码补全工具,它分析代码并提供即时反馈和相关的代码建议。 DALL-E 2 DALL-E 2是OpenAI开发的文本到图像生成工具,它根据用户的提示创建原始图像。它被设计为拒绝不适当的用户请求。 Cohere Generate Cohere Generate利用AI的潜力来增强业务运营。它为电子邮件、落地页、产品描述和其他各种需求提供个性化内容。 AlphaCode AlphaCode由DeepMind开发,能够以竞争水平编写计算机程序。 Adobe Firefly Firefly是一款以提示为图像输出准确性而闻名的图像生成和编辑工具。它包括各种图像修改功能,包括内容类型、颜色、色调、光照和构图工具。…
Leave a Comment自2009年成立以来,大型强子对撞机(LHC)一直是科学探索的先锋工具,旨在揭示超越标准模型边界的粒子和现象。然而,寻找新物理的传统方法涉及复杂的计算机模拟,将观测到的碰撞数据与标准模型和其他理论模型的预测相匹配。这些方法受到预定义模型和模拟的限制,可能忽视不符合这些模型的意外现象。为了解决这个限制,研究人员转向无监督机器学习,以检测碰撞数据中可能表示新物理现象的异常。 目前,寻找新物理涉及模拟,模拟已知粒子的行为,根据已建立的模型。将准确的碰撞数据与这些模拟进行比较,有助于识别可能暗示新现象的偏差。另一种方法是寻找标准模型背景的微小变化,这表明存在新的过程。然而,这些方法受到所测试模型固有假设的限制。 ATLAS的一项新研究提出了一种用于分析LHC碰撞数据的新框架。这个框架利用无监督机器学习技术,特别是一种复杂的神经网络,称为自编码器。与现有方法不同,这种方法不受模型和预设期望的限制。 引入的框架涉及对实际LHC碰撞数据进行复杂神经网络的训练。这个由许多相互连接的“神经元”组成的网络被称为自编码器。训练过程涉及压缩输入数据,然后在比较初始输入和输出时进行解压缩。通过这种比较,自编码器可以识别“典型”的碰撞事件并将其滤除,留下偏离正常的事件-称为“异常”。异常表示神经网络在识别模式时遇到困难,暗示着可能存在新的物理现象。为了评估这些异常,研究人员分析碰撞中粒子的不变质量,并评估它们是否可以归因于标准模型过程。 通过识别和表征异常事件,可以衡量这种方法的成功。自编码器检测到的异常事件被仔细检查,以确定它们与新的物理现象的潜在联系。输入和输出数据之间的重建差异越大,事件与标准模型之外的新物理相关的可能性越大。 总之,尽管传统的LHC寻找新物理的方法有效,但受到对预定义模型和模拟的依赖的限制。研究人员提出的新方法通过自编码器引入了无监督机器学习,实现了对碰撞数据的无模型分析。这个框架有潜力揭示逃脱传统方法的意外现象。通过关注自编码器检测到的异常,科学家可以揭示超出我们对宇宙当前理解的粒子和相互作用的奥秘。
Leave a Comment包括绘画、产品设计和动画在内的行业正在受到3D图像合成及相关技术的显著影响。虽然诸如神经辐射场(NeRF)之类的新型3D图像合成方法使得能够大规模生成3D内容成为可能,但由于这些方法使得对物体的形态和颜色进行精确和局部修改变得困难,因此这些方法难以被广泛采用。尽管最近进行了几次3D物体编辑的尝试,但对3D物体进行更局部和精细的操作仍然需要改进和降低成本。这在特定风格的特定物品的添加或删除方面尤为如此。虽然Text2Mesh和TANGO只允许对整个3D物体进行基本纹理和浅层形状的改变,但早期的尝试,如EditNeRF和NeRFEditing,只提供了受限制的、不灵活的编辑可能性。 虽然CLIP-NeRF提出了一种具有解耦条件NeRF的生成技术来进行对象编辑,但只在本地编辑对象的所需部分是具有挑战性的。它需要大量的训练数据来进行预期的编辑类别。它们还提供了一种不同的方法来修改物品的外观,但不是形态:对每个场景进行单个NeRF的微调,以实现以CLIP为驱动的目标。为了通过任何文本提示在规模上实现对3D物体的有效和实际的局部编辑,需要对物体的特定区域进行风格修改,例如选择性地改变颜色,局部添加和删除密度,如图1所示。 图1显示了我们基于文本驱动的局部对象操作策略的结果。基本物体是推土机,每次修改都使用调整颜色、增加密度和减少密度的方法进行。 在这篇论文中,LG电子和首尔国立大学的作者提出了一种先进的局部对象编辑技术,它可以使用文本提示来修改3D物体,提供完整的风格化和基于密度的局部编辑。他们认为,为了完全风格化形状和颜色,仅依赖于一个单一NeRF的简单微调来生成接近低初始密度附近的新密度或通过CLIP驱动目标来修改现有密度是不够的。相反,他们采用了一种方法,将原始的3D物体表示与参数化的隐式3D体积表示子集相结合,然后使用经过训练的可编辑的NeRF架构来自然地生成混合图像。他们使用类似CLIPSeg的预训练视觉语言方法来检测文本输入过程中需要修改的区域。所提出的方法基于一种称为Blending-NeRF的新颖分层NeRF架构,它包括预训练的NeRF和可编辑的NeRF。 在某些情况下,可以使用多个NeRF同时训练来重建一个动态场景的静态和动态元素。然而,他们的方法添加了一个额外的NeRF,以便在预训练的静态场景的特定区域进行基于文本的更改。这些更改包括多个编辑过程,包括颜色调整、密度增加和密度减少。它们可以通过结合两个NeRF的密度和颜色,对3D物体进行精细的局部化修改。 他们提供了创新的Blending-NeRF架构,通过使用多种目标和训练方法将预训练的NeRF与可编辑的NeRF混合起来。 这是他们的贡献概述: • 使用这种方法,可以直观地修改一些3D物体,同时保持其原始外观。 • 他们添加了新的混合技术,用于衡量密度增加、密度减少和颜色修改的程度。他们的方法使得可以精确地定位特定区域进行局部编辑,并由于这些混合过程限制了对象修改的范围。 • 他们进行了多个测试,涉及文本引导的3D物体编辑,例如修改形状和颜色。他们将自己的方法与早期方法及其直接扩展进行了比较,证明了混合-NeRF在质量和数量上都更优秀。
Leave a Comment大型语言模型(LLMs)因其在各种任务上的出色表现而受到了大量关注。它们的开发方式使它们经常在一些情况下超过监督模型甚至人类。尽管它们的能力令人惊叹,但先前的研究表明,某些功能约束可能会影响它们在实际世界中的实用性。这些模型对提示语言的细微差别、少量示范以及这些示范的组织的敏感性构成了一个重要的性能问题。这种敏感性阻碍了对LLMs能力的客观评估。 在Megagon Labs的最新研究中,一组研究人员对LLMs在处理多项选择题中的鲁棒性进行了研究,这是一种用于测试其推理和事实检索能力的流行任务。调查的主要焦点是LLMs对多项选择测试中选项重新排列的响应。经过深入研究后发现,当选项被改变时,跨多个基准测试的性能差异明显,范围从大约13%到75%不等。 经过深入分析后提出了一个假设,即当LLMs在对预测的前2或前3个选项不确定时,观察到的敏感性会发生。由于问题措辞带来的位置偏见,一些选项的顺序可能有利于这些前选项中的某些预测。在前两个选项中可以看到强调或减弱模型对某些选项放置的倾向的有趣模式。 为了突出偏见,团队采用了一种最佳策略,即将前两个列表中的第一个和最后一个替代方案放在一起以强调偏见。另一方面,为了抵抗偏见,建议将这些选择分散在周围的选项中。进行了一系列研究来验证假设的敏感性。此外,还使用了两种不同的校准技术来改进LLMs的预测。在多个模型和基准测试中看到了高达8个百分点的性能提升,这带来了显着改进。 该研究提出了一些问题,包括敏感性的程度,即LLMs在MCQs选项顺序方面受到多大程度的影响,导致LLMs敏感性的因素以及如何增强LLMs对选项顺序的鲁棒性。使用GPT-4和InstructGPT在五个不同的MCQ基准测试上进行了实验证明第一个问题。在零样本情况下发现了高达75%的敏感性差距。关于第二个问题,数据表明位置偏见是导致LLMs敏感性的原因,因为当LLMs不确定最佳选项时,它们倾向于偏好特定的放置方式。为了回答最后一个问题,研究表明使用两种不同的校准技术可以将LLMs的性能提高高达8个百分点。 总之,这项研究强调了面对LLMs对提示方面和排列方式的敏感性的必要性。通过研究LLMs在多项选择题中对选项重新排序的细微差别,它揭示了LLMs的决策过程,这肯定可以提高LLMs在实际情况下的可用性和可靠性。
Leave a Comment假设您希望构建一个自然语言处理(NLP)模型来解决一个给定的问题。您需要定义任务范围,然后找到或创建能够指定预期系统行为的数据,选择适合的模型架构,训练模型,通过评估来评估其性能,然后将其部署供实际使用。研究人员已经通过一行代码使得原型化这种复杂的NLP模型成为可能! https://arxiv.org/abs/2308.12261 Prompt2Model是一个系统,它保留了使用简单提示指定系统行为的能力,并同时提供了一个可部署的特殊目的模型,保留了所有其优点。上图展示了我们Prompt2Model的工作架构。它实际上是一个自动化的流水线,从用户提示中提取关于任务的所有必要细节,然后收集和组合与任务相关的信息,并使用以下不同的通道进行部署。 数据集检索:给定一个提示,第一个任务是发现现有的手动注释数据,以支持用户的任务描述。 数据集生成:为了支持各种任务,存在一个数据集生成器,根据Prompt解析器解析的用户特定要求生成合成训练数据。Prompt解析器包含具有上下文学习的LLM,用于分段用户提示,使用OpenAI的gpt-3.5-turbo-0613。 模型检索:使用提供的提示,选择一个预训练的语言模型,该模型具有适合用户目标的知识。这个选择的模型作为学生模型,进一步进行微调和评估,使用生成的和检索到的数据。 WebApp:最后,存在一个易于使用的图形用户界面,允许下游用户与训练好的模型进行交互。这个使用Gradio构建的Web应用程序可以轻松地在服务器上公开部署。 总之,Prompt2Model是一个快速构建小而有竞争力的NLP系统的工具。它可以直接用于在几小时内产生优于LLM的任务特定模型,无需手动数据注释或架构。鉴于该模型的可扩展设计,它可以提供一个平台,用于探索模型蒸馏、数据集生成、合成评估、数据集检索和模型检索等新技术。 展望未来,我们可以将Prompt2Model视为促进协作创新的催化剂。通过提出不同的挑战,研究人员旨在在未来在框架的各个组件上促进多样化的实现和改进。
Leave a Comment由于大型语言模型(LLMs)的进步,美国的律师和行政人员正在重新评估法律职业。根据其支持者的说法,LLMs可能会改变律师处理短文写作和公司合规等工作的方式。它们可能最终通过提高法律服务的可及性来解决美国长期存在的司法准入困境。这一观点受到了LLMs具有使它们更适合法律工作的独特特性的影响。与手动数据注释相关的支出,这些支出通常增加了法律语言模型的创建成本,将会因模型能够从少量标记数据中学习新工作而减少。 它们也非常适合进行法律的严格研究,包括解读带有大量术语的复杂文本和进行整合多种思维方式的推理过程。然而,法律应用程序经常涉及高风险,这种热情受到了一定程度的抑制。研究表明,LLMs可能会产生冒犯性、欺骗性和事实错误的信息。如果这些行为在法律环境中重复发生,可能会造成严重的损害,历史上受压迫和资源匮乏的人承受了不成比例的压力。因此,由于安全影响,迫切需要建立法律环境下衡量LLMs的基础设施和程序。 然而,希望判断LLMs是否能够运用法律推理的实践者面临着重重障碍。第一个障碍是法律基准的生态系统很小。例如,大多数现有的基准都集中在模型通过调整或训练特定任务数据来学习的任务上。这些标准无法捕捉到激发对法律实践兴趣的LLMs的特征,特别是它们只需简短提示即可完成各种任务的能力。类似地,基准倡议主要集中在专业认证考试(如统一律师资格考试)上,尽管它们并不总是反映LLMs的实际应用。第二个问题是律师和现有标准对“法律推理”的定义之间存在差异。 目前使用的基准广泛将需要法律信息或法律作为评估“法律推理”的工作进行分类。相反,律师们知道“法律推理”这个词是广泛的,包括各种形式的推理。不同的法律责任需要不同的能力和知识体系。由于现有的法律标准需要识别这些差异,因此对法律从业者来说,将当代LLMs的表现置于他们对法律能力的认知中是具有挑战性的。法律行业不使用与法律标准相同的术语或概念框架。鉴于这些限制,他们认为为了严格评估LLMs的法律推理能力,法律界需要更多地参与基准设计过程。 为此,他们介绍了LEGALBENCH,这是创建一个英文跨学科协作法律推理基准的初始阶段。过去一年,这项研究的作者们共同努力构建了162个任务(来自36个不同的数据源),每个任务都测试了特定形式的法律推理。他们借鉴了各自的法律和计算机科学背景。据他们所知,LEGALBENCH是第一个开源的法律基准项目。这种基准设计方法,即专家积极参与并积极参与评估任务的开发,是LLM研究中一种多学科合作的典范。他们还主张,这表明法律从业者在评估和推进法律中的LLMs中必须发挥的关键作用。 他们强调LEGALBENCH作为研究项目的三个方面: 1. LEGALBENCH是使用预先存在的针对少量样本LLM范式进行重新格式化的法律数据集的组合构建的,并且还包括由法律专家生成和提供的手动制作的数据集,这些法律专家也被列为本文的作者。参与此合作的法律专家被邀请提供测试有趣的法律推理能力或在法律中具有实际价值应用的数据集。因此,在LEGALBENCH任务上的良好表现提供了相关数据,律师可以用来确认对LLM法律能力的意见,或者找到能够提高工作流程效率的LLM。 2. LEGALBENCH上的任务被分为详细的分类,概述了完成任务所需的法律推理类型。由于该分类法借鉴了法律界常见的框架,并使用他们已经熟悉的词汇和概念框架,法律专业人员可以积极参与LLM性能的讨论。 3. 最后,LEGALBENCH的设计旨在作为更多研究的平台。对于没有法律培训的人工智能研究人员来说,LEGALBENCH在了解如何促进和评估各种活动方面提供了实质性的帮助。他们还打算通过不断征求和包括法律从业者的工作来扩大LEGALBENCH,因为法律界与LLMs的潜在影响和功能的互动越来越多。 他们在本文中做出了如下贡献: 1. 他们提供了一种根据必要的证明来分类和描述法律义务的分类法。这种分类法基于律师用来解释法律推理的框架。 2. 接下来,他们概述了LEGALBENCH中的活动,概述了它们是如何创建的,重要的异质性维度和约束条件。在附录中,对每个任务都进行了详细的描述。 3. 为了分析来自11个不同家族的20个LLMs在不同规模点上的情况,他们使用LEGALBENCH作为最后一步。他们对几种提示工程策略进行了初步调查,并对各种模型的有效性做出了评价。 这些研究结果最终揭示了LEGALBENCH可能有助于的几个潜在研究课题。他们预计各种社区都会对这个基准感到有趣。从业人员可以使用这些活动来决定是否以及如何将LLMs纳入当前流程以提高客户结果。LLMs能够进行的各种类型的注释以及它们允许的各种类型的实证学术工作可能会引起法学界的兴趣。在法律这样一个特殊的词汇特征和挑战性任务可能会揭示新的见解的领域中,这些模型的成功可能会引起计算机科学家的兴趣。 在继续之前,他们澄清了这项工作的目标不是评估计算技术是否应该取代律师和法律人员,也不是理解这种替代的利弊。相反,他们希望创建工具来帮助受影响的社区和相关利益相关者更好地理解LLMs在某些法律责任上的表现。鉴于这些技术的普及,他们认为解决这个问题对于确保计算法律工具的安全和道德使用至关重要。
Leave a Comment人工智能在语音和面部识别方面起着至关重要的作用。这些来自面部和语音的信号通过脑信号进行记录和合成,从而实现了对人工智能的广泛应用。该技术还可以将这些信号编码和解码为文本,速度更快,使系统更加强大。这些语音和面部识别技术属于自然语言处理的广泛范畴。研究人员仍在寻找能够为瘫痪患者实现语音和面部识别的人工智能。 加州大学旧金山分校和加州大学伯克利分校的研究人员开发了一种脑机接口。也称为智能大脑,它是大脑电脉冲和外部设备之间的直接通信路径,最可能是机器人或人工智能聊天机器人。它已经显示出像瘫痪的女性甚至可以与数字化的化身进行交流的结果。这些研究人员的目标是嵌入一个强大的沟通身体,这是与他人进行最自然的交流方式。人工智能为那些患有瘫痪或无法说话的患者提供了解决方案。研究人员在女性的表面上实施了矩形形状的电极,这对于语音识别至关重要。这些电极实现了大脑信号或脉冲沿她的身体传播,使其识别对她来说更容易。研究人员训练了模型并改进了系统使用的人工智能算法,提高了系统的准确性。这还涉及多次迭代不同短语,并在系统中使用自然语言处理的词袋模型。研究人员还训练了人工智能模型,使其能够识别和编码这些单词到音素。这提高了系统的准确性,并使其比以前更快。 研究人员开发了一种算法,使用女性婚礼上录制的声音生成她的声音。声音有一些缺陷,但后来研究人员致力于改善以前生成的声音的质量。这些研究人员还开发了数字化化身,帮助女性进行面部识别。研究人员还创建了一个机器学习模型,可以将化身与女性的脑信号融合在一起。它记录了她的下颚、嘴唇、舌头、口腔和其他每个器官的每个动作。 研究人员仍在为人体和软件之间的无线连接进行这个设置的工作。这将成为该模型的下一个版本的主要优势是非直接接触。各种深度学习算法仍在这个无线模型上进行研究和开发。超参数测试被进行以提高模型的效率。
Leave a CommentDeepSwap DeepSwap是一款基于人工智能的工具,适用于任何想要创作逼真换脸视频和图片的人。通过替换视频、图片、梗图、老电影、GIF等内容,您可以轻松创建自己的内容。该应用没有内容限制,用户可以上传任何类型的素材。此外,首次订阅该产品的用户可享受50%的折扣。 Aragon 使用Aragon,轻松获得令人惊叹的专业头像。利用最新的人工智能技术,快速创建高质量的个人头像!省去预约摄影工作室或穿着正装的麻烦。快速编辑和修饰您的照片,不用等上几天。获得40张高清照片,助您在下一个工作中脱颖而出。 AdCreative.ai 通过AdCreative.ai提升您的广告和社交媒体效果-这是终极的人工智能解决方案。告别数小时的创意工作,迎接几秒钟内生成的高转化广告和社交媒体帖子。立即使用AdCreative.ai,最大化您的成功,最小化您的努力。 Hostinger AI网站构建器 Hostinger利用先进的人工智能引擎为所有网站所有者打造最佳的AI网站构建器。构建器将指导您完成设计过程,为您的需求提供布局、配色方案和内容位置建议。在保持对各种设备的响应式设计的同时,拥抱自由定制每一个细节。 Otter AI Otter.AI利用人工智能技术,为用户提供实时会议笔记的转录,这些笔记可以共享、搜索、访问和保护。获得一个会议助手,可以记录音频、撰写笔记、自动捕捉幻灯片并生成摘要。 Notion Notion通过利用先进的人工智能技术,旨在扩大其用户群。他们的最新功能Notion AI是一个强大的生成式AI工具,可以帮助用户进行笔记总结、识别会议中的行动项,并创建和修改文本。Notion AI通过自动化繁琐的任务、提供建议和模板,简化和改善用户体验,从而简化工作流程。 Codium AI 为繁忙的开发人员生成有意义的测试。使用CodiumAI,您可以在IDE内部获得非平凡的测试建议(也可以是平凡的!),这样您就可以在推送时进行智能编码、创造更多价值并保持信心。借助CodiumAI,开发人员可以更快、更自信地进行创新,节省他们用于测试和分析代码的时间。代码就像您想的那样。 Docktopus AI Docktopus是一款由人工智能驱动的演示工具,通过100多个可定制模板简化在线内容创建,让用户能够在几秒钟内创建专业的演示文稿。 SaneBox 人工智能是未来,但在SaneBox,人工智能已经成功地为过去12年的电子邮件提供动力,每周为普通用户节省超过3小时的时间。 Promptpal…
Leave a Comment在不断发展的软件开发领域中,对高效和高产的编码工具的需求变得日益迫切。开发人员面临着编写强大、有良好文档的代码以及在调试和代码完成的复杂性中航行的挑战。随着代码库变得越来越复杂,解决这些挑战的创新解决方案变得至关重要。传统的编码工具和方法虽然有用,但有时可能无法满足现代软件开发的需求。 现有的编码工具和框架为程序员提供了宝贵的支持,从提供代码建议和完成的集成开发环境(IDE)到基于代码的语言模型(LM),可以根据提示生成代码片段。然而,这些工具在准确性、效率和全面性方面通常存在限制。现代编码任务的复杂性需要更先进的方法,能够理解自然语言指令和复杂的代码逻辑。 请见Code Llama,Meta AI在生成式AI编码方面的突破性进展。通过在代码特定数据集上进一步训练最先进的Llama 2模型开发,Code Llama弥合了自然语言指令和复杂代码生成之间的鸿沟。具有提高生产力和提供编码协助的潜力,Code Llama成为各技能水平开发人员的创世者。 Code Llama是一个多功能工具,具有满足不同编码需求的多个功能。它可以生成代码片段,并提供关于代码的自然语言解释,协助完成代码和帮助调试任务。支持Python、C++、Java等流行的编程语言,Code Llama针对各种编码场景进行了量身定制。 Code Llama的一个突出特点是其能够处理更长的输入序列,使开发人员能够提供更多来自其代码库的上下文。这导致更相关和准确的代码生成,特别适用于在大型代码库中调试复杂问题。 为了评估Code Llama的效果,进行了广泛的基准测试,使用了流行的编码挑战。Code Llama的性能与开源的基于代码的语言模型以及其前身Llama 2进行了比较。结果令人印象深刻,Code Llama的34B版本在HumanEval和Mostly Basic Python Programming (MBPP)等编码基准测试中取得了高分。这些分数超过了现有解决方案,并展示了它在广泛认可的AI模型中的竞争优势。 在编码工具领域,Code Llama以其变革性的工具而脱颖而出,它有潜力重塑开发人员处理任务的方式。通过提供开放和社区驱动的方法,Code Llama鼓励创新并倡导负责任和安全的AI开发实践。…
Leave a CommentLLM已经改变了语言处理(NLP)的思考方式,但其评估问题仍然存在。旧的标准最终变得无关紧要,因为LLM可以使用语言数据以人类水平(OpenAI,2023)进行NLU和NLG。 针对像闭书问答(QA)为基础的知识测试、以人为中心的标准化考试、多轮对话、推理和安全评估等领域的新基准的迫切需求,NLP社区提出了新的评估任务和涵盖各种技能的数据集。 然而,这些更新的标准仍然存在以下问题: 任务格式对可评估的能力施加了限制。大多数这些活动使用单轮QA风格,使其不能充分评估LLM的全面性。 操纵基准很简单。在确定模型的有效性时,测试集不被以任何方式破坏至关重要。然而,由于已经训练了如此多的LLM信息,测试用例与训练数据混合的可能性越来越大。 开放型QA目前可用的度量标准是主观的。传统的开放式QA评估包括客观和主观的人工评分。在LLM时代,基于文本段匹配的度量已不再相关。 研究人员目前正在使用基于良好对齐的LLM(如GPT4)的自动评分器来降低人工评分的高成本。虽然LLM对某些特征有偏见,但该方法的最大问题是无法分析超过GPT4级别的模型。 由PTA Studio、宾夕法尼亚州立大学、北京航空航天大学、中山大学、浙江大学和华东师范大学最近进行的研究提出了AgentSims,这是一种用于为LLM策划评估任务的架构,它具有交互式、视觉吸引力和基于编程的特点。AgentSims的主要目标是通过消除研究人员在编程水平差异上可能面临的障碍来促进任务设计过程。 LLM领域的研究人员可以利用AgentSims的可扩展性和可组合性来研究组合多个计划、记忆和学习系统的效果。AgentSims的用户友好界面用于地图生成和代理管理,使其对行为经济学和社会心理学等各个学科的专家都易于使用。这样的用户友好设计对LLM行业的持续增长和发展至关重要。 研究论文称AgentSims比当前的LLM基准更好,当前的基准只测试少数技能,并使用容易解释的测试数据和标准。社会科学家和其他非技术用户可以通过图形界面的菜单和拖放功能快速创建环境和设计任务。通过修改代码的抽象代理、规划、记忆和工具使用类,AI专业人员和开发人员可以尝试各种LLM支持系统。目标驱动的评估可以确定任务的成功率。总之,AgentSims通过基于明确目标的各种社会模拟来促进跨学科社区发展健壮的LLM基准。
Leave a Comment神经辐射场(NeRFs)因其能够创建准确而直观的可视化而越来越受欢迎。这导致了改变图像的NeRFs的想法。去噪扩散模型也能够从文本描述中产生出色的图像,并因其有效性而在图像编辑中流行起来。尽管扩散式图片编辑技术有着很大的潜力,但目前还明显缺乏一种自动化的方法来识别需要修改的区域。目前使用的方法要么依赖于用户提供的掩码,要么以嘈杂输入中找到的全局信息作为起点,要么依赖于输入数据来确定去噪过程的进行方式。 然而,这些方法通常有过度编辑的倾向。即使是NeRF编辑的IN2N应用程序也会遇到过度场景编辑的问题。与IP2P类似,DiffEdit使用由字幕引导的噪声预测来定位编辑区域,尽管这种方法较慢且效率较低。一组研究人员提出了一种独特的方法,可以根据特定的文本指令识别和定位图像中需要更改的精确区域。这种方法被称为Watch Your Steps,它支持通过文本指令进行本地图像和场景编辑。 该团队通过利用InstructPix2Pix (IP2P)的能力,揭示了IP2P在有指令和无指令情况下所做预测的关键区别。这种差异被称为相关性图。相关性图基本上充当了一张路线图,说明更改特定像素的重要性以达到所需的修改。它作为进行更改的指南,确保只更改必要的像素,而保留不必要的像素。 该团队还表示,相关性图不仅对基本图像编辑有用,而且在3D场景的文本引导修改方面,尤其是由神经辐射场建模的场景,它们甚至提高了准确性。为此,利用与不同训练视图相关的相关性图,训练了一个相关性场。通过这个相关性场有效地定义了应该改变的3D区域,因此,该过程涉及从建立的相关性场中渲染相关性图,以指导迭代地更新训练视图。 在评估中,发现这种方法在神经辐射场(NeRF)编辑作业以及图像编辑方面取得了无与伦比的性能水平。这展示了这种方法在克服图像和场景处理中遇到的困难方面的价值和优秀性。
Leave a CommentAI系统有意识的可能性是当前热门话题。顶尖研究人员从与人类意识相关的大脑过程中获得灵感,以提升AI的能力。AI的进展惊人迅速。同时,开发能够准确模仿人类语音的AI系统可能会增加用户对有意识的AI系统的感知。他们在这项研究中主张,评估AI的意识最好的方法是参考神经科学对意识的理论。他们讨论了这类已知的理论,并研究了它们对AI的影响。 他们认为以下是他们在这份报告中的主要贡献: 1. 证明评估AI的意识在科学上是可行的,因为意识可以科学地进行研究,而且这项研究的结果适用于AI。 2. 他们提供了初步证据,表明许多指标性质可以使用当前技术在AI系统中实现,尽管目前没有系统被认为是意识的强有力候选者。 3. 以科学理论为基础,概述了评估AI中的意识的评分表。他们预期随着研究的进展,他们将包括的指标特征清单可能会发生变化,因此提供的评分表是初步的。 他们使用了三个基本原则来研究AI中的意识。作为工作假设,他们首先接受了计算功能主义的理论,该理论认为适当的计算既是理解的必要条件,也是充分条件。尽管有争议,但这一观点是现代哲学思考的支柱。出于实用原因,他们采纳了这一理论,因为与其他观点不同,它意味着AI的意识在理论上是可行的,研究AI系统的内部运作对于确定AI系统是否有可能有意识是重要的。这意味着思考计算功能主义对AI意识的影响是有用的。其次,他们认为基于神经科学的意识理论具有实证的有效性,并可用于评估人工智能中的意识。 计算功能主义暗示在AI中,类似的功能可能足以实现意识。这些理论试图找到在人类中既是必要条件又是充分条件的意识功能。第三,他们认为在AI中研究意识的最佳策略是理论为基础的策略。这意味着确定AI系统是否执行与科学理论中与意识相关的任务,并根据以下因素评估这些理论的可信度: 功能的相似性。 支持理论的证据的强度。 对计算功能主义的信念。 与此策略相比,评估行为意识的替代方法是进行行为测试。然而,由于AI系统可以被训练以模仿人类行为而在运作方式上有所不同,因此这种策略可能更可靠。 在这个背景下,他们不支持任何特定的理论,因为在意识科学中有几个假设是活跃的竞争者。相反,他们从对意识理论的研究中收集了一份指标清单。每个指标质量都是意识所必需的,并且一些子集是足够的,这是几个理论声称的。然而,他们认为,如果AI系统具有更多的指标特征,它们更有可能是有意识的。人们应该评估当前或计划中的AI系统是否具备或将具备这些特征,以确定它是否是意识的严肃竞争者。他们讨论了几个科学理论,如计算的高阶理论、全局工作空间理论和循环处理理论。由于集成信息理论与计算功能主义不兼容,他们不予考虑。 此外,他们还考虑了代理和具身化作为指标的概念。然而,重要的是要理解它们所暗示的计算方面。他们讨论了Perceiver架构和基于Transformer的大型语言模型,并根据全局工作空间的思想对其进行评估。他们还研究了一种通过管理虚拟鼠标身体来完成任务的系统(名为PaLM-E,即“具身化多模态语言模型”)和DeepMind的自适应代理(一种在3D虚拟环境中工作的强化学习代理)。他们使用这三个系统作为案例研究,以展示与代理和具身化相关的指标特征。 查看预印本论文。这项研究的所有荣誉归功于该项目的研究人员。此外,不要忘记加入我们的29k+ ML SubReddit、40k+ Facebook社区、Discord频道和电子邮件通讯,在那里我们分享最新的AI研究动态、有趣的AI项目等等。 Hostinger AI 网站构建器:用户友好的拖放式编辑器。立即试用(赞助) 1/8 非常兴奋地宣布我们的新预印版,从神经科学领域的领先理论的角度考虑了人工智能中的意识问题。这是一个大型的跨学科合作项目,涉及哲学、神经科学和人工智能的人员!https://t.co/rLm78YNfJk…
Leave a Comment大型语言模型和扩散模型的发展为将文本到图像模型与可微分的神经三维场景表示相结合铺平了道路,其中最好的例子是DeepSDF、NeRF和DMTET。这些模型使得仅通过文本描述就能够创建准确的三维模型成为可能。尽管这些进展在人工智能社区中取得了巨大的进步,但就形状和纹理而言,生成的对象或角色经常无法产生出优质逼真的三维头像。这些角色也可能无法适应传统的计算机图形工作流程。 最近的研究中,一个研究团队引入了一种名为TADA(Text to Animatable Digital Avatars)的简单而强大的方法,将口语描述转换为具有引人注目的几何形状和逼真纹理的表情丰富的三维头像。这些头像可以使用传统的图形方法进行动画处理,并且视觉上非常令人愉悦。现有的从文本生成角色的技术在几何和纹理质量方面存在问题。这些技术在动画方面有困难,因为在几何和纹理方面存在不匹配,尤其是在面部。TADA通过在2D扩散模型和参数化身体模型之间形成强大的协同作用来解决这些问题。 创建复杂头像表示对于TADA的发明至关重要。该团队在SMPL-X身体模型上添加了一个位移层和纹理映射来改进它。结果,SMPL-X以高分辨率形式呈现,能够捕捉更细致的纹理和特征。引入了一种分层渲染方法和分数蒸馏采样(SDS),以从文本输入创建复杂的高质量三维头像。这种技术确保了头像的详细和全面的特征。 为了使头像的几何形状和纹理对齐,团队在整个SDS优化过程中使用了创建角色的潜在嵌入渲染的法线和RGB图片。通过实施对齐策略,解决了以前技术中存在的对位问题,尤其是在面部区域。此外,在优化过程中使用了多种表情,以保持角色的面部表情和语义的一致性。这种方法确保了最终头像保持了原始SMPL-X模型的语义完整性,从而实现了逼真且有机地对齐动画。 TADA使用了一种名为Score Distillation Sampling(SDS)的技术。主要贡献如下: 具有混合网格表示的分层优化,允许高质量细节,尤其是在面部。 几何和纹理的一致对齐,使用优化过程对生成的角色进行形状变形,使用预定义的SMPL-X身体姿势和面部表情。 语义一致性和动画,确保生成的角色与SMPL-X保持语义一致,便于进行轻松准确的动画处理。 团队进行了一些定性和定量评估,评估了TADA相对于其他替代方法的优势。结果显示,TADA的能力超越了头像的制作,它实现了适合动画和渲染的大规模数字角色的构建。它还提供了文本引导编辑,为用户提供了巨大的权力和定制能力。
Leave a Comment你玩过GTA-5吗?人们对游戏中的3D图形赞叹不已。与平面上的2D图形不同,3D图形模拟深度和透视,使得视觉更加真实和沉浸。这些图形在各个领域广泛应用,包括视频游戏、电影制作、建筑可视化、医学成像、虚拟现实等等。 传统的创建3D模型的方法是通过估计输入图像的深度图,然后将其融合以创建3D模型。苹果和加州大学圣巴巴拉分校的研究人员创建了一个直接推断场景级3D几何的方法,使用了深度神经网络,不涉及传统的测试时间优化。 传统方法在深度图不匹配的区域(如透明或低纹理表面)导致几何缺失或伪影。研究人员的方法将图像映射到体素网格上,并使用3D卷积神经网络直接预测场景的截断有符号距离函数(TSDF)。 卷积神经网络(CNN)是一种专门设计用于处理和分析视觉数据(尤其是图像和视频)的人工神经网络。使用这种技术的优势在于CNN可以学习和生成平滑、一致的表面,填补低纹理或透明区域的空白。 研究人员在训练期间使用三线性插值对地面真实TSDF进行采样,以与模型的体素网格对齐。这种三线性插值采样会在训练过程中对细节添加随机噪声。为了克服这个问题,他们只考虑了在地面真实TSDF完全已知的确切点处的有监督预测,并且这种方法改善了结果10%。 体素是体素像素的缩写。它代表网格内的三维空间中的一个点,类似于像素代表二维图像中的一个点。现有的体素大小为4cm或更大,这不足以解决自然图像中可见的几何细节,并且增加体素分辨率是昂贵的。他们通过使用CNN网格特征,直接将图像特征投影到查询点来解决这个问题。 他们需要使用密集的反投影来从每个体素中的每个输入图像中进行采样。然而,这会导致反投影体积模糊,他们通过使用初始的多视角立体深度估计来解决这个问题,进一步增强了特征体积。 研究人员声称他们的方法是使网络学习细节并允许自由选择输出分辨率的关键,而无需额外的训练或3D卷积层。
Leave a Comment大型语言模型(LLMs)在人工智能领域引发了一场革命。ChatGPT的发布为LLMs时代点燃了火花,从那时起,我们见证了它们不断改进。这些模型通过大量的数据变得可能,并以其能力给我们留下了深刻的印象,从掌握语言理解到简化复杂任务。 ChatGPT的替代方案有很多,它们每天都在变得越来越好,甚至在某些任务上超越了ChatGPT。LLaMa、Claudia、Falcon等等;新的LLM模型正向ChatGPT的宝座发起冲击。 然而,毫无疑问,ChatGPT仍然是迄今为止最受欢迎的LLM。你最喜欢的基于AI的应用很有可能只是一个处理连接的ChatGPT封装器。但是,如果我们退后一步思考安全问题,它真的是私密且安全的吗?OpenAI确保保护API数据隐私是他们非常关心的事情,但他们同时面临着许多诉讼。即使他们非常努力地保护模型使用的隐私和安全性,这些模型可能过于强大而无法控制。 那么,我们如何确保在使用LLMs的同时不会出现隐私和安全问题?如何利用这些模型的能力而不损害敏感数据?让我们来认识一下PUMA。 PUMA 是一个旨在实现安全高效评估Transformer模型的框架,同时保护您数据的纯洁性。它将安全多方计算(MPC)与高效的Transformer推理相结合。 在其核心,PUMA 引入了一种新颖的技术,用于近似Transformer模型内的复杂非线性函数,如GeLU和Softmax。这些近似是为了保持准确性,同时显著提高效率。与可能牺牲性能或导致复杂部署策略的先前方法不同,PUMA的方法平衡了两个世界-确保准确结果的同时,保持了实际应用所需的效率。 PUMA 引入了三个关键实体:模型所有者、客户端和计算方。每个实体在安全推理过程中都发挥着关键作用。 模型所有者提供经过训练的Transformer模型,而客户端贡献输入数据并接收推理结果。计算方集体执行安全计算协议,确保数据和模型权重在整个过程中得到安全保护。PUMA推理过程的基本原则是保持输入数据和权重的机密性,保护涉及的实体的隐私。 安全嵌入是安全推理过程的一个基本方面,传统上涉及使用令牌标识符生成一位热向量。然而,PUMA 提出了一种与Transformer模型的标准工作流程密切相符的安全嵌入设计。这种简化的方法确保安全措施不会干扰模型的固有架构,简化了在实际应用中部署安全模型。 PUMA中使用的安全GeLU和LayerNorm协议的概述。来源:https://arxiv.org/pdf/2307.12533.pdf 此外,在安全推理中,近似复杂函数(如GeLU和Softmax)以平衡计算效率和准确性的方式是一个重大挑战。PUMA 通过设计更准确的近似方法,根据这些函数的特性进行优化,解决了这个问题。通过利用这些函数的特定特征,PUMA 显著提高了近似的精度,同时优化了运行时间和通信成本。 最后,LayerNorm作为Transformer模型中的关键操作,由于除法平方根公式,它在安全推理中带来了独特的挑战。PUMA 通过巧妙地重新定义使用安全协议的操作,确保LayerNorm的计算既安全又高效。 PUMA 最重要的特点之一是它的无缝集成。该框架可以在不需要进行重大模型架构修改的情况下,实现端到端的安全推理,这意味着您可以轻松利用预训练的Transformer模型。无论是从Hugging Face还是其他来源下载的语言模型,PUMA 都能简化操作。它与原始工作流程相一致,不需要复杂的重新训练或修改。
Leave a Comment在与大型语言模型(LLM)进行接口交互的领域中,开发人员常常面临一个共同的困境。一方面,存在复杂而臃肿的框架,而另一方面,要从零开始构建大量抽象的前景。在简单性、调试易用性和可扩展性之间取得平衡依然是一个艰巨的挑战。 构建者和与LLM相关的开发人员传统上面临着有关框架的问题。复杂和功能繁重的框架位于光谱的一端,往往导致代码混乱和难以控制。另一方面,缺乏适当的工具和抽象使得开发人员需要投入大量时间来构建他们的解决方案,从而阻碍了效率和生产力。这些缺点凸显了需要一个提供简化体验而又不牺牲功能的框架的需求。 为了直面这一挑战,Cursive框架成为一个有前景的解决方案。Cursive试图通过提升与LLM交互时的开发者体验(DX)来重新定义这一领域的格局。它的目标是使与LLM的交互过程直观、愉快,并摆脱不必要的复杂性。此外,Cursive采取了一个非常出色的步骤,确保其适用于包括浏览器、Node.js、Cloudflare Workers、Deno、Bun等各种JavaScript环境。 Cursive的核心承诺在于简化开发人员与LLM之间的交互,为他们提供清晰而愉快的体验。一个值得注意的特点是简化了向模型提问和接收答案的方法。开发人员可以轻松地进行模型查询,并通过最少的代码获得响应,提高工作流程的效率。此外,与模型保持对话线程非常简单,实现了无缝的双向交互。 Cursive还革新了在LLM上下文中调用函数的方式。传统的函数调用经常导致不连贯的代码,难以理解。然而,Cursive引入了一种函数调用方法,保持整个过程的连贯性。函数定义的创建、执行和结果检索无缝集成,提高了代码的可读性和可维护性。 Cursive的影响通过反映增强的DX和改进的开发工作流程的有形指标来衡量。减少了与模型交互所需的代码行数,直观的函数调用以及连贯的对话处理都有助于提高开发者的生产力。该框架能够估算不同模型的成本和使用情况,并处理模型之间的上下文切换,带来了以前缺乏的可靠性和可观察性。 Cursive的引入在LLM交互领域迈出了重要的一步。通过优先考虑开发者体验,该框架解决了现有的挑战,并为更高效、简化和愉快的开发流程铺平了道路。作为一种旨在改变构建者与LLM交互方式的工具,Cursive具有重新定义最佳实践、鼓励创新并提高开发领域生产力的潜力。其在各种JavaScript环境中的多样性进一步巩固了它作为一个具有颠覆性解决方案的地位。
Leave a Comment为了应对嵌入式系统上可访问机器学习(ML)工具需求的指数级增长,研究人员推出了一种创新解决方案,旨在赋予使用树莓派单板计算机的开发人员更强大的能力。新的框架MediaPipe for Raspberry Pi提供了一个基于Python的软件开发工具包(SDK),旨在促进各种ML任务的开发。这一发展在设备上ML领域中是一个重要的进步,解决了简化和高效工具的需求。 设备上机器学习的出现为开发人员带来了独特的资源限制和复杂性挑战。树莓派作为一个受欢迎的平台,无论是业余爱好者还是专业人士,都缺乏一个全面的SDK,使用户能够无缝地在项目中利用机器学习的能力。这种缺乏可访问工具的情况促使了对一个用户友好的解决方案的需求。 在MediaPipe for Raspberry Pi推出之前,开发人员常常苦于将通用的机器学习框架调整为适应树莓派设备的能力。这个过程常常很复杂,并要求对ML算法和硬件约束有深入的理解。这个挑战因为需要一个专门针对树莓派生态系统的SDK而更加严峻。 来自各个机构的研究人员站了出来,揭示了一个突破性的框架,解决了这些问题。MediaPipe for Raspberry Pi SDK是协同努力的结果,旨在简化设备上ML的开发。该框架提供了一个基于Python的接口,方便进行各种机器学习任务,包括音频分类、文本分类、手势识别等。它的推出标志着开发人员可以无缝地将机器学习整合到他们的树莓派项目中。 MediaPipe for Raspberry Pi通过提供处理嵌入式系统上机器学习实现细节的预构建组件,简化了开发过程。SDK与OpenCV和NumPy的集成进一步增强了其实用性。该框架通过提供涵盖各种应用的Python示例(如音频分类、面部关键点定位、图像分类等),使用户能够通过使用提供的Python示例启动他们的项目。此外,开发人员被鼓励使用本地存储的ML模型,以确保在树莓派设备上实现最佳性能。 虽然MediaPipe for Raspberry Pi框架承诺提升ML开发体验,但需要注意的是,它在不同的树莓派型号上的性能会有所差异。由于硬件能力的提升,Raspberry Pi 4和Raspberry Pi…
Leave a Comment数据分析领域长期以来一直在努力将Python的能力(一种广泛用于分析的强大编程语言)与Microsoft Excel的熟悉界面和功能无缝集成。这个挑战妨碍了依赖这两个工具进行任务的专业人士进行高效决策和数据处理。显然需要一个能够弥合这个差距的统一解决方案。 现有的合并Python和Excel的尝试经常是繁琐的,涉及到复杂的设置。分析师不得不使用外部脚本、第三方工具或在两个环境之间进行手动数据传输。这些方法引入了低效性,提高了安全风险,并使协作工作流变得困难。缺失的部分是融合这两个平台的强项的一个统一解决方案。 Microsoft 对这个长期存在的挑战的答案是将Python整合到Excel中。这种突破性的整合提供了一种本地和无缝的方式来结合Excel的数据组织、可视化能力和对Python的分析能力的熟悉。它承诺重新定义专业人士在数据分析、决策和协作方面的方法。 Python in Excel 允许用户使用新的 PY 函数直接在Excel单元格中输入Python代码。这消除了使用外部脚本或复杂数据传输的需要。该整合是专为分析师设计的,确保了Python分析库(如pandas、Matplotlib和scikit-learn)的可用性。这种整合超越了简单的并置,使用户能够创建将Excel的现有功能与Python分析相结合的端到端解决方案。 通过在Microsoft Cloud上的隔离容器中运行Python代码,整合确保了安全性。通过Python和Excel函数之间的受控交互来维护数据隐私。通过与Microsoft Teams和Outlook等工具的兼容性来简化协作,实现共同撰写和数据共享,并遵守安全策略。 Python in Excel 在数据分析工作流中引入了一个范式转变。分析师现在可以在不离开熟悉的Excel界面的情况下无缝访问Python丰富的分析能力。高级可视化、机器学习、预测分析和数据清洗是基于Excel的分析的重要组成部分。这种整合的成功度量可能包括数据分析效率的提高、减少数据传输所花费的时间、增强协作能力和改善数据安全性。 Python in Excel 的引入解决了各行业专业人士长期面临的一个挑战。通过融合Python和Excel的优势,Microsoft 打开了新的分析潜力和协作水平。这种整合简化了工作流程,增强了数据洞察力,优化了决策过程。作为一种具有变革性的工具,Python in Excel…
Leave a Comment语言引导的视频分割是一个新兴的领域,专注于使用自然语言描述在视频中分割和跟踪特定对象。目前用于指代视频对象的数据集通常强调突出的对象,并依赖于具有许多静态属性的语言表达式。这些属性允许在仅一个帧中识别目标对象。然而,这些数据集忽视了语言引导的视频对象分割中运动的重要性。 https://arxiv.org/abs/2308.08544 研究人员引入了一个名为MeVIS的新的大规模数据集,称为运动表达视频分割(MeViS),以帮助我们的研究。MeViS数据集包含2,006个视频,8,171个对象,并提供了28,570个运动表达式来指代这些对象。上面的图像显示了MeViS中主要关注运动属性的表达式,仅仅通过检查一个单一的帧无法识别所指的目标对象。例如,第一个示例展示了三只外貌相似的鹦鹉,目标对象被确定为“飞走的鸟”。只有通过捕捉整个视频中的运动才能识别出这个对象。 几个步骤确保MeVIS数据集强调视频的时间动态。 首先,精心选择包含多个与运动共存的对象的视频内容,并排除了只能用静态属性描述的孤立对象的视频。 其次,在语言表达式中优先选择不包含静态线索的表达式,例如类别名称或对象颜色,在这种情况下,目标对象仅通过运动词语就可以明确描述。 除了提出MeViS数据集之外,研究人员还提出了一种名为语言引导的运动感知和匹配(LMPM)的基线方法,以应对这个数据集带来的挑战。他们的方法涉及生成以语言为条件的查询,以识别视频中的潜在目标对象。然后,使用对象嵌入来表示这些对象,与对象特征图相比,对象嵌入更稳健且计算效率更高。研究人员将运动感知应用于这些对象嵌入,以捕捉视频中的时间上下文,并建立对视频的整体运动动态的理解。这使得他们的模型能够把握视频中的瞬时和持久的运动。 https://arxiv.org/abs/2308.08544 上图显示了LMLP的架构。他们使用Transformer解码器来解释受运动影响的组合对象嵌入中的语言,以预测对象的移动。然后,将语言特征与投影的对象移动进行比较,以找到表达式中提到的目标对象。这种创新的方法将语言理解和运动评估合并在一起,有效地处理了复杂的数据集任务。 这项研究为开发更先进的语言引导视频分割算法奠定了基础。它在更具挑战性的方向上开辟了更多的途径,例如: 探索更好的运动理解和建模技术,结合视觉和语言模态。 创建更高效的模型,减少冗余检测到的对象数量。 设计有效的跨模态融合方法,利用语言和视觉信号之间的互补信息。 开发可以处理复杂场景中各种对象和表达式的先进模型。 解决这些挑战需要进行研究,推动语言引导视频分割领域的最新技术前进。
Leave a Comment通过利用不同语言共享的表示形式,跨语言学习已被认为可以提高自然语言处理模型在数据有限的低资源语言(LRL)上的准确性。然而,高资源语言(HRL)和低资源语言(LRL)的准确性存在显著差异,这与LRL的预训练数据相对稀缺有关,即使对于最先进的模型也是如此。在专业环境中,常常会对语言级准确性设定目标。这时候,像神经机器翻译、音译和类似数据上的标签传播等技术非常有用,因为它们可以用于合成增强现有训练数据。 这些方法可以用来增加训练数据的数量和质量,而无需采用代价过高的手动注释。由于机器翻译的局限性,即使翻译通常会提高LRL的准确性,但它可能需要赶上商业目标。 亚马逊的研究团队提出了一种通过使用主动学习有选择地收集标记数据来提高低资源语言(LRL)准确性的方法。虽然以前已经研究过多语言数据的主动学习,但大部分研究集中在为单一语言训练模型上。为此,他们正在努力完善一种能够有效地在语言之间进行翻译的单一模型。这种方法被称为语言感知主动学习多语言模型(LAMM),类似于已经显示主动学习可以在使用单一模型的情况下提高模型在各种语言上的性能的工作。然而,这种方法不提供专门针对和提高LRL准确性的手段。由于他们坚持为已经超过准确性目标的语言获取标签,今天最先进的主动学习算法在满足语言级目标至关重要的情况下浪费了手动注释。为了提高LRL的准确性而不对HRL的性能产生负面影响,他们提出了一种基于主动学习的策略来有策略地收集标记数据。建议的策略LAMM可以增加在所有相关语言中实现准确性目标的可能性。 研究人员将LAMM作为具有多个目标的MOP来构建。其目标是选择以下未标记数据的示例: 不确定的(模型对结果没有信心) 来自语言家族,分类器的性能可能优于目标。 亚马逊的研究人员使用典型的基于池的主动学习设置,将LAMM的性能与两个基准进行比较,使用四个多语言分类数据集。其中两个示例是亚马逊评论和MLDoc。亚马逊内部使用了两个多语言产品分类数据集。以下是标准的流程: 最低置信度(LC)收集可能具有最大熵不确定性的样本。 均匀分配(EC),为了填充每种语言的注释预算,收集具有高熵的样本,并将注释预算在语言之间均匀分配。 他们发现LAMM在所有LRL上的表现优于竞争对手,而在HRL上略微不如。使用LAMM时,HRL标签的百分比减少了62.1%,而与LC相比,AUC的准确性仅降低了1.2%。使用四个不同的产品分类数据集,其中两个是公开可用的,另外两个是亚马逊内部使用的专有数据集,他们展示了相对于强大基线,LAMM可以将LRL的性能增加4-11%。
Leave a Comment大型语言模型(LLMs)最近引起了很大的关注并取得了显著的成功。其中OpenAI的ChatGPT尤为突出。这些模型通过利用大量的互联网数据进行重要的预训练,并通过精确的指导数据进行进一步的微调,实现了各种任务的最新(SOTA)零-shot性能。这种模式在代码的理解和生成中也有所体现。许多代码LLMs已被提出来解决代码相关活动中固有的困难。这些代码LLMs通过使用大量的代码数据进行预训练,使它们能够在与代码相关的各种活动中表现出色。 在代码领域中,与大多数之前的代码LLMs主要侧重于预训练阶段不同,需要对细粒度的指令定制进行更多的研究。为了提高语言模型在各种活动中的泛化能力,首次使用了指令调整。例如,OpenAI的InstructGPT要求人工标注员提供具体的指令以验证与用户目标的符合性。类似于最近的Alpaca,使用ChatGPT通过自我指导方法生成指令数据。Vicuna利用用户在ShareGPT.com上发布的聊天记录。WizardLM建立了Evol-Instruct方法,涉及修改当前的指令数据以生成更复杂和多样化的数据集。 然而,重要的是要注意,这些技术在设计时应该特别考虑到代码领域,而不是主要关注通用领域。受Evol-Instruct方法的启发,微软和香港浸会大学的研究人员在这个项目中打算通过使用特定于代码的Evol-Instruct生成详细的代码指令数据来改进开源代码LLM StarCoder的功能。他们对适用于涉及编码的活动的进化提示过程进行了多方面的修改,以实现这一目标。简化了进化提示,改进了进化指令,并包括了代码调试和时间空间复杂性的限制。他们的方法首先用于开发基本的Code Alpaca指令数据。 接下来,他们使用新开发的代码指令跟随训练集来微调StarCoder并获得他们的WizardCoder。根据包括HumanEval、HumanEval+、MBPP和DS-100在内的四个代码生成基准的实验结果,他们的WizardCoder击败了所有其他开源代码LLM,达到了最先进的(SOTA)性能。他们注意到在HumanEval和HumanEval+上的pass@1得分显著提高,即在HumanEval上增加了22.3(57.3 vs. 35.0),在MBPP上增加了8.2(51.8 vs. 43.6)。令人惊讶的是,尽管规模较小,但他们的WizardCoder在HumanEval和HumanEval+的及格率上甚至超过了Anthropic的Claude和Google的Bard。 以下是本研究的贡献摘要: • 我们提供了WizardCoder,它应用了Code Evol-Instruct来改进开源代码LLM StarCoder的功能。 • WizardCoder在代码生成方面明显优于所有其他开源代码LLM,包括StarCoder、CodeGen、CodeGee、CodeT5+、InstructCodeT5+、StarCoder-GPTeacher和Instruct-Codegen-16B。 • 尽管规模较小,但WizardCoder在代码生成方面超过了主要的闭源LLM,包括Claude、Bard、PaLM、PaLM-2和LaMDA。
Leave a Comment在咨询领域,高效和有效地传播知识一直是一个持续追求的目标。咨询行业的开拓者麦肯锡认识到了利用其丰富的见解的挑战,并寻求简化这一过程的方法。尽管拥有许多专家、大量的文档和全球网络,但搜索、综合和应用这些资源的耗时性质仍然是一个瓶颈。这一障碍阻碍了公司迅速为客户提供价值的能力,限制了推动问题解决边界的能力。传统的研究方法非常耗时,尤其是对于新手来说,即使是经验丰富的专业人士也需要大量的时间投资进行深入探索和建立人际网络。 已经尝试了各种解决方案,从策划数据库到复杂的分析工具。然而,这些方法通常存在局限性。虽然它们可能改善了知识检索的某些方面,但未能全面解决迅速访问和利用公司的集体智慧这一多维挑战。 这就是麦肯锡对这个问题的创新回应——“Lilli”。Lilli代表了一种生成式AI平台,彻底改变了公司利用其广泛的知识储备的方式。这种由AI驱动的解决方案为搜索麦肯锡宝贵的见解和专业知识提供了无缝和公正的过程。它是将公司丰富的知识产权转化为可行战略的复杂工具,确保咨询顾问花更多时间应用见解而不是追寻它们。 Lilli的影响是可衡量和深远的。该平台通过自动化项目规划的初始阶段,从识别相关研究文档到定位相关专家,大大减少了启动工作的时间和精力投入。这种效率不仅使初级顾问受益,还使资深同事能够将时间专注于高价值的任务,如问题解决、指导和客户互动。此外,Lilli的AI能力不仅限于文档检索——它已经发展成为许多人的“思维擂台伴侣”,帮助预测问题、完善论证和拓宽视角。 指标显示了Lilli的效力。曾经需要几周的研究和建立人际网络现在只需花费一小部分时间。值得注意的是,专门从事技术战略的团队成员表示,在会议准备方面,他们的时间节省了多达20%,同时提高了他们的贡献质量。该平台不仅可以检索文档,还可以生成新的见解,正如团队成员之一在发现出人意料但相关的客户询问事例时所强调的那样。Lilli的功能涵盖两种模式,可以在麦肯锡的内部知识库以及外部来源进行搜索,增强了其多功能性。 Lilli的实施不仅仅是一项技术壮举;它还需要在法律、网络安全、风险管理和人才发展等领域的协调。该平台的发展历程,从最初的三人小组到70多名专家的联合体,反映了确保其成功的奉献精神。凭借QuantumBlack在GenAI方面的专业知识,Lilli已经准备好在成千上万的同事中进行广泛的部署,重塑公司的知识利用方式。 总而言之,麦肯锡的Lilli是生成式AI在推动咨询行业向前发展的潜力的明证。通过灵活解决知识获取和应用的挑战,Lilli使咨询顾问能够发挥其创造潜力,为客户提供前所未有的价值。这种创新不仅节省时间,还催生了问题解决和思考的新方式,从而展示了技术如何放大人类专业知识以创造变革性的结果。
Leave a Comment代码助手解决方案是一种在编写和编辑代码时帮助开发人员的工具或软件应用程序。由于其重要性日益增加,代码助手解决方案最近在全球范围内得到广泛使用。全球范围内正在进行实验和研究项目以推进这个领域。这些代码助手解决方案是建立在LLM(语言模型)之上的。一些代码助手解决方案包括GitHub Copilot、TabNine、IntelliCode等等。它们能够极大地提高生产力。这些平台极大地提升了生产力,提供了上下文相关的代码建议和补全。它们的影响正在为软件开发过程带来显著的效率改进。 然而,使用这些代码助手也存在问题,因为使用这些助手会将代码库暴露给第三方。在训练和推理过程中,代码库都会暴露给第三方,因为经过微调的代码LLM很可能在推理过程中泄露其训练数据集中的代码。SafeCoder允许客户学习创建和更新模型的过程,并掌握他们的AI能力。 因此,Hugging Face的研究人员对这些代码助手解决方案进行了深入研究,并制定了一种名为SafeCoder的方法,以帮助客户构建自己的代码LLM。这种方法涉及在客户的私有代码库上对模型进行微调,利用先进的开放模型和库。重要的是,这个过程允许客户通过避免与Hugging Face或外部实体共享来保持代码的机密性。SafeCoder的核心原则是,在训练或推理过程中,客户的内部代码库将永远不会被任何第三方(包括Hugging Face)访问。在训练和推理过程中,代码始终保持在虚拟私有云(VPC)中,确保其完整性。 StarCoder使用了稳健的150亿参数进行训练,并结合了代码优化技术。引入了Flash Attention进一步提升了模型的效率,使其能够涵盖8192个标记的上下文。它在80多种编程语言上进行了训练,并在多个基准测试中提供了最先进的性能。 研究人员开始参与一个可选的训练阶段,以提供用户特定的代码建议。Hugging Face团队与客户团队密切合作,提供逐步指导,以策划和构建训练数据集。这个过程还包括通过微调来打造个性化的代码生成模型,同时确保最高的隐私性。 在SafeCoder的部署阶段,客户通过将Hugging Face提供的容器实施到自己的基础架构上来掌控情况。这些容器的配置与客户的特定硬件设置相一致,包括NVIDIA GPU、AMD Instinct GPU、Intel Xeon CPU、AWS Inferentia2或Habana Gaudi加速器等选项。在部署和激活SafeCoder的端点后,开发人员可以集成兼容的SafeCoder IDE插件。此集成允许开发人员在工作时实时接收代码建议。 在未来,SafeCoder可能会提供其他类似的可商业允许的开源模型,这些模型以道德来源和透明数据集作为基础LLM进行微调。
Leave a Comment在机器学习的世界中,强化学习的概念占据了中心舞台,使代理通过在特定环境中的迭代试错来征服任务。它突出了这一领域的成就,例如使用光子方法来外包计算成本,并利用光的物理属性。它强调了将这些方法扩展到涉及多个代理和动态环境的更复杂问题的必要性。通过这项来自东京大学的研究,研究人员旨在将赌博算法与Q学习相结合,创建一种修改过的赌博Q学习(BQL),以加速学习并为多智能体合作提供见解,最终促进光子强化技术的进步。 研究人员使用了网格世界问题的概念。在这个问题中,一个代理通过一个5*5的网格进行导航,每个单元格表示一个状态。在每一步中,代理必须采取上、下、左或右的动作,并接收奖励和下一个状态。特定的单元格A和B提供更高的奖励,并促使代理转移到不同的单元格。这个问题依赖于一个确定性策略,其中代理的动作决定了它的移动。 动作值函数Q(s, a)量化了给定策略π的状态-动作对未来奖励。这个函数体现了代理通过其动作对累积奖励的预期。这项研究的主要目标是使代理学习所有状态-动作对的最优Q值。引入了一种修改过的Q学习,将赌博算法整合进来,通过动态的状态-动作对选择增强学习过程。 这种修改过的Q学习方案允许并行学习,其中多个代理更新共享的Q表。并行化通过增强Q表更新的准确性和效率来提升学习过程。设想了一个决策系统,利用光子的量子干涉原理,确保代理的同时动作保持不同,而无需直接通信。 研究人员计划开发一种算法,使代理能够连续行动,并将其方法应用于更复杂的学习任务。未来,作者的目标是创建一个光子系统,使至少三个代理之间能够进行无冲突的决策,增强决策协调。
Leave a Comment