Press "Enter" to skip to content

Month: September 2023

评估人工智能中的意识潜力:基于神经科学理论的指标属性的科学探索

AI系统有意识的可能性是当前热门话题。顶尖研究人员从与人类意识相关的大脑过程中获得灵感,以提升AI的能力。AI的进展惊人迅速。同时,开发能够准确模仿人类语音的AI系统可能会增加用户对有意识的AI系统的感知。他们在这项研究中主张,评估AI的意识最好的方法是参考神经科学对意识的理论。他们讨论了这类已知的理论,并研究了它们对AI的影响。 他们认为以下是他们在这份报告中的主要贡献: 1. 证明评估AI的意识在科学上是可行的,因为意识可以科学地进行研究,而且这项研究的结果适用于AI。 2. 他们提供了初步证据,表明许多指标性质可以使用当前技术在AI系统中实现,尽管目前没有系统被认为是意识的强有力候选者。 3. 以科学理论为基础,概述了评估AI中的意识的评分表。他们预期随着研究的进展,他们将包括的指标特征清单可能会发生变化,因此提供的评分表是初步的。 他们使用了三个基本原则来研究AI中的意识。作为工作假设,他们首先接受了计算功能主义的理论,该理论认为适当的计算既是理解的必要条件,也是充分条件。尽管有争议,但这一观点是现代哲学思考的支柱。出于实用原因,他们采纳了这一理论,因为与其他观点不同,它意味着AI的意识在理论上是可行的,研究AI系统的内部运作对于确定AI系统是否有可能有意识是重要的。这意味着思考计算功能主义对AI意识的影响是有用的。其次,他们认为基于神经科学的意识理论具有实证的有效性,并可用于评估人工智能中的意识。 计算功能主义暗示在AI中,类似的功能可能足以实现意识。这些理论试图找到在人类中既是必要条件又是充分条件的意识功能。第三,他们认为在AI中研究意识的最佳策略是理论为基础的策略。这意味着确定AI系统是否执行与科学理论中与意识相关的任务,并根据以下因素评估这些理论的可信度: 功能的相似性。 支持理论的证据的强度。 对计算功能主义的信念。 与此策略相比,评估行为意识的替代方法是进行行为测试。然而,由于AI系统可以被训练以模仿人类行为而在运作方式上有所不同,因此这种策略可能更可靠。 在这个背景下,他们不支持任何特定的理论,因为在意识科学中有几个假设是活跃的竞争者。相反,他们从对意识理论的研究中收集了一份指标清单。每个指标质量都是意识所必需的,并且一些子集是足够的,这是几个理论声称的。然而,他们认为,如果AI系统具有更多的指标特征,它们更有可能是有意识的。人们应该评估当前或计划中的AI系统是否具备或将具备这些特征,以确定它是否是意识的严肃竞争者。他们讨论了几个科学理论,如计算的高阶理论、全局工作空间理论和循环处理理论。由于集成信息理论与计算功能主义不兼容,他们不予考虑。 此外,他们还考虑了代理和具身化作为指标的概念。然而,重要的是要理解它们所暗示的计算方面。他们讨论了Perceiver架构和基于Transformer的大型语言模型,并根据全局工作空间的思想对其进行评估。他们还研究了一种通过管理虚拟鼠标身体来完成任务的系统(名为PaLM-E,即“具身化多模态语言模型”)和DeepMind的自适应代理(一种在3D虚拟环境中工作的强化学习代理)。他们使用这三个系统作为案例研究,以展示与代理和具身化相关的指标特征。 查看预印本论文。这项研究的所有荣誉归功于该项目的研究人员。此外,不要忘记加入我们的29k+ ML SubReddit、40k+ Facebook社区、Discord频道和电子邮件通讯,在那里我们分享最新的AI研究动态、有趣的AI项目等等。 Hostinger AI 网站构建器:用户友好的拖放式编辑器。立即试用(赞助) 1/8 非常兴奋地宣布我们的新预印版,从神经科学领域的领先理论的角度考虑了人工智能中的意识问题。这是一个大型的跨学科合作项目,涉及哲学、神经科学和人工智能的人员!https://t.co/rLm78YNfJk…

Leave a Comment

遇见TADA:将口述描述转化为富有表现力的3D化身的强大AI方法

大型语言模型和扩散模型的发展为将文本到图像模型与可微分的神经三维场景表示相结合铺平了道路,其中最好的例子是DeepSDF、NeRF和DMTET。这些模型使得仅通过文本描述就能够创建准确的三维模型成为可能。尽管这些进展在人工智能社区中取得了巨大的进步,但就形状和纹理而言,生成的对象或角色经常无法产生出优质逼真的三维头像。这些角色也可能无法适应传统的计算机图形工作流程。 最近的研究中,一个研究团队引入了一种名为TADA(Text to Animatable Digital Avatars)的简单而强大的方法,将口语描述转换为具有引人注目的几何形状和逼真纹理的表情丰富的三维头像。这些头像可以使用传统的图形方法进行动画处理,并且视觉上非常令人愉悦。现有的从文本生成角色的技术在几何和纹理质量方面存在问题。这些技术在动画方面有困难,因为在几何和纹理方面存在不匹配,尤其是在面部。TADA通过在2D扩散模型和参数化身体模型之间形成强大的协同作用来解决这些问题。 创建复杂头像表示对于TADA的发明至关重要。该团队在SMPL-X身体模型上添加了一个位移层和纹理映射来改进它。结果,SMPL-X以高分辨率形式呈现,能够捕捉更细致的纹理和特征。引入了一种分层渲染方法和分数蒸馏采样(SDS),以从文本输入创建复杂的高质量三维头像。这种技术确保了头像的详细和全面的特征。 为了使头像的几何形状和纹理对齐,团队在整个SDS优化过程中使用了创建角色的潜在嵌入渲染的法线和RGB图片。通过实施对齐策略,解决了以前技术中存在的对位问题,尤其是在面部区域。此外,在优化过程中使用了多种表情,以保持角色的面部表情和语义的一致性。这种方法确保了最终头像保持了原始SMPL-X模型的语义完整性,从而实现了逼真且有机地对齐动画。 TADA使用了一种名为Score Distillation Sampling(SDS)的技术。主要贡献如下: 具有混合网格表示的分层优化,允许高质量细节,尤其是在面部。 几何和纹理的一致对齐,使用优化过程对生成的角色进行形状变形,使用预定义的SMPL-X身体姿势和面部表情。 语义一致性和动画,确保生成的角色与SMPL-X保持语义一致,便于进行轻松准确的动画处理。 团队进行了一些定性和定量评估,评估了TADA相对于其他替代方法的优势。结果显示,TADA的能力超越了头像的制作,它实现了适合动画和渲染的大规模数字角色的构建。它还提供了文本引导编辑,为用户提供了巨大的权力和定制能力。

Leave a Comment

苹果研究人员提出了一种从姿势图像生成详细的3D重建的端到端网络

你玩过GTA-5吗?人们对游戏中的3D图形赞叹不已。与平面上的2D图形不同,3D图形模拟深度和透视,使得视觉更加真实和沉浸。这些图形在各个领域广泛应用,包括视频游戏、电影制作、建筑可视化、医学成像、虚拟现实等等。 传统的创建3D模型的方法是通过估计输入图像的深度图,然后将其融合以创建3D模型。苹果和加州大学圣巴巴拉分校的研究人员创建了一个直接推断场景级3D几何的方法,使用了深度神经网络,不涉及传统的测试时间优化。 传统方法在深度图不匹配的区域(如透明或低纹理表面)导致几何缺失或伪影。研究人员的方法将图像映射到体素网格上,并使用3D卷积神经网络直接预测场景的截断有符号距离函数(TSDF)。 卷积神经网络(CNN)是一种专门设计用于处理和分析视觉数据(尤其是图像和视频)的人工神经网络。使用这种技术的优势在于CNN可以学习和生成平滑、一致的表面,填补低纹理或透明区域的空白。 研究人员在训练期间使用三线性插值对地面真实TSDF进行采样,以与模型的体素网格对齐。这种三线性插值采样会在训练过程中对细节添加随机噪声。为了克服这个问题,他们只考虑了在地面真实TSDF完全已知的确切点处的有监督预测,并且这种方法改善了结果10%。 体素是体素像素的缩写。它代表网格内的三维空间中的一个点,类似于像素代表二维图像中的一个点。现有的体素大小为4cm或更大,这不足以解决自然图像中可见的几何细节,并且增加体素分辨率是昂贵的。他们通过使用CNN网格特征,直接将图像特征投影到查询点来解决这个问题。 他们需要使用密集的反投影来从每个体素中的每个输入图像中进行采样。然而,这会导致反投影体积模糊,他们通过使用初始的多视角立体深度估计来解决这个问题,进一步增强了特征体积。 研究人员声称他们的方法是使网络学习细节并允许自由选择输出分辨率的关键,而无需额外的训练或3D卷积层。

Leave a Comment

朱丽叶·鲍威尔(Juliette Powell)和阿特·克莱纳(Art Kleiner)是《人工智能困境—访谈系列》的作者

《AI困境》一书由朱丽叶·鲍威尔(Juliette Powell)和阿特·克莱纳(Art Kleiner)共同撰写朱丽叶·鲍威尔是一位作家、电视节目制作人,在她的名下有9000个直播节目,同时也是一位技术专家和社会学家她还是彭博电视台/商业新闻网络的评论员,并在由经济学家和国际金融公司组织的会议上发表演讲[…]

Leave a Comment

ChatGPT的Enigma PUMA是一种AI方法,提出了一种快速且安全的LLM推理方式

大型语言模型(LLMs)在人工智能领域引发了一场革命。ChatGPT的发布为LLMs时代点燃了火花,从那时起,我们见证了它们不断改进。这些模型通过大量的数据变得可能,并以其能力给我们留下了深刻的印象,从掌握语言理解到简化复杂任务。 ChatGPT的替代方案有很多,它们每天都在变得越来越好,甚至在某些任务上超越了ChatGPT。LLaMa、Claudia、Falcon等等;新的LLM模型正向ChatGPT的宝座发起冲击。 然而,毫无疑问,ChatGPT仍然是迄今为止最受欢迎的LLM。你最喜欢的基于AI的应用很有可能只是一个处理连接的ChatGPT封装器。但是,如果我们退后一步思考安全问题,它真的是私密且安全的吗?OpenAI确保保护API数据隐私是他们非常关心的事情,但他们同时面临着许多诉讼。即使他们非常努力地保护模型使用的隐私和安全性,这些模型可能过于强大而无法控制。 那么,我们如何确保在使用LLMs的同时不会出现隐私和安全问题?如何利用这些模型的能力而不损害敏感数据?让我们来认识一下PUMA。 PUMA 是一个旨在实现安全高效评估Transformer模型的框架,同时保护您数据的纯洁性。它将安全多方计算(MPC)与高效的Transformer推理相结合。 在其核心,PUMA 引入了一种新颖的技术,用于近似Transformer模型内的复杂非线性函数,如GeLU和Softmax。这些近似是为了保持准确性,同时显著提高效率。与可能牺牲性能或导致复杂部署策略的先前方法不同,PUMA的方法平衡了两个世界-确保准确结果的同时,保持了实际应用所需的效率。 PUMA 引入了三个关键实体:模型所有者、客户端和计算方。每个实体在安全推理过程中都发挥着关键作用。 模型所有者提供经过训练的Transformer模型,而客户端贡献输入数据并接收推理结果。计算方集体执行安全计算协议,确保数据和模型权重在整个过程中得到安全保护。PUMA推理过程的基本原则是保持输入数据和权重的机密性,保护涉及的实体的隐私。 安全嵌入是安全推理过程的一个基本方面,传统上涉及使用令牌标识符生成一位热向量。然而,PUMA 提出了一种与Transformer模型的标准工作流程密切相符的安全嵌入设计。这种简化的方法确保安全措施不会干扰模型的固有架构,简化了在实际应用中部署安全模型。 PUMA中使用的安全GeLU和LayerNorm协议的概述。来源:https://arxiv.org/pdf/2307.12533.pdf 此外,在安全推理中,近似复杂函数(如GeLU和Softmax)以平衡计算效率和准确性的方式是一个重大挑战。PUMA 通过设计更准确的近似方法,根据这些函数的特性进行优化,解决了这个问题。通过利用这些函数的特定特征,PUMA 显著提高了近似的精度,同时优化了运行时间和通信成本。 最后,LayerNorm作为Transformer模型中的关键操作,由于除法平方根公式,它在安全推理中带来了独特的挑战。PUMA 通过巧妙地重新定义使用安全协议的操作,确保LayerNorm的计算既安全又高效。 PUMA 最重要的特点之一是它的无缝集成。该框架可以在不需要进行重大模型架构修改的情况下,实现端到端的安全推理,这意味着您可以轻松利用预训练的Transformer模型。无论是从Hugging Face还是其他来源下载的语言模型,PUMA 都能简化操作。它与原始工作流程相一致,不需要复杂的重新训练或修改。

Leave a Comment

“遇见Cursive:一种通用而直观的与LLM互动的人工智能框架”

在与大型语言模型(LLM)进行接口交互的领域中,开发人员常常面临一个共同的困境。一方面,存在复杂而臃肿的框架,而另一方面,要从零开始构建大量抽象的前景。在简单性、调试易用性和可扩展性之间取得平衡依然是一个艰巨的挑战。 构建者和与LLM相关的开发人员传统上面临着有关框架的问题。复杂和功能繁重的框架位于光谱的一端,往往导致代码混乱和难以控制。另一方面,缺乏适当的工具和抽象使得开发人员需要投入大量时间来构建他们的解决方案,从而阻碍了效率和生产力。这些缺点凸显了需要一个提供简化体验而又不牺牲功能的框架的需求。 为了直面这一挑战,Cursive框架成为一个有前景的解决方案。Cursive试图通过提升与LLM交互时的开发者体验(DX)来重新定义这一领域的格局。它的目标是使与LLM的交互过程直观、愉快,并摆脱不必要的复杂性。此外,Cursive采取了一个非常出色的步骤,确保其适用于包括浏览器、Node.js、Cloudflare Workers、Deno、Bun等各种JavaScript环境。 Cursive的核心承诺在于简化开发人员与LLM之间的交互,为他们提供清晰而愉快的体验。一个值得注意的特点是简化了向模型提问和接收答案的方法。开发人员可以轻松地进行模型查询,并通过最少的代码获得响应,提高工作流程的效率。此外,与模型保持对话线程非常简单,实现了无缝的双向交互。 Cursive还革新了在LLM上下文中调用函数的方式。传统的函数调用经常导致不连贯的代码,难以理解。然而,Cursive引入了一种函数调用方法,保持整个过程的连贯性。函数定义的创建、执行和结果检索无缝集成,提高了代码的可读性和可维护性。 Cursive的影响通过反映增强的DX和改进的开发工作流程的有形指标来衡量。减少了与模型交互所需的代码行数,直观的函数调用以及连贯的对话处理都有助于提高开发者的生产力。该框架能够估算不同模型的成本和使用情况,并处理模型之间的上下文切换,带来了以前缺乏的可靠性和可观察性。 Cursive的引入在LLM交互领域迈出了重要的一步。通过优先考虑开发者体验,该框架解决了现有的挑战,并为更高效、简化和愉快的开发流程铺平了道路。作为一种旨在改变构建者与LLM交互方式的工具,Cursive具有重新定义最佳实践、鼓励创新并提高开发领域生产力的潜力。其在各种JavaScript环境中的多样性进一步巩固了它作为一个具有颠覆性解决方案的地位。

Leave a Comment

谷歌推出适用于树莓派的MediaPipe,并提供易于使用的Python SDK,用于设备上的机器学习

为了应对嵌入式系统上可访问机器学习(ML)工具需求的指数级增长,研究人员推出了一种创新解决方案,旨在赋予使用树莓派单板计算机的开发人员更强大的能力。新的框架MediaPipe for Raspberry Pi提供了一个基于Python的软件开发工具包(SDK),旨在促进各种ML任务的开发。这一发展在设备上ML领域中是一个重要的进步,解决了简化和高效工具的需求。 设备上机器学习的出现为开发人员带来了独特的资源限制和复杂性挑战。树莓派作为一个受欢迎的平台,无论是业余爱好者还是专业人士,都缺乏一个全面的SDK,使用户能够无缝地在项目中利用机器学习的能力。这种缺乏可访问工具的情况促使了对一个用户友好的解决方案的需求。 在MediaPipe for Raspberry Pi推出之前,开发人员常常苦于将通用的机器学习框架调整为适应树莓派设备的能力。这个过程常常很复杂,并要求对ML算法和硬件约束有深入的理解。这个挑战因为需要一个专门针对树莓派生态系统的SDK而更加严峻。 来自各个机构的研究人员站了出来,揭示了一个突破性的框架,解决了这些问题。MediaPipe for Raspberry Pi SDK是协同努力的结果,旨在简化设备上ML的开发。该框架提供了一个基于Python的接口,方便进行各种机器学习任务,包括音频分类、文本分类、手势识别等。它的推出标志着开发人员可以无缝地将机器学习整合到他们的树莓派项目中。 MediaPipe for Raspberry Pi通过提供处理嵌入式系统上机器学习实现细节的预构建组件,简化了开发过程。SDK与OpenCV和NumPy的集成进一步增强了其实用性。该框架通过提供涵盖各种应用的Python示例(如音频分类、面部关键点定位、图像分类等),使用户能够通过使用提供的Python示例启动他们的项目。此外,开发人员被鼓励使用本地存储的ML模型,以确保在树莓派设备上实现最佳性能。 虽然MediaPipe for Raspberry Pi框架承诺提升ML开发体验,但需要注意的是,它在不同的树莓派型号上的性能会有所差异。由于硬件能力的提升,Raspberry Pi 4和Raspberry Pi…

Leave a Comment

微软在Excel中引入Python:将分析能力与熟悉度相结合,以增强数据洞察力

数据分析领域长期以来一直在努力将Python的能力(一种广泛用于分析的强大编程语言)与Microsoft Excel的熟悉界面和功能无缝集成。这个挑战妨碍了依赖这两个工具进行任务的专业人士进行高效决策和数据处理。显然需要一个能够弥合这个差距的统一解决方案。 现有的合并Python和Excel的尝试经常是繁琐的,涉及到复杂的设置。分析师不得不使用外部脚本、第三方工具或在两个环境之间进行手动数据传输。这些方法引入了低效性,提高了安全风险,并使协作工作流变得困难。缺失的部分是融合这两个平台的强项的一个统一解决方案。 Microsoft 对这个长期存在的挑战的答案是将Python整合到Excel中。这种突破性的整合提供了一种本地和无缝的方式来结合Excel的数据组织、可视化能力和对Python的分析能力的熟悉。它承诺重新定义专业人士在数据分析、决策和协作方面的方法。 Python in Excel 允许用户使用新的 PY 函数直接在Excel单元格中输入Python代码。这消除了使用外部脚本或复杂数据传输的需要。该整合是专为分析师设计的,确保了Python分析库(如pandas、Matplotlib和scikit-learn)的可用性。这种整合超越了简单的并置,使用户能够创建将Excel的现有功能与Python分析相结合的端到端解决方案。 通过在Microsoft Cloud上的隔离容器中运行Python代码,整合确保了安全性。通过Python和Excel函数之间的受控交互来维护数据隐私。通过与Microsoft Teams和Outlook等工具的兼容性来简化协作,实现共同撰写和数据共享,并遵守安全策略。 Python in Excel 在数据分析工作流中引入了一个范式转变。分析师现在可以在不离开熟悉的Excel界面的情况下无缝访问Python丰富的分析能力。高级可视化、机器学习、预测分析和数据清洗是基于Excel的分析的重要组成部分。这种整合的成功度量可能包括数据分析效率的提高、减少数据传输所花费的时间、增强协作能力和改善数据安全性。 Python in Excel 的引入解决了各行业专业人士长期面临的一个挑战。通过融合Python和Excel的优势,Microsoft 打开了新的分析潜力和协作水平。这种整合简化了工作流程,增强了数据洞察力,优化了决策过程。作为一种具有变革性的工具,Python in Excel…

Leave a Comment

新加坡国立大学(NTU)的这篇AI论文介绍了MeVIS:一个用于带有运动表达的视频分割的大规模基准测试

语言引导的视频分割是一个新兴的领域,专注于使用自然语言描述在视频中分割和跟踪特定对象。目前用于指代视频对象的数据集通常强调突出的对象,并依赖于具有许多静态属性的语言表达式。这些属性允许在仅一个帧中识别目标对象。然而,这些数据集忽视了语言引导的视频对象分割中运动的重要性。 https://arxiv.org/abs/2308.08544 研究人员引入了一个名为MeVIS的新的大规模数据集,称为运动表达视频分割(MeViS),以帮助我们的研究。MeViS数据集包含2,006个视频,8,171个对象,并提供了28,570个运动表达式来指代这些对象。上面的图像显示了MeViS中主要关注运动属性的表达式,仅仅通过检查一个单一的帧无法识别所指的目标对象。例如,第一个示例展示了三只外貌相似的鹦鹉,目标对象被确定为“飞走的鸟”。只有通过捕捉整个视频中的运动才能识别出这个对象。 几个步骤确保MeVIS数据集强调视频的时间动态。 首先,精心选择包含多个与运动共存的对象的视频内容,并排除了只能用静态属性描述的孤立对象的视频。 其次,在语言表达式中优先选择不包含静态线索的表达式,例如类别名称或对象颜色,在这种情况下,目标对象仅通过运动词语就可以明确描述。 除了提出MeViS数据集之外,研究人员还提出了一种名为语言引导的运动感知和匹配(LMPM)的基线方法,以应对这个数据集带来的挑战。他们的方法涉及生成以语言为条件的查询,以识别视频中的潜在目标对象。然后,使用对象嵌入来表示这些对象,与对象特征图相比,对象嵌入更稳健且计算效率更高。研究人员将运动感知应用于这些对象嵌入,以捕捉视频中的时间上下文,并建立对视频的整体运动动态的理解。这使得他们的模型能够把握视频中的瞬时和持久的运动。 https://arxiv.org/abs/2308.08544 上图显示了LMLP的架构。他们使用Transformer解码器来解释受运动影响的组合对象嵌入中的语言,以预测对象的移动。然后,将语言特征与投影的对象移动进行比较,以找到表达式中提到的目标对象。这种创新的方法将语言理解和运动评估合并在一起,有效地处理了复杂的数据集任务。 这项研究为开发更先进的语言引导视频分割算法奠定了基础。它在更具挑战性的方向上开辟了更多的途径,例如: 探索更好的运动理解和建模技术,结合视觉和语言模态。 创建更高效的模型,减少冗余检测到的对象数量。 设计有效的跨模态融合方法,利用语言和视觉信号之间的互补信息。 开发可以处理复杂场景中各种对象和表达式的先进模型。 解决这些挑战需要进行研究,推动语言引导视频分割领域的最新技术前进。

Leave a Comment

企业如何提高多语言产品分类器的准确性?这篇人工智能论文提出了LAMM:一种针对训练数据有限语言的主动学习方法,旨在增强分类准确性

通过利用不同语言共享的表示形式,跨语言学习已被认为可以提高自然语言处理模型在数据有限的低资源语言(LRL)上的准确性。然而,高资源语言(HRL)和低资源语言(LRL)的准确性存在显著差异,这与LRL的预训练数据相对稀缺有关,即使对于最先进的模型也是如此。在专业环境中,常常会对语言级准确性设定目标。这时候,像神经机器翻译、音译和类似数据上的标签传播等技术非常有用,因为它们可以用于合成增强现有训练数据。 这些方法可以用来增加训练数据的数量和质量,而无需采用代价过高的手动注释。由于机器翻译的局限性,即使翻译通常会提高LRL的准确性,但它可能需要赶上商业目标。 亚马逊的研究团队提出了一种通过使用主动学习有选择地收集标记数据来提高低资源语言(LRL)准确性的方法。虽然以前已经研究过多语言数据的主动学习,但大部分研究集中在为单一语言训练模型上。为此,他们正在努力完善一种能够有效地在语言之间进行翻译的单一模型。这种方法被称为语言感知主动学习多语言模型(LAMM),类似于已经显示主动学习可以在使用单一模型的情况下提高模型在各种语言上的性能的工作。然而,这种方法不提供专门针对和提高LRL准确性的手段。由于他们坚持为已经超过准确性目标的语言获取标签,今天最先进的主动学习算法在满足语言级目标至关重要的情况下浪费了手动注释。为了提高LRL的准确性而不对HRL的性能产生负面影响,他们提出了一种基于主动学习的策略来有策略地收集标记数据。建议的策略LAMM可以增加在所有相关语言中实现准确性目标的可能性。 研究人员将LAMM作为具有多个目标的MOP来构建。其目标是选择以下未标记数据的示例: 不确定的(模型对结果没有信心) 来自语言家族,分类器的性能可能优于目标。 亚马逊的研究人员使用典型的基于池的主动学习设置,将LAMM的性能与两个基准进行比较,使用四个多语言分类数据集。其中两个示例是亚马逊评论和MLDoc。亚马逊内部使用了两个多语言产品分类数据集。以下是标准的流程: 最低置信度(LC)收集可能具有最大熵不确定性的样本。 均匀分配(EC),为了填充每种语言的注释预算,收集具有高熵的样本,并将注释预算在语言之间均匀分配。 他们发现LAMM在所有LRL上的表现优于竞争对手,而在HRL上略微不如。使用LAMM时,HRL标签的百分比减少了62.1%,而与LC相比,AUC的准确性仅降低了1.2%。使用四个不同的产品分类数据集,其中两个是公开可用的,另外两个是亚马逊内部使用的专有数据集,他们展示了相对于强大基线,LAMM可以将LRL的性能增加4-11%。

Leave a Comment

微软和香港浸会大学的研究人员推出了WizardCoder:一种代码演变指导的精调代码LLM

大型语言模型(LLMs)最近引起了很大的关注并取得了显著的成功。其中OpenAI的ChatGPT尤为突出。这些模型通过利用大量的互联网数据进行重要的预训练,并通过精确的指导数据进行进一步的微调,实现了各种任务的最新(SOTA)零-shot性能。这种模式在代码的理解和生成中也有所体现。许多代码LLMs已被提出来解决代码相关活动中固有的困难。这些代码LLMs通过使用大量的代码数据进行预训练,使它们能够在与代码相关的各种活动中表现出色。 在代码领域中,与大多数之前的代码LLMs主要侧重于预训练阶段不同,需要对细粒度的指令定制进行更多的研究。为了提高语言模型在各种活动中的泛化能力,首次使用了指令调整。例如,OpenAI的InstructGPT要求人工标注员提供具体的指令以验证与用户目标的符合性。类似于最近的Alpaca,使用ChatGPT通过自我指导方法生成指令数据。Vicuna利用用户在ShareGPT.com上发布的聊天记录。WizardLM建立了Evol-Instruct方法,涉及修改当前的指令数据以生成更复杂和多样化的数据集。 然而,重要的是要注意,这些技术在设计时应该特别考虑到代码领域,而不是主要关注通用领域。受Evol-Instruct方法的启发,微软和香港浸会大学的研究人员在这个项目中打算通过使用特定于代码的Evol-Instruct生成详细的代码指令数据来改进开源代码LLM StarCoder的功能。他们对适用于涉及编码的活动的进化提示过程进行了多方面的修改,以实现这一目标。简化了进化提示,改进了进化指令,并包括了代码调试和时间空间复杂性的限制。他们的方法首先用于开发基本的Code Alpaca指令数据。 接下来,他们使用新开发的代码指令跟随训练集来微调StarCoder并获得他们的WizardCoder。根据包括HumanEval、HumanEval+、MBPP和DS-100在内的四个代码生成基准的实验结果,他们的WizardCoder击败了所有其他开源代码LLM,达到了最先进的(SOTA)性能。他们注意到在HumanEval和HumanEval+上的pass@1得分显著提高,即在HumanEval上增加了22.3(57.3 vs. 35.0),在MBPP上增加了8.2(51.8 vs. 43.6)。令人惊讶的是,尽管规模较小,但他们的WizardCoder在HumanEval和HumanEval+的及格率上甚至超过了Anthropic的Claude和Google的Bard。 以下是本研究的贡献摘要: • 我们提供了WizardCoder,它应用了Code Evol-Instruct来改进开源代码LLM StarCoder的功能。 • WizardCoder在代码生成方面明显优于所有其他开源代码LLM,包括StarCoder、CodeGen、CodeGee、CodeT5+、InstructCodeT5+、StarCoder-GPTeacher和Instruct-Codegen-16B。 • 尽管规模较小,但WizardCoder在代码生成方面超过了主要的闭源LLM,包括Claude、Bard、PaLM、PaLM-2和LaMDA。

Leave a Comment