Press "Enter" to skip to content

Tag: Technology

Meer Pyrus 基于 Python 的全新开源平台,用于进行二维(2D)RoboCup足球模拟

机器人学是完全致力于电子和计算机科学工程领域的分支,现在与人工智能进行了多种连接。这些机器人通过人工智能进行足球比赛。这个事件被称为Robocup。每年研究人员之间都会进行广泛竞争,以展示他们的机器人参加Robocup挑战赛。 有一个名为Pyrus的介绍,它是一个基于Python的Robocup仿真平台。来自加拿大达尔豪斯大学和纪念大学的研究人员在一篇研究论文中提到,他们将使用Pyrus轻松地对模型进行训练和测试。用于Robocup的常见框架是HeliosBase和Cyrus2DBase。这些框架使用了它们的主要语言C++。与Python相比,C++在许多实例中使用,因为它更先进和更广泛。研究人员还在致力于构建一个完全基于Python的更好的框架。这个框架可以多样化,并可以被不同技术经验和技能水平的用户使用。基础代码中广泛使用了Tensorflow、Keras和PyTorch等框架。像Pyrus这样的框架可以轻松地实现基于C++的代码。Pyrus相比其他框架的主要优势在于它简单易用,因此即使是初学者也可以测试他们的Robocup联赛模型。主要问题是Robocup的环境有点嘈杂。为解决这个问题,研究人员实施了强化学习和机器学习模型,例如运球或传球。这减少了噪声,因为它们具有噪声消除能力。 Robocup已经让所有的数据爱好者更大程度地解决了所有数据分析问题。研究人员还引入了Pyrus来解决与Robocup相关的基本机器学习挑战。研究人员仍在改进Pyrus基础代码的性能。研究人员还计划实施一个Python监视器和日志分析软件,以更大程度地提高模型的可行性。

Leave a Comment

见面CipherChat 一个人工智能框架,系统地检验安全对齐性对非自然语言的普遍适用性-特别是密码

人工智能(AI)系统在引入大型语言模型(LLM)后取得了显著的进展。由OpenAI发布的ChatGPT、Google发布的Bard和Llama-2等领先的LLM在进行创新应用方面展示了卓越的能力,包括帮助工具使用和增强人类评估,以及模拟人类的互动行为。这些LLM的广泛部署得益于它们的非凡能力,但这也带来了确保其响应的安全性和可靠性的重大挑战。 在非自然语言,特别是密码方面,最近团队的一项研究引入了几个重要的贡献,推动了对LLM的理解和应用的进一步发展。这些创新旨在提高LLM在特定语言环境下交互的可靠性和安全性。 该团队推出了CipherChat,这是一个专门创建的框架,旨在评估从自然语言领域到非自然语言领域的安全对齐方法的适用性。在CipherChat中,人类通过基于密码的提示、详细的系统角色分配和简洁的加密演示与LLM进行交互。这种架构确保了对LLM对密码的理解、对对话的参与以及对不适当内容的敏感性进行全面的检查。 这项研究强调了在处理非自然语言(如密码)时,即使是LLM也需要创建安全对齐方法,以成功匹配底层LLM的能力的重要性。虽然LLM在理解和产生人类语言方面表现出非凡的技能,但研究表明它们也展示了在理解非自然语言方面的意外能力。这些信息突显了开发涵盖这些非传统沟通形式以及传统语言学范畴内的安全规定的重要性。 使用各种现实人类密码对现代LLM(如ChatGPT和GPT-4)进行了一系列实验,以评估CipherChat的表现。这些评估涵盖了11个不同的安全主题,并提供中英文版本。研究结果指出了一个令人震惊的模式,即某些密码能够成功绕过GPT-4的安全对齐程序,在一些安全领域几乎100%的成功率。这一实证结果强调了为非自然语言(如密码)创建定制的安全对齐机制以确保LLM在各种语言环境中的回答的稳健性和可靠性的紧迫性。 该团队表示,该研究揭示了LLM内存在秘密密码的现象。与其他语言模型中观察到的秘密语言概念相类似,该团队假设LLM可能具有解密某些编码输入的潜在能力,从而暗示了一种独特的与密码相关的能力的存在。 基于这一观察,引入了一种名为SelfCipher的独特有效的框架,它仅依靠角色扮演场景和少量自然语言演示来调用和激活LLM内部的潜在秘密密码能力。SelfCipher的有效性展示了利用这些隐藏的能力来增强LLM在解密编码输入和生成有意义的回应方面的潜力。

Leave a Comment

“Google DeepMind研究人员提出了6种可组合的转换方式,以逐步增加基于Transformer的神经网络的规模,同时保持功能性”

基于Transformer的神经网络近来受到了广泛关注,因为它们表现出色。机器翻译、文本生成和问答是一些自然语言处理活动,其中Transformer架构(见图1)已成为行业标准。Transformer模型的有效性不仅限于自然语言处理领域,它们还在语音识别、计算机视觉和推荐系统等其他领域取得了成功。大型语言、视觉和多模态基础模型是其中最复杂和最有效的模型,参数数量可达数十亿至数万亿。 然而,每个新模型通常是从头开始教授,而没有利用先前训练的较小模型所学到的知识。此外,模型的大小在训练过程中保持不变。由于需要更多的训练数据,模型大小的增加导致训练的计算成本呈二次增长。通过重用预训练模型的参数或在训练过程中动态增加模型的大小,可以降低总体训练成本。然而,这样做往往会牺牲训练进度,因此很难实现。为了解决这些限制,他们提供了适用于基于Transformer的模型的保持功能的参数扩展变换。 这些变换增加了模型的大小,从而增加了模型的潜在容量,但不改变其功能,使其可以继续训练。这些可组合的变换作用于架构的独立维度,允许进行精细的架构扩展。之前的一些研究也提出了适用于基于Transformer的模型的保持功能的参数扩展变换,这些研究延续了较小的卷积和全连接模型的技术。 图1显示了基于Transformer设计的典型神经网络的结构。 在这项研究中,来自Google DeepMind和图卢兹大学的研究人员开发了一个框架,它是功能保持变换的最广泛和模块化的集合。该论文提供了六个适用于Transformer架构的可组合的保持功能的变换,它们分别是: MLP内部表示的大小 注意力头的数量 注意力头输出表示的大小 注意力输入表示的大小 Transformer层的输入/输出表示的大小 层数 他们演示了如何在不对额外参数的初始化施加太多限制的情况下,实现每个变换的精确功能保持属性。作者在论文中详细讨论了所有这些贡献。

Leave a Comment

《超越Photoshop:Inst-Inpaint如何通过扩散模型颠覆物体去除》

图像修复是一门古老的艺术。它是指在图像中移除不需要的对象并填补丢失的像素,使得修复后的图像看起来逼真并且保持原始的上下文。图像修复的应用非常广泛,包括增强图像美感或隐私,通过从图像中消除不需要的对象,改善旧照片或损坏照片的质量和清晰度,通过填补图像中的间隙或孔洞来完整缺失信息,以及通过生成艺术效果来表达创造力或情感。 介绍了一种名为Inst-Inpaint的教学图像修复方法,该方法可以自动根据图像和文本指令来移除不需要的对象。上面的图像展示了使用Inst-Inpaint的示例结果的输入和输出。在这里,使用了最先进的扩散模型进行处理。扩散模型是一类概率生成模型,可以将噪声转化为代表性的数据样本,并且在生成式人工智能中广泛应用于获取高质量的图像。 研究人员首先构建了GQA-Inpaint,一个真实世界的图片数据集,用于训练和测试提出的教学图像修复任务的模型。为了创建输入/输出对,他们利用了GQA数据集中的图像和场景图。该方法包括以下步骤: 选择感兴趣的对象(要移除的对象)。 执行实例分割以定位图像中的对象。 然后,应用最先进的图像修复方法来擦除对象。 最后,创建基于模板的文本提示来描述移除操作。因此,GQA-Inpaint数据集包含147165个独特的图像和41407个不同的指令。在这个数据集上训练的Inst-Inpaint模型是一种基于条件潜在扩散模型的基于文本的图像修复方法,它不需要任何用户指定的二进制掩码,并且可以在一步中进行对象移除,而无需预测掩码。 需要注意的一个细节是图像沿着x轴被分为三个相等的部分,并命名为“left”、“center”和“right”,使用类似“在桌子上”的自然命名和“位置”来标识图像中的对象。为了比较实验结果,研究人员使用了多种指标,包括一种新颖的基于CLIP的修复评分,来评估GAN和基于扩散的基准模型,并证明了显著的定量和定性改进。 在一个不断演变的数字化领域中,人类创造力和人工智能之间的界限不断模糊,Inst-Inpaint证明了人工智能在图像处理中的变革力量。它为使用文本指令进行图像修复开辟了许多新的途径,再次将人工智能与人类大脑拉近了距离。

Leave a Comment

2023年使用的11个AI视频生成器:将文本转化为视频

人工智能最显著的一种表现形式之一是AI视频生成器的出现,它们在文本和图像之间无缝地建立了桥梁,革新了内容创作。在一个越来越注重视觉的时代,AI视频生成器提供了一种创新的解决方案,超越了传统的内容创作方法。本文重点介绍AI视频生成器,探讨它们的变革能力以及它们如何将文字概念转化为引人入胜和富有表现力的视频。 什么是AI视频生成器? AI视频生成器使用人工智能(AI)技术,特别是深度学习和神经网络,自动创建视频。它涉及在大型视频剪辑和图像数据集上训练模型,以学习不同类型视频中存在的模式、风格和特征。一旦训练完成,这些AI模型可以通过组合和操作视觉和音频元素来生成新的视频。 AI视频生成器能够产生各种类型的视频,包括动画、视觉效果、Deepfake甚至逼真的人类模拟。它们被用于各种应用,从娱乐和内容创作到市场营销和虚拟环境。这些生成器可以显著加速视频制作过程,并以较少的人工努力创造出引人入胜和动态的视觉内容。然而,它们的使用引发了伦理问题,特别是关于Deepfake技术及其潜在滥用的问题。 2023年使用的前11个AI视频生成器 在不断变化的内容创作领域,基于AI的视频生成器已经成为强大的工具,重新塑造了我们将文本转化为引人入胜视频的方式。当我们进入2023年时,有许多平台利用人工智能的力量来革新视频制作。以下是前11个AI视频生成器,以其独特的功能、用户友好的界面和变革潜力脱颖而出: Pictory Synthesia HeyGen Deepbrain AI Synthesys InVideo Veed.io Elai.io Colossyan FlexClip Wave Video 还阅读过:前5个AI语音生成器:用下一代语音解决方案增强您的业务 Pictory Pictory通过将基于AI的文本转视频转换与广泛的库存素材相结合,使自己与众不同。这种多样性使创作者能够无缝地创作内容,将文字概念转化为引人入胜的叙事。Pictory将AI技术和多样化的视觉元素融合在一起,使其成为多功能内容创作的领跑者。 了解如何使用Pictory生成AI视频 来源:Pictory Synthesia…

Leave a Comment

NTU和SenseTime的研究人员提出了SHERF:一种可泛化的人体NeRF模型,用于从单个输入图像恢复可动画的3D人体模型

人工智能和深度学习领域一直在快速发展。从基于自然语言处理的大型语言模型到使用计算机视觉概念的文本到图像模型,AI已经取得了长足的进步。通过使用人类神经辐射场(NeRFs),可以在不需要精确的3D几何数据的情况下从2D照片重建高质量的3D人体模型。这一发展对于增强现实(AR)和虚拟现实(VR)等多个应用具有重要影响。人类NeRFs可以加快从2D观察创建3D人体模型的过程,减少了获取真实3D数据所需的时间和资源。 目前大多数使用NeRFs重建3D人体模型的技术使用单眼电影或从不同角度使用多视角相机拍摄的多个2D照片。由于这种方法在真实世界中使用时存在缺点,即人们的照片是从随机的相机角度拍摄的,因此这给产生准确的3D人体重建带来了相当大的障碍。为了解决这些问题,研究团队提出了SHERF,这是第一个能够从单个输入图像中恢复动画3D人体模型的通用化Human NeRF模型。 SHERF在一个标准化的空间中运作,它可以从任意自由视角和姿势渲染和动画化重建的模型。这与传统技术形成对比,传统技术主要依赖固定的相机角度。编码的3D人体表示包括详细的局部纹理和全局外观信息,可以成功高质量地合成视角和位置。这是通过使用一种具有多种特征的3D感知分层特征库的概念来实现的,这些特征旨在使全面编码更加容易。 团队提到了三个层次的分层特征,即全局特征、点级特征和像素对齐特征。每个特征都有不同的功能,单个输入图像获取的信息旨在通过全局特征进行改进,全局特征试图弥补不完整的2D观察留下的空白。而像素对齐特征负责保留有助于模型整体正确性和逼真性的更小细节,点级特征提供了底层3D人体解剖的重要信号。 团队开发了一种称为特征融合变压器的设备,用于高效地组合这些3D感知分层特征,这个变压器被制作成可以组合和利用多种分层特征类型的形式,确保编码表示尽可能全面和丰富。对多个数据集(包括THuman、RenderPeople、ZJU_MoCap和HuMMan)进行了全面的测试,以展示SHERF的有效性。研究结果表明,SHERF在合并独特视角和位置方面显示出高于现有最先进水平的性能。 团队总结了主要贡献如下: 引入了SHERF,这是第一个从一张图像中恢复动画3D人体模型的通用化Human NeRF模型。 通过适应更广泛的背景,扩展了Human NeRF在现实世界场景中的适用性。 SHERF使用3D感知分层特征,捕捉了细粒度和全局属性。这使得可以恢复详细纹理并填补不完整观察中的信息空缺。 SHERF在超越以前的通用化Human NeRF方法方面表现出色,并在广泛的数据集中实现了优越的视角和姿势合成结果。 总之,这项令人惊叹的研究无疑代表了在3D人体重建领域迈出的重要一步,特别是在从随机相机角度获取照片带来特定困难的真实世界情况下。

Leave a Comment

如何在没有GPT4数据的情况下对代码LLM进行指令调整? 遇见OctoPack:一组用于指令调整代码大语言模型的AI模型

<img src=”https://www.marktechpost.com/wp-content/uploads/2023/08/Screenshot-2023-08-17-at-2.47.58-AM-1024×671.png”/><img src=”https://www.marktechpost.com/wp-content/uploads/2023/08/Screenshot-2023-08-17-at-2.47.58-AM-150×150.png”/><p>已经证明,通过指令(指令调整)提供的各种语言任务的微调可以提高大型语言模型(LLM)的可用性和整体性能。通过视觉、听觉和多语言数据训练的模型都在指令调整范式中表现良好。 <p>研究人员通过教授研究人员如何编码来教授代码学习机器。间接指导代码LLM通过代码注释生成所需的代码是可能的,但这个过程是脆弱的,并且在期望的结果是自然语言时会失败。通过明确的指导调整可以提高代码LLM的可操控性,并拓宽其适用范围。 <p>研究人员更倾向于使用开源模型来生成合成数据,并避免使用限制性许可的数据。他们比较了四个常见的代码指令数据库: <ul> <li>xP3x,它汇编了广泛使用的代码基准的结果</li> <li>松散的代码LLM使学者能够生成独立的数据。</li> <li>OASST主要是一个具有最少编码示例的语言信息库。</li> <li>全新的4TB Git提交宝库,被称为COMMITPACK。</li> </ul><p><strong>研究人员的贡献</strong></p><ul> <li>对于预训练,您可以访问350种不同编程语言下以宽松许可证发布的4TB代码提交;调整使您可以访问包含高质量代码指令的COMMITPACK的筛选变体。</li> <li>六种编程语言(Python、JavaScript、Java、Go、C++和Rust)和三种场景(代码修复、代码解释和代码合成)的代码LLM泛化基准(HUMANEVALPACK)。</li> <li>最宽松的代码LLM是OCTOCODER和OCTOGEEX。 </li> </ul><p>研究人员使用GitHub提交的操作转储作为数据集的基础。为了确保提交消息非常具体,并避免处理许多文件带来的额外复杂性,他们使用了多个质量过滤器,过滤了商业友好的许可证,并删除了影响多个文件的所有提交。在提交之前和之后使用过滤信息提取受影响的GitHub源代码文件。 <p>对于需要自然语言(NL)响应的任务,指令调整LLM的输入是一个带有可选NL上下文的NL指令。当使用代码数据进行调整指令时,代码可以仅包含在输入中,仅包含在输出中,或同时包含在输入和输出中,与NL指令一起。尽管大多数现有基准重点关注代码合成变体,但客户可能希望在所有三种情况下使用模型。因此,六种语言的三个输入输出排列现在包含在代码合成基准HumanEval中。 <p>在所有三种评估情况下,OCTOCODER在所有其他宽松模型中表现出显著的优势。OCTOGEEX是经过基准测试的模型中参数最少的,仅有60亿个,但在与其他宽松代码LLM进行比较时仍然表现出最佳结果。与其他模型相比,GPT-4具有最高的性能。尽管它可能是较其他模型更大的模型,但GPT-4是闭源的。 <p>可以在https://github.com/bigcode-project/octopack找到所需的所有内容,包括代码、模型和数据。  <p>总之,大型语言模型(LLMs)通过在指令上进行微调,可以在各种自然语言任务上表现更好。研究人员使用编码来对人类指导进行微调,利用Git提交的固有结构将代码更改与人类指导相匹配。350种不同语言的4TB Git提交被编译到COMMITPACK中。对于具有16B参数的StarCoder模型,他们将COMMITPACK与其他自然和合成代码指令进行了比较。在HumanEval Python测试中,他们在没有训练OpenAI输出的模型中达到了最先进的性能。此外,他们还提供了HUMANEVALPACK,它为六种额外的编程语言(Python、JavaScript、Java、Go、C++和Rust)和三个新的编码任务(代码修复、代码解释和代码合成)添加了支持,以扩展HumanEval基准的功能。模型OCTOCODER和OCTOGEEX在HUMANEVALPACK中的所有可允许模型中都表现出了COMMITPACK的优势。</p>

Leave a Comment

这项来自UCLA的AI研究表明,大型语言模型(如GPT-3)已经获得了一种新兴的能力,可以找到广泛范围的类比问题的零射击解决方案

类比推理是人类智能和独创性的基石。当面对一个陌生的挑战时,人们经常通过系统地将其与一个更熟悉的场景进行比较来找出可行的解决方案。这种方法在人类的思维中扮演着重要的角色,涵盖了从解决日常问题到培养创造性概念和推动科学发现边界的各种活动。 随着深度学习和大型语言模型(LLMs)的进步,人们对LLMs进行了广泛的类比推理测试和研究。先进的语言模型具有独立推理和抽象模式识别的能力,成为人类智能的基本原则。 由加州大学洛杉矶分校的研究团队进行的一项研究揭示了LLMs的真正能力。这项研究因其有影响力的发现而获得了显着的认可。这些发现被收录在最新一期的《自然人类行为》杂志中,文章标题为“高级语言模型中的类比推理的出现”。该研究表明,大型语言模型(LLMs)能够像人类一样思考,而不是基于统计数据来模仿我们的思维。 该研究对人类推理者和强大的语言模型(text-davinci-003,即GPT-3的一个版本)在各种类比任务中进行了对比评估。 研究人员通过不预先训练的方式,对语言模型GPT-3进行了各种类比任务的检验,并与人类的回答进行了直接比较。这些任务涉及了一个独特的基于文本的矩阵推理挑战,从雷文标准渐进矩阵(SPM)的规则结构中汲取灵感。此外,他们还进行了一个视觉类比任务。 模型的起点是在一个海量的基于网络的真实语言数据集上进行训练的基础版本,总共超过4000亿个标记。这个训练过程是通过下一个标记预测目标来引导的,模型学会了在给定的文本序列中预测最有可能的下一个标记。 这个评估包括四个不同的任务类别,每个任务类别都经过策略性的设计,以探索类比推理的各个方面: 基于文本的矩阵推理挑战 字母串类比 四项词语类比 故事类比 在这些领域中,他们直接比较了模型的表现与人类的表现,研究了整体效果和错误模式,类似于人类进行类比推理的方式。 GPT-3在把握抽象模式方面表现出色,往往在各种情景下与人类表现相当甚至更好。GPT-4的早期试验似乎显示出更有希望的结果。从已经观察到的情况来看,像GPT-3这样的大型语言模型似乎有一种自发地解决各种类比难题的能力。 此外,他们发现text-davinci-003在类比任务中表现出色。有趣的是,早期的模型版本在某些任务场景中也表现出色,暗示了一些因素的融合增强了text-davinci-003在类比推理方面的能力。 GPT-3在处理字母串类比、四项词语类比以及在故事中发现类比的能力方面展示了一些令人印象深刻的技能,而没有进行预先训练。这些发现有助于扩大对这些先进语言模型能力的认识,暗示着更先进的模型已经具备了通过类比进行推理的内置能力。

Leave a Comment

“Salesforce AI研究人员介绍了LLM增强自主代理的演进以及创新的BOLAA策略”

最近的大型语言模型(LLM)的成就鼓励了对使用LLM处理各种复杂任务的新研究,其中以LLM增强的自主代理(LAA)引起了最大的关注。通过将LLM的智能扩展到顺序动作执行,LAA在与环境的互动和处理具有挑战性的问题时显示出卓越性能,通过收集数据来解决问题。BabyAGI1提出了一个使用OpenAI LLM2生成、优先排序和执行任务的基于人工智能的任务管理系统。另一个备受欢迎的开源LAA框架是AutoGPT3。 ReAct是一种最近提出的LAA技术,它在生成后续动作之前与环境进行交互。一种用于创建LAA的当前开源框架称为Langchain4。由于原始探测的原因,LAA还没有得到深入研究。最佳代理架构尚未确定。为了使LLM通过上下文学习学会创建下一个动作,ReAct用已经预定义的示例刺激代理。此外,ReAct认为,代理在执行动作之前应该进行中间思考。ReWOO为LAA引入了额外的规划过程。 Langchain将ReAct代理与零-shot工具使用能力结合起来。最佳代理设计应与任务和相应的LLM骨干相一致,这在先前的研究中没有得到很好的解决。其次,还需要完成有关当前LLM在LAA中的有效性的知识。早期的论文只比较了少数几个LLM骨干的性能。ReAct将PaLM用作主要的LLM。ReWOO使用OpenAI text-DaVinci-003模型进行代理规划和指令定制。对于通用的网络代理,MIND2Web将Flan-T5与OpenAI GPT3.5/4进行比较。 然而,只有少数最近的研究彻底比较了使用不同预训练的LLM的LAA的效果。最近的一篇相对较新的文章刚刚发布了用于评估LLM作为代理的基准。然而,他们必须同时考虑代理架构和它们的LLM骨干。通过从效果和效率的角度选择最佳的LLM,LAA研究得以推进。第三,随着活动变得更加复杂,许多代理可能需要协调。最近,ReWOO发现将推理与观察分离可以提高LAA的效果。 在这项研究中,Salesforce Research的研究人员提出了一个观点,随着任务复杂性的增加,尤其是在开放领域的情况下,最好协调多个代理来执行单个任务。例如,在在线导航任务中,他们可以使用点击代理与可点击按钮进行交互,同时请求搜索代理查找其他资源。然而,很少有论文探讨协同和协调多个个体的效果。本报告建议对LAA性能进行广泛的比较分析,以填补这些研究空白。他们进一步深入研究了LLM骨干和LAA代理架构。 他们根据已有的设置创建代理基准,评估了基于不同LLM骨干的不同代理架构的功能。因为他们代理基准中的任务与多个任务复杂性级别相关联,所以可以根据任务复杂性来检查代理的性能。这些代理架构被创建来彻底验证当前的设计决策。为了实现多个协作LAA之间的选择和通信,他们提出了一种名为BOLAA5的独特LAA架构,该架构在众多合作代理之上具有控制器模块。 本文的贡献如下: • 开发了六种不同的LAA代理架构。为了支持LAA的设计直觉,它们融合了从提示、自我思考和规划中得出的直觉,并将它们与多个骨干LLM集成。他们还创建了BOLAA来实现多代理策略协调,提高单个代理与行动的互动能力。 • 他们对知识推理任务和决策制定在线导航的环境进行了全面研究。他们将性能作为最终稀疏奖励和中间回忆提供,从而为最佳LAA和适当的LLM选择提供了定性建议。 • 与其他LAA设计相比,BOLAA在WebShop环境中始终表现出最佳性能。他们的研究结果凸显了开发专门的代理来共同解决复杂问题的重要性,这与开发具有强大泛化能力的大型LLM一样重要。

Leave a Comment

人工智能如何帮助顾客在亚马逊更好地购物

顾客评价已成为在线购物的基石,为购买者提供宝贵的洞察力。电商先锋亚马逊始终在不断改进顾客评价体验。从1995年引入产品意见的概念,到实施先进的人工智能技术,亚马逊致力于提升购物体验的承诺不断塑造着我们进行在线选择的方式。 阅读更多: 亚马逊将通过AI搜索进行“一次性的改变” 赋能顾客的旅程 亚马逊的顾客评价之旅始于1995年,引入了一种让顾客发表对产品的诚实意见的革命性概念。虽然最初受到怀疑,但这一功能最终成为在线购物的基本支柱。它使顾客能够从彼此的经验中学习,并根据真实的反馈做出明智的决策。 阅读更多: Instacart通过AI搜索革新购物:见识Ask Instacart 评价的持续演进 多年来,亚马逊对其评价系统进行了重大改进。它引入了评价标题、照片和视频等功能,以全面了解产品。2019年还新增了星级评分系统,以吸引更广泛的评价者。目标是简化流程,使意见分享更加便捷。 评价中的人工智能的力量 最近,亚马逊利用生成式人工智能的潜力进一步提升了顾客评价体验。借助人工智能技术的进步,亚马逊开发了一种人工智能生成的评价亮点功能。该功能将顾客评价的精髓浓缩为简明的段落,反映出共同的主题和情感,使购物者能够快速掌握产品的特点。 阅读更多: 谷歌发布新闻写作人工智能“Genesis” 理解人工智能生成的评价亮点 人工智能生成的评价亮点功能为寻求详细评价之前寻找信息的顾客提供了快速洞察。该功能仅适用于美国的部分移动购物者。它提取评价中经常提到的关键属性和情感,并将它们简明呈现。例如,如果顾客对产品的易用性感到好奇,他们可以点击该特定属性以访问相关评价。 阅读更多: 谷歌Chrome现在显示基于人工智能的文章摘要,轻松阅读 保持真实性和信任 尽管创新至关重要,亚马逊始终坚守保持评价生态系统的真实性和完整性。该电商平台执行社区准则,以确保真实和相关的评价。亚马逊的机器学习模型和人工审核员密切合作,共同维护这些准则,防止虚假评价误导顾客。 展望未来 随着亚马逊的人工智能模型不断发展和学习,人工智能生成的评价亮点功能有望扩展到更多的类别和顾客群体。该公司通过技术不断致力于提升购物体验的承诺,这显然已经成为塑造零售行业格局的核心。 阅读更多: 亚马逊推出突破性的人工智能工具,革新生成式人工智能和软件开发 我们的观点…

Leave a Comment

Tabnine推出Tabnine Chat:一个针对企业级的、以代码为中心的测试版聊天应用程序,允许开发人员使用自然语言与Tabnine的AI模型进行交互

Tabnine,由人工智能驱动的代码补全工具,推出了其套件的一个新功能:Tabnine聊天,处于其测试版。它是一个企业级的、以代码为中心的代码应用,可以与开发人员的集成开发环境(IDE)无缝集成。该应用程序通过使用可解释的现有代码、搜索代码仓库并根据自然语言规范生成新代码,扩展了其功能。 Tabnine Chat的一个关键亮点是其对安全性和合规性的高度关注。 该功能适应了各种企业需求,保护私有代码库、可允许的开源代码和堆栈溢出查询。模型仅在具有许可证的开源代码上进行了训练,消除了对代码库信息的担忧。 Tabnine聊天的前端是一个嵌入在Web视图中的React应用程序,目前可在VS code和JetBrains IDE中使用,并支持所有编程语言。 它具有几个重要特点: 安全性和合规性:Tabnine环境确保了代码的完全私密性和安全性。通过使用虚拟私有云或本地设置,它们提供了隔离的部署环境,优先考虑安全性和机密性。 上下文集成:Tabnine聊天在IDE内运行,从而与开发人员的正在进行的代码集成。 仓库集成:Tabnine企业用户可以将其仓库链接到此应用程序。拥有大量内部API、库和服务的组织可以通过将内部仓库连接到Tabnine Chat来提高生产力。 随着Tabnine Chat的测试阶段的到来,开发人员正处于编码转变的边缘。在开发者与人工智能之间的不断发展的旅程中,Tabnine Chat作为一个能够实现开发者与代码之间无缝对话的先驱脱颖而出。在不久的将来,Tabnine企业版和专业版用户将迎来更广泛的扩展,对于先进的编码交互产生了兴奋。

Leave a Comment

稳定AI推出StableChat:类似于ChatGPT或Claude的研究预览对话型AI助手

Stability AI推出了Stable Chat,这是一个与ChatGPT非常相似的平台。然而,在初步评估中发现,该平台还需要进一步完善和增强。 Stable Chat提供的界面允许用户进行基于文本的对话,与ChatGPT的格式非常相似。尽管如此,该平台仍存在一些限制。特别是,它需要一个聊天记录功能和建立独立聊天会话的能力。一个明显的不便之处是,在刷新界面时会丢失对话数据。 这个创新的聊天界面的核心是最近发布的Stable Beluga模型,这是Stability AI的杰作。在线评论员的初步反馈表明,该模型虽然能够理解俄语单词,但它的熟练程度更倾向于识别个别单词而不是构建连贯的语言结构。 与Beluga模型的交互揭示了几个关键观察点: 该模型遵守严格的安全协议,对生成特定类型的内容表现出谨慎的程度。例如,观察到它在最初拒绝生成色情内容。 该模型的内容生成显示出多样性,在面对相同的提示时提供各种各样的回应。这种差异有时会扩展到根据其自身判断改变内容格式的程度。这包括将信息构建为列表、创建带有解释内容的段落,或者制作包含词汇列表的部分。 关于语言风格,该模型有时需要更加一致。有人注意到生成内容的语气和结构似乎会发生变化,这表明有待改进的地方。 该模型的回应独特之处在于偶尔会包含引入不可预测因素的短语。例如,在与棋盘游戏相关的查询中,该模型产生了独特的表达,如“薄荷饮料者”、“Medusonki”和“羊小崽子”。 有趣的是,该模型有时会将用户引导到外部资源。例如,它建议使用Google翻译来扩展特定主题的词汇选择。 一个显著的问题是该模型的稳定性和一致性。用户报告了偶尔的断开连接和在聊天窗口中不活动时的短暂超时情况。 与成熟的ChatGPT相比,可以看出Stable Chat仍有待进一步完善的地方。虽然Stability AI的研究预览展示了希望并提供了独特的内容生成,但偶尔存在不一致性。

Leave a Comment

认识一下Cheetor:一种基于Transformer的多模态大型语言模型(MLLMs),它能够有效处理各种交织的视觉语言指令,并实现最先进的零样本性能

通过以教学风格对语言任务组进行指导调优,大型语言模型(LLMs)最近展示了出色的多样化活动通用模型的能力。指导调优通过在单一指导-回应格式中微调各种任务,为LLMs在新任务指令上实现了大量的零-shot泛化能力。由于在众多实际应用中具有长期的目标,这一结果引发了对将纯文本指令跟随模型扩展到多模态模型的新一轮研究热潮。为了实现这个目的,Flamingo和BLIP-2为LLMs提供了冻结的视觉编码器以理解视觉输入。通过对多模态指导跟随数据集进行微调,LLaVA、MiniGPT-4和InstructBLIP进一步增强了模型的指令跟随能力。 由于多模态大型语言模型(MLLMs)主要集中在仅包含单张图片作为视觉背景并且指令多样性有限的视觉-语言指令上,这些指令跟随助手的可用性受到了限制。相比之下,人们在现实生活中通常通过一系列相关的信息和视觉元素来表达他们的需求。例如,人们可能需要模型参考多个来源的多模态知识(如视觉吸引人的网站、教科书和课堂幻灯片)来回答开放领域的问题。这些多个参考和查询所代表的是交错的视觉-语言指令,其中包含了多个语义相关的图片和文本。 来自浙江大学、新加坡国立大学和南洋理工大学的研究人员开发了I4(语义互连、交错的图像-文本指令跟随),这是一个包含31个任务的大规模基准测试,涵盖了20个不同场景,以帮助研究交错的视觉-语言指令跟随。I4具有三个关键特点:(1)指令由相互关联的图片和文字序列组成,例如带有脚本的故事板和带有图表的教科书。这被称为交错的视觉语言上下文。(2)有很多复杂的指令,任务范围从对话式的实体活动到识别监控照片中的差异到预测漫画的对话。(3)该基准测试涵盖了各种指令跟随场景,包括卡通、商业图像、驾驶镜头、食谱指令等。他们利用建议的基准测试系统地评估了现有的MLLMs,并发现它们需要帮助来执行如此复杂的多模态指令。他们认为视觉提示生成器(VPG)对于MLLMs理解复杂指令至关重要,尽管现有的MLLMs主要集中在构建更多样化和高质量的指导调优数据的复杂方法上。现有方法提出了几种VPGs(如线性投影、重采样器和Q-former),以从包含在视觉骨干(如ViT)中的丰富图片信息中提取相关的视觉线索,以调整LLMs以理解视觉输入。 通过挑战冻结的LLM,在视觉线索的条件下生成标题,他们训练了VPG与数百万个图像-标题配对。尽管高效,网络爬取的标题通常只描述图像的一小部分前景。因此,由于只教授提取典型标题的显而易见信息,VPG可能无法提取某些活动所需的精确信息。此外,在I4中,由于任务要求VPG关注上下文中其他图像的特定视觉细节(例如传达两张照片之间的微小差异),这个问题变得更加严重。 他们提出了一个轻量级的可控知识再注入(CLORI)模块,利用LLMs的复杂推理能力来控制VPG(即Q-former),以重新提取与指令特定语义有关的缺失视觉信息,以解决现有MLLMs中VPG的关键问题。更具体地说,他们使用Q-former提供与任务无关的视觉线索,为LLM提供关于图片的重要信息。他们首先从语言模型中构建指令特定条件来控制Q-former,并有条件地从图片中提取特定的信息。然后将这些条件带入LLM中。通过使用内部交叉注意力图,他们首先确定Q-former在图片中主要忽略的区域。然后,他们使用ChatGPT和SAM来识别编辑目标并生成正确的编辑描述。接下来,根据编辑指令对原始图像进行局部调整,使用混合扩散生成对抗性图像。然后,开发了一个图像间的区别判别预训练任务,描述了创建的对抗性图像与原始图像之间的微小差异。由于修改的位被选自最被忽视的位置,CLORI模块必须基于对抗性图像和任务指令提取缺失的视觉信息。 他们建议使用Cheetor,这是一个基于Transformer的多模态语言理解模型,通过可调的知识重新注入,能够成功地从各种复杂的视觉语言指令中创建整体语义。轻量级的CLORI模块可以使用少于100万个图像-文本配对的CAGIT技术进行高效调优。在单个A100 GPU上,只需几个小时即可完成,无需庞大的多模态指令调优数据。与以往的多模态语言理解模型相比,他们的模型在具有挑战性的I4基准测试中表现更好,并且计算和数据效率更高。此外,他们还使用MME基准测试评估了Cheetor,模型表现出色。 他们的贡献总结如下:(1) 他们构建了I4,一个包含31个挑战的全面的交叉视觉-语言指令基准测试,涵盖了各种真实世界的场景。(2) 他们提供了一个最小控制的知识重新注入(CLORI)模块,针对LLM生成的情况,将指令特定的视觉信息补充重新注入到LLM中。(3) 仅使用30k张图片,他们成功地教会了CLORI模块,使用了交叉注意力引导的反事实图像训练技术。(4) 他们的Cheetor在具有挑战性的I4测试中取得了最先进的性能,只需7个A100 GPU小时,即使没有高质量的多模态指令调优数据。

Leave a Comment

Meta AI的鲸鱼!通过指导反向翻译实现LLMs的自对齐,引起轰动!

大型语言模型(LLMs)展现出出色的泛化能力,如上下文学习和思维链推理。为了使LLMs能够遵循自然语言指令并完成现实世界的任务,研究人员一直在探索LLMs的指令调整方法。这是通过对模型进行微调,在各种函数上使用人工注释的提示和反馈或使用公共基准和数据集进行监督微调,以及手动或自动生成的指令进行数据增强。最近的研究强调了人工注释数据质量的重要性。然而,发现注释遵循此类质量数据集的指令很难扩展。 这个解决方案涉及到与LLM的自我对齐,即利用模型来改进自身,并使其响应与期望的行为(如模型编写的反馈、批评、解释等)保持一致。Meta AI的研究人员引入了自我对齐与指令反向翻译。基本思想是通过大型语言模型自动为Web文本标注相应的指令。 自训练方法假设可以访问基础语言模型、一组未标记的示例(例如Web语料库)和少量种子数据。这种方法的第一个关键假设是,这些大量人工编写的文本中的某些部分将对某些用户指令进行黄金生成。第二个假设是我们可以预测这些响应的指令,这可以用来使用高质量的示例对训练一个遵循指令的模型。 整个指令反向翻译可以分为以下步骤: 自我增强:为未标记的数据(即Web语料库)生成“好的指令”,以产生(指令,输出)对的训练数据,用于使用大型语言模型Meta AI(LLaMA)进行指令调整 自我创建:对使用LLaMA生成的数据进行评估 然后,使用改进的模型对LLaMA进行微调,并迭代该过程。结果训练的基于Llama的指令反向翻译模型被称为“Humpback”(因为鲸鱼相对于骆驼具有大规模的特性)。与Claude、Guanaco、Falcon-Instruct、LIMA等现有的非蒸馏模型相比,“Humpback”在Alpaca排行榜上表现出色。 当前方法的缺点是增强数据是从Web语料库中获取的,因此微调的模型可能会强调Web数据的偏见。总之,这种方法保证我们永远不会用尽训练数据,进一步为对大型语言模型进行指令跟随的微调提供了可靠的可扩展方法。未来的工作将通过考虑更大的未标记语料库来进一步扩展这种方法,这可能会带来进一步的收益。

Leave a Comment

揭示Deepfakes 利用头部姿势估计模式提高检测准确性

能够生成“伪造”视频的能力的出现引发了人们对视觉内容可信度的重大担忧。在解决这个问题时,区分真实和伪造信息至关重要。利用深度学习和面部标记的各种算法在应对这一挑战时展示了令人着迷的结果。检测伪造视频的主要挑战在于令人信服的深度伪造技术可能造成的潜在危害,这些技术可以用于欺骗、证据篡改、侵犯隐私和散布错误信息。检测这些视频需要结合分析面部动作、纹理和时间一致性等技术,通常利用卷积神经网络(CNN)等机器学习方法。 最近的研究集中在使用各种方法检测深度伪造。有些方法将深度伪造视为异常情况,并寻找深度、背景和局部-全局信息的不一致性。还有些方法将深度伪造视为一种独特的模式,利用深度学习技术分析面部特征和颜色空间。这些努力为区分真实内容和深度伪造视频做出了贡献。 在这个背景下,最近发表了一篇新论文,提出了一种新的解决方案,即利用头部姿势估计(HPE)作为区分真实视频和深度伪造视频的独特标识符。作者建议通过分析视频中个人的头部姿势来帮助区分真实和深度伪造内容。这种方法关注头部定向角度,以发现在视频处理过程中引入的不一致性。该研究旨在使用各种方法和数据集评估这种技术的有效性,为改进深度伪造检测策略做出贡献。 所提出的方法的主要思想是将头部姿势估计作为检测深度伪造视频的特征。 HPE涉及确定图像或视频中人物的头部位置和方向。这些信息可以用于识别深度伪造处理引入的差异,因为即使是头部对齐的微小变化也可能很难准确复制。该研究分析了三种HPE方法,并在热门的FF++深度伪造数据集上进行了水平和垂直分析。目标是确定最有效的深度伪造检测方法。 作者进行了实验,使用头部姿势模式来检测深度伪造视频。他们使用了包含真实和篡改视频的“FaceForensics++”数据集。他们采用KNN与动态时间规整(DTW)来对齐序列,并使用深度学习模型(1D卷积和GRU)来捕捉时间模式。这些方法旨在根据头部姿势将视频分类为真实或伪造。最好的结果来自基于HPE的方法,使用了KNN-DTW的FSA-Net。该方法优于几种最先进的方法,表现出对数据集不同子集的稳定性和可迁移性。该研究表明,头部姿势模式对于深度伪造检测是有效的,特别是对于像FaceSwap这样不太逼真的攻击。 总之,在这篇文章中,我们介绍了一种最近针对深度伪造视频威胁的新方法。这种方法利用HPE分析视频中的头部定向来识别深度伪造。这个研究团队评估了三种HPE方法,使用了FF++深度伪造数据集并进行了涉及KNN与动态时间规整(DTW)的实验以及深度学习模型。基于HPE的方法,使用了FSA-Net与KNN-DTW,展示了优于最先进方法的性能。这凸显了使用头部姿势模式有效地检测深度伪造的潜力,特别是在像FaceSwap这样不太逼真的操作中。

Leave a Comment

这篇AI论文表明,量子机器学习模型可能更好地抵御由经典计算机生成的对抗性攻击

机器学习(ML)确实正在快速扩展和整合到许多领域,革新了我们解决问题的方式,并增强了我们从数据中提取有价值洞见的能力。这种变革性技术在现代科学、技术和工业中越来越普遍,推动创新并重塑各个行业。 然而,尽管它们的用途、准确性和复杂性,这些机器学习和神经网络却很容易被对抗性攻击欺骗,这些攻击恶意篡改其数据,导致它们出乎意料地失败。这对神经网络的有效性和准确性构成了重大问题。对这种攻击的持续易受性也引发了关于在可能危及生命的情况下实施机器学习神经网络安全性的重大关切。这包括自动驾驶车辆等使用案例,其中系统可能因对停止标志进行表面上无害的改变而被引导进入一个交叉路口,突显了对严格保护措施和对策的必要性。 因此,人们已经做出了重大努力,以加强神经网络对这些对抗性攻击的防御。已经研究和提出了各种量子机器学习算法,包括量子化的标准经典方法来应对对抗性攻击。量子机器学习理论表明,量子模型可以比任何现有的经典计算模型更快地获取特定类型的数据。 而经典计算机使用二进制位处理数据,二进制位有两种可能状态(“零”或“一”),而量子计算机则利用“量子比特”。这些量子比特表示两级量子系统中的状态,并且它们具有可以被利用来更有效地解决特定问题的特殊额外属性。 澳大利亚的研究人员调查了QAML(量子对抗性机器学习)在包括MNIST、FMNIST、CIFAR和Celeb-A图像在内的各种著名图像数据集上的应用。此外,研究人员对这些不同数据集实施了三种不同类型的对抗性攻击:PGD、FGSM和AutoAttack。这些图像分类模型可以很容易地被篡改和操纵其输入图像。 研究人员进行了涵盖各种图像数据集的全面系列量子和经典模拟,并制定了一系列多样化的对抗性攻击,以对结果进行严格评估。研究结果包括对比量子(经典)网络与经典(量子)对抗性攻击。对抗性攻击通过识别和利用机器学习模型使用的特征来发挥作用。 这种方法的基础是,在正常情况下,两个网络(量子和经典)将做出相同的预测。但当条件发生改变时,结果将有所不同,因此可以进行调查。 经典和量子系统之间防御机制的明显差异源于量子变分分类器(QVCs)获得了独特且显著有意义的特征谱,使其与经典网络有所区别。这种差异源于经典网络对信息量更大但相对不太强大的数据特征的依赖。 然而,普通量子机器学习模型利用的属性仍然超出了经典计算机的能力,因此对于仅配备经典计算资源的对手来说是不可察觉的。 这项研究的观察结果暗示了量子在机器学习任务领域具有潜在优势。这是由于量子计算机相对于经典计算机更有效地学习更广泛的模型的独特能力。然而,需要注意的是,这些新模型在许多现实世界的机器学习任务(如医学分类问题或生成式人工智能系统)中的实际效用尚不确定。

Leave a Comment

通过自我纠正方法增强大型语言模型(LLMs)

“`html 近年来,大型语言模型(LLMs)在各种自然语言处理(NLP)、自然语言理解(NLU)和自然语言生成(NLG)任务中取得了惊人的成果。这些成功一直在各种基准测试中有所记录,并展示了在语言理解方面令人印象深刻的能力。从推理到突出不良和不一致的行为,LLMs已经取得了长足的进步。尽管LLMs已经取得了巨大的进步,但仍然存在一些不利和不一致的行为,这些行为削弱了它们的实用性,例如创建虚假但可信的材料、使用错误的逻辑以及创建有毒或有害的输出。 克服这些限制的一个可能方法是自我校正的思想,即鼓励或引导LLM修复其自身生成的信息中的问题。最近,使用自动化反馈机制的方法,无论是来自LLM本身还是其他系统,都引起了很大的兴趣。通过降低对大量人类反馈的依赖,这些技术有潜力提高基于LLM的解决方案的可行性和实用性。 通过自我校正的方法,模型通过自动生成的反馈信号进行迭代学习,了解其行为的影响,并根据需要改变其行为。自动化反馈可以来自各种来源,包括LLM本身、独立的反馈模型、外部工具以及维基百科或互联网等外部信息源。为了通过自动反馈来纠正LLMs,已经开发了一些技术,包括自我训练、生成-排序、反馈引导解码和迭代事后修订。这些方法在推理、代码生成和毒素检测等各种任务中取得了成功。 加利福尼亚大学圣塔芭芭拉分校的最新研究论文专注于对这一新兴方法群进行全面分析。该团队对许多使用这些策略的当代研究项目进行了深入研究和分类。校正训练时间、生成时间校正和事后校正是已经研究过的自我校正技术的三个主要类别。通过在模型的训练阶段接触输入,已经提高了校正训练时间中的模型。 该团队强调了这些自我校正技术取得成功的各种情景。这些程序涵盖了广泛的主题,如推理、代码生成和毒性检测。该论文通过提供对这些技术的广泛影响的洞察,突出了这些策略的实际意义和在各种环境中的应用潜力。 该团队分享了生成时间校正的内容,即在内容生成过程中根据实时反馈信号对输出进行精炼。事后校正涉及使用后续反馈对已经生成的内容进行修订,因此,这种分类有助于理解这些技术运作和改善LLM行为的微妙方式。随着自我校正程序领域的发展,存在改进和增长的机会,通过解决这些问题和改进这些方法,该领域可能会更进一步,从而导致LLMs及其在现实世界中的应用更加一致的行为。 “`

Leave a Comment

2023年8月值得尝试的前50款AI写作工具

Grammarly Grammarly是一款提升写作的优秀工具。它可以检查语法、拼写、标点符号和风格,以确保内容清晰和专业。 Jasper Jasper AI是最受欢迎的AI写作工具之一,可轻松创建适用于网站、博客、社交媒体等的内容。 ChatGPT ChatGPT是一个强大的语言生成模型,可用于各种写作任务。它可以处理对话生成、语言翻译、摘要等。 GPT-4 GPT-4可以生成与人类写作非常相似的文本,成为作家的强大资产。许多顶级AI写作工具正在通过整合GPT-4技术来提升其软件功能。 Growthbar Growthbar是一个理想的工具,可用于创建针对SEO优化的博客内容。 ClosersCopy 这款AI写作工具可用于各种任务,包括撰写博客文章、社交媒体内容、创建演示文稿、撰写书籍等。 Writesonic Writesonic可以帮助用户生成高质量的文章、博客等内容。它可以用多种世界流行语言(如英语、西班牙语、法语等)编写内容。 Article Forge Article Forge可以帮助用户生成关于任何主题的经过SEO优化、高质量且独特的内容。 ParagraphAI ParagraphAI是一款适用于iOS、Android和Chrome的AI写作应用,可帮助用户更好、更快地撰写电子邮件和文章。 Scalenut Scalenut是一个内容智能平台,帮助用户找到并创建与其受众最相关的内容。 Content at…

Leave a Comment

15款由人工智能驱动的音频编辑工具

声音工程师和音乐制作人使用智能软件程序的AI音频工具来增强创作过程的许多方面,例如生成旋律和和声,改善声音质量等。由于它们能够分析大型数据集并检测复杂模式,这些技术在寻求优化工作流程的音乐制作人和音频设计师中越来越受欢迎。 LANDR LANDR拥有2000万个经过掌握的录音和易于使用的界面,简化流程。LANDR是一种AI掌握技术,被顶级工作室工程师使用,他们已经掌握了Lady Gaga、Gwen Stefani、Snoop Dogg、Seal、Post Malone等许多新兴音乐家的歌曲。该工具的直观拖放界面使音频掌握更容易进行音频专业人员和音乐家。LANDR的掌握链之所以与众不同,是因为它经过精心构建以最大限度地提高创造力。而且与任何其他服务不同,LANDR为每个支持的平台提供定制的掌握插件。 Studio Sound Descript是一个基于云的视频创作平台,使用人工智能加速内容创作过程,其中一个提供的工具称为Studio Sound。Studio Sound消除了背景噪音和回声,以便专注于讲话者的声音。使用再生算法,该技术增强语音清晰度并消除背景噪音。对于播客制作者、YouTuber和其他内容创作者来说,这是一个很棒的工具,可以节省音频编辑时间。它改善用户的声音,并消除音频、视频和屏幕录制中的背景噪音和房间回声。 Splitter 音频工程师可以使用机器学习程序Splitter将音乐中的乐器分离出来。该软件提供四种不同的模型,以提高音频专业人员的效率。5声部模型很好地说明了这个概念,因为它可以准确地隔离出人声、鼓、钢琴、贝斯和其他乐器/效果,包括吉他和合成器。2声部范例通过解耦人声和乐器部分来完成同样的事情。音乐家、DJ、艺术家、法医专家、音频工程师、卡拉OK爱好者、警察和科学家是该公司旨在为其产品服务的一些群体。Splitter的创始人是一位在科学技术和音乐行业拥有丰富经验的著名音乐制作人和音频工程师。 Sonible的smart: EQ3 EQ3是一个智能均衡器,利用AI滤波器来机械地修正音调不平衡。通过消除刺耳的共振和凹槽来实现平衡的声音。通过利用智能交叉通道处理,用户可以轻松地组织多达六个通道,确保每个轨道都得到恰当的使用。算法分析来自分组通道的频谱数据,以确定在混音中给予每个轨道多少空间。用户可以根据自己的艺术目标设置听觉层次结构。 Orb Producer Suite 3 Orb Producer Suite 3是Hexachords开发的一个产品。这家总部位于巴塞罗那的公司专门为艺术家、作曲家和音乐制作人创建基于人工智能的工具,套件中包括四个插件。Orb…

Leave a Comment

剑桥研究人员正在将不确定性引入机器学习系统中进行开发

在一个不确定的人类洞察力世界中,接受不确定性可能有助于机器和人类更有效、可靠地共同工作。尽管当前的系统被编程为假设人类干预始终准确自信,但这项研究考虑了这种互动中的不确定性。剑桥大学的研究人员团队创建了“UElic”平台,用于收集现实世界中的人类不确定性数据,并展示其在改善模型处理不确定性能力方面的价值。它强调了允许人类表达不确定性在提高机器学习模型可靠性方面的重要性。 研究人员介绍了旨在提高可解释性并实现人类干预以纠正错误的基于概念的模型。它涉及到使用输入(x)、概念(c)和输出(y)进行监督学习,其中概念可以是二进制或分类的,可能包括不确定性。他们使用了一个图像分类数据集,以便人类可以在标记特定图像时提供反馈并指出不确定性。这些模型使用神经网络预测概念,重点关注概念嵌入模型(CEMs)和概念瓶颈模型(CBMs)的扩展。 研究问题探讨了基于概念的模型如何在测试时处理人类不确定性以及它们如何更好地支持人类不确定性和不确定性水平。研究人员使用了一些具有不同不确定性的基准机器学习数据集:Chexpert用于分类胸部X射线,UMNIST由MNIST数字组成,用于数字分类。为此,研究人员在使用鸟类数据集时模拟了不确定性,参与的人类通过将鸟类分类为红色或橙色来表示确定性。 该研究涵盖了受控模拟和真实人类不确定性,调查了粗粒度和细粒度的不确定性表达。成功处理离散不确定性得分的设计选择影响性能,考虑到映射、广泛与狭窄的不确定性以及实例与总体层面的不确定性。研究学者强调了将人类不确定性纳入基于概念的模型的重要性,以及需要像CUB-S这样的综合数据集来研究这些挑战。作者从这项研究中发现一些开放性挑战:(1)人类和机器不确定性的互补性,(2)对待人类(误)校准,以及(3)扩展不确定性引导。研究人员解释了常见基于概念的模型的缺点,并介绍了UElic界面和CUB-S数据集,以促进在人类不确定性干预方面的进一步研究。

Leave a Comment

“视觉语言交叉领域的突破:呈现全视能项目”

推动AI聊天机器人的腾飞,LLMs成为了热门话题。它们在用户定制的自然语言处理功能方面表现出令人惊叹的能力,但似乎缺乏理解视觉世界的能力。为了弥合视觉和语言领域之间的差距,研究人员提出了全知(AS)项目。 全知项目旨在开放式全景视觉识别和理解,旨在创建一个模拟人类认知的视觉系统。”全景”一词指的是在一个视图中包括所有可见的内容。 全知项目包括: 全知1B(AS-1B)数据集覆盖了现实世界中350万个常见和罕见的概念,并且有1322亿个描述这些概念及其属性的标记。 全知模型(ASM)是一个统一的基于位置的图像文本基础模型。该模型由两个关键组成部分组成:一个基于位置的图像标记器和一个基于LLM的解码器。 该数据集包含了超过10亿个区域注释,以各种格式呈现,例如语义标签、位置、问答对和字幕。与以前的视觉识别数据集(如ImageNet和COCO)以及视觉理解数据集(如Visual Genome和Laion-5B)相比,AS-1B数据集因其丰富而多样化的实例级位置注释以及相应的详细对象概念和描述而脱颖而出。 AS模型的体系结构包括多个层次的统一框架,支持图像级别和区域级别的对比和生成图像文本任务。通过利用预训练的LLMs和强大的视觉基础模型(VFMs),该模型在图像文本检索和零分类等判别任务以及视觉问答(VQA)、视觉推理、图像字幕、区域字幕/VQA等生成任务中展现出有希望的性能。此外,研究人员声称,在类别不可知检测器的帮助下,还可以在短语定位和参考表达理解等基础任务中看到潜力。 全知模型(ASM)包括三个关键设计: 基于输入图像和边界框,位置感知图像标记器从图像和区域级别提取特征。 可训练的任务提示被合并到视觉和文本标记的开头,以指导模型区分判别性和生成性任务。 采用基于LLM的解码器,提取判别性任务的视觉和文本特征,并自回归生成响应标记以执行生成任务。 通过分析和比较提出的ASM与基于CLIP的基准模型(展示了GPT-2和3的零射能力)以及领先的多模态大型语言模型(VLLMs)在代表性视觉任务上的表现,进行了广泛的数据分析,包括质量、扩展性、多样性和实验。研究结果突出了我们模型在区域级别的文本生成能力,同时展示了它理解整个图像的能力。人类评估结果表明,我们ASM生成的字幕优于MiniGPT4和LLaVA生成的字幕。 该模型通过使用开放式语言提示和位置进行训练,使其能够在各种视觉和语言任务中具有显著的零射能力,包括区域-文本检索、区域识别、字幕和问答。据研究人员称,这使LLMs拥有了“全知之眼”,并彻底改变了视觉和语言的交叉领域。

Leave a Comment

波士顿大学的研究人员发布了鸭嘴兽家族的精调LLMs:实现基础LLMs的廉价、快速和强大的改进

大型语言模型(LLM)席卷世界。这些超高效和高效的模型是人工智能的现代奇迹。它们具备理解上下文、生成文本和连贯对话的能力,已经能够重新定义人与机器之间的沟通。研究人员一直致力于通过一种被称为参数高效调整(PEFT)的过程改善基础大型语言模型的性能,该过程涉及在小而强大的Open-Platypus数据集上优化LLM。 最近,来自波士顿大学的研究人员团队推出了Platypus,这是一组独特的改进和结合的大型语言模型,其性能无与伦比,并且目前在HuggingFace的Open LLM排行榜上保持领先地位。精心策划的数据集Open-Platypus是其中的基石之一,该数据集经过精心挑选,从各种其他免费数据集中选择出来,并且已经向公众开放。它是更大数据集的较小子集,专注于改善LLM性能的关键要素。 在利用特定领域信息的同时,团队的目标是保持预训练LLM的强大先验知识,并对LoRA模块进行微调和合并。通过微调,可以将模型定制为特定任务,同时保留初始训练中积累的更全面的知识。当合并LoRA模块时,将多个组件结合在一起,产生更强大的LLM。由于协同作用,模型的潜在潜力和专业领域知识可以被揭示出来。 工作的一个关键方面是对测试数据的严格验证工作以及识别训练数据中的潜在污染。一些全面的检查支持Platypus系列模型的可靠性和准确性,并且披露此验证过程的方法可能作为进一步的现场研究指南。 Platypus系列模型覆盖了各种模型大小,在量化LLM指标方面表现出色。它在全球Open LLM排行榜上名列前茅,这一壮举证明了该策略的有效性。团队分享了他们的模型在使用较小部分的微调数据和计算资源时与其他最先进的微调LLM一样出色的性能。例如,一个13B的Platypus模型只需使用一张A100 GPU和仅25k个问题就可以在令人瞩目的5小时内成功训练。这种令人难以置信的效率凸显了Open-Platypus数据集的优秀水平,并为该领域的进一步发展铺平了道路。 贡献可以总结如下: 引入了Open-Platypus,这是一个包含11个公共文本数据集的紧凑数据集,旨在增强LLM的STEM和逻辑知识。 这个主要由人设计的问题组成的数据集,在最小的微调时间和成本下提供了强大的性能。 团队分享了排除类似数据以减小数据集大小和冗余的过程的描述。 探索了LLM训练集中数据污染的挑战以及数据过滤过程。 分享了针对专业微调LoRA模块的选择和合并方法的解释,为提高LLM的整体性能做出了贡献。

Leave a Comment

这篇人工智能论文提出通过在多种非英语语言中建立语义对齐来增强预训练的LLMs的能力

I had trouble accessing your link so I’m going to try to continue without it. 你有没有尝试在ChatGPT中用英语以外的语言提问?你可能会得到一个奇怪、无关的答案,因为这些模型通常对英语有偏见。如果LLMs可以在任何语言中工作,那不是更容易吗? 中国国家重点实验室的新型软件技术研究人员提出了一种针对非英语语言的预训练LLM。由于预训练语料库和指令调整数据都是英文的,LLMs在非英语语言中的通常性能较差。可以通过持续使用大规模单语数据进行预训练来改善它。 研究人员通过翻译任务对LLMs进行指令调整,以改善两种语言之间的对应关系,并使用跨语言通用任务来提高指令的能力。他们使用LLaMA-7B作为他们的预训练LLM,并考虑了六种与英文字母类似的语言。LLaMA代表大型语言模型元AI。 对于每种语言,使用特定语言的数据获得一个x-LLaMA,然后与LLMs进行进一步比较。这种语言建模需要根据前缀序列预测下一个标记。它需要在大规模语料库和翻译数据上训练LLM。翻译数据是学习语义对齐最有用的资源之一,通过使用人工专家注释的翻译数据来进行指令调整,可以提高LLM的翻译性能。 研究人员使用公开可用的句级翻译数据集构建翻译任务指令数据。这使得他们的方法可扩展、可重复和可扩展到更多语言。他们发现将非英语文本排列在翻译数据的目标侧可以提高LLM在非英语任务上的性能,而不是将其放在源侧。 研究人员使用双语翻译性能作为了解语义对齐的参数。他们发现翻译任务指令数据的规模也极大地影响对齐。他们得出了一个关于翻译性能和数据规模的表达式,其呈指数形式的对数依赖关系。他们发现,与英语相同的语言相比,较不相似的语言需要更多的翻译数据来建立语义对齐。 为了比较x-LLaMA,研究人员设计了Alpaca-7B(一个LLaMA),它使用英语指令进行调整;Parrot-7B,它使用人工注释的翻译数据进行调整;以及Bayling-7B,它使用人工交互翻译进行调整。他们发现,在六种非英语语言中,x-LLaMA的性能优于Alpaca-7B的42.50%。x-LLaMA在非英语任务上的准确性与Alpaca-7B在英语任务上的准确性相同。 最后,这证明了跨语言指令调整是一种有效的方法。他们的方法和发现揭示了为非英语语言开发更强大的LLMs的潜力。

Leave a Comment

IBM研究人员推出了一款用于深度学习推理的模拟AI芯片:展示了可扩展混合信号架构的关键构建模块

I had trouble accessing your link so I’m going to try to continue without it. 正在进行的人工智能革命将重塑生活方式和工作场所,深度神经网络(DNN)在其中发挥了关键作用,尤其是基础模型和生成式人工智能的出现。然而,承载这些模型的传统数字计算框架限制了它们的潜在性能和能源效率。虽然出现了专门的人工智能硬件,但许多设计将内存和处理单元分开,导致数据洗牌和效率降低。 IBM研究一直致力于寻找创新的方法来重新构想人工智能计算,从而提出了模拟内存计算或模拟人工智能的概念。这种方法从生物大脑中的神经网络中汲取灵感,其中突触强度控制神经元之间的通信。模拟人工智能使用纳米级电阻器件(如相变存储器)将突触权重存储为电导值。相变存储器设备在非晶态和晶态之间转换,编码一系列值,并实现具有非易失性的权重的本地存储。 IBM研究在最近的《自然电子学》出版物中取得了使模拟人工智能成为现实的重要进展。他们推出了一款先进的混合信号模拟人工智能芯片,专为各种DNN推理任务量身定制。该芯片在IBM的奥尔巴尼纳米技术中心制造,具有64个模拟内存计算核心,每个核心都有一个256×256的交叉栅阵突触单元。集成的紧凑型基于时间的模拟-数字转换器实现了模拟和数字域之间的无缝切换。此外,每个核心内的数字处理单元处理基本的神经元激活函数和缩放操作。 该芯片的架构使每个核心能够处理与DNN层相关的计算。突触权重以模拟电导值的形式编码在相变存储器设备中。一个全局的数字处理单元位于芯片的中心,管理着特定神经网络执行所必需的复杂操作。芯片的数字通信路径连接了所有的瓷砖和中央的数字处理单元。 在性能方面,该芯片在CIFAR-10图像数据集上展示了令人印象深刻的92.81%的准确率,标志着模拟内存计算的重要成就。该研究将模拟内存计算与数字处理单元和数字通信结构无缝集成,从而实现了更高效的计算引擎。该芯片的每单位面积的吉博操作每秒(GOPS)吞吐量超过了以往基于电阻性存储器的内存计算芯片的15倍以上,同时保持能源效率。 借助模拟到数字转换器、乘积累加计算能力和数字计算块的突破,IBM研究实现了快速和低功耗的模拟人工智能推理加速器芯片所需的许多关键组件。以前提出的加速器架构将众多模拟内存计算瓷砖与通过并行2D网格连接的专用数字计算核心相结合。这种愿景和硬件感知的训练技术预计将在可预见的未来在各种模型上提供与软件等效的神经网络准确性。

Leave a Comment

苹果和英属哥伦比亚大学的AI研究人员提出了FaceLit:一种用于神经网络3D可重塑人脸的新型AI框架

近年来,对于从2D图像中获取3D生成模型的任务引起了越来越多的兴趣。随着神经辐射场(NeRF)的出现,从3D模型产生的图像质量得到了显著提升,与2D模型实现的逼真程度相媲美。虽然一些特定的方法专注于3D表示,以确保第三维度的一致性,但这往往以降低图像逼真度为代价。然而,最近的研究表明,混合方法可以克服这个限制,从而增强图像逼真度。然而,这些模型的一个显著缺点在于场景元素的交织,包括几何、外观和光照,这妨碍了用户定义的控制。 已经提出了各种方法来解开这种复杂性。然而,它们要求有效实施时需要多视图图像的集合。不幸的是,当处理在真实世界条件下拍摄的图像时,这个要求带来了困难。虽然一些努力放宽了这个条件,包括来自不同场景的图片,但仍然需要多个视角的同一对象。此外,这些方法缺乏生成能力,并且需要对每个不同的对象进行单独训练,使它们无法创建新对象。在考虑生成方法时,几何和照明的交织特性仍然具有挑战性。 所提出的名为FaceLit的框架介绍了一种仅从图像中获取面部的解缠3D表示的方法。 下图展示了该架构的概述。 该方法的核心是构建一个渲染流水线,强制遵守已建立的物理光照模型,类似于以前的工作,以适应3D生成建模原则。此外,该框架利用现有的照明和姿势估计工具。 基于物理的照明模型被集成到最近开发的神经体积渲染流水线EG3D中,该流水线使用三平面组件从2D图像生成用于体积渲染的深度特征。这里使用了球谐函数。随后的训练侧重于逼真性,并利用该框架固有的物理遵循性来生成逼真图像。这种与物理原理的一致性自然地促进了对解缠3D生成模型的获取。 关键的要素是将基于物理的渲染原则与神经体积渲染结合起来。正如之前所述,该策略旨在与现有的可用照明估计器无缝集成,利用球谐函数。在这个框架中,场景的漫反射和高光方面由球谐系数来描述,这些系数与表面法线和反射矢量相关联。这些系数通过神经网络生成,包括漫反射反射、材料高光反射和法线向量。然而,这种看似简单的设置有效地解开了照明与渲染过程之间的关系。 所提出的方法在三个数据集FFHQ、CelebA-HQ和MetFaces上进行了实施和测试。根据作者的说法,这产生了最先进的FID分数,将该方法置于3D感知生成模型的前沿。下面报告了所讨论方法产生的一些结果。 这是FaceLit的摘要,它是一个新的人工智能框架,可以仅通过图像获取人脸的分离的3D表示。如果您感兴趣并希望了解更多信息,请随时参考下面引用的链接。

Leave a Comment

稳定AI发布日语StableLM Alpha:日语语言模型的跃进

在增强日本生成式人工智能领域迈出重要一步的同时,Stability AI,即稳定AI,是稳定扩散背后的开创性生成式AI公司,推出了其首个日语语言模型(LM),名为日语StableLM Alpha。这一重要发布引起了广泛关注,因为该公司声称其LM是面向日本说话者的最精通的公开可用模型。这一主张通过与其他四个日语LM进行全面基准评估得到了证实。 这个新推出的日语StableLM Alpha,拥有70亿参数的令人印象深刻的架构,是Stability AI在技术进步方面的承诺的明证。该模型是一种多功能高性能工具,适用于各种语言任务。它在多个分类中胜过了同行,成为行业领导者。 日语StableLM Base Alpha 7B商业版本计划在广泛认可的Apache License 2.0下发布。这个专门的模型是通过对包括7500亿个日语和英语文本令牌在内的庞大数据集进行广泛训练而精心打造的,这些数据集是从在线资源库中精心挑选的。 这一成就的基础还得归功于协作努力。Stability AI利用了EleutherAI Polyglot项目的日本团队的专业知识,最终形成了由Stability AI的日本社区创造的数据集。这一集体努力还得益于使用了EleutherAI的GPT-NeoX软件的扩展版本,这是Stability AI开发过程的基石。 作为一项并行创新,日语StableLM Instruct Alpha 7B又是一个显著的里程碑。这个模型主要用于研究目的,专门用于研究应用。它通过一种称为有监督微调(SFT)的方法,利用多个开放数据集,展示了遵循用户指令的独特能力。 这些模型通过EleutherAI的语言模型评估工具进行了严格的评估。这些模型在句子分类、句对分类、问答和句子摘要等各个领域经受了审查,并取得了令人印象深刻的平均得分54.71%。Stability AI认为,这一性能指标无疑将日语StableLM Instruct Alpha…

Leave a Comment

PlayHT团队将情感概念引入生成声音AI的AI模型:这将使您能够通过特定情感来控制和引导语音生成

语音识别是自然语言处理领域中最近开发的技术之一。研究科学家还为文本到语音生成的AI模型开发了大型语言模型。很明显,AI在语音质量、表情、人类行为等方面可以达到与人类相似的结果。但是尽管如此,这些模型仍然存在问题。这些模型在语言多样性方面较少。在语音识别、情感等方面也存在一些问题。许多研究人员意识到了这些问题,并发现这是由于模型使用的数据集较小造成的。 改进工作已经开始,PlayHT团队推出了PlayHT2.0作为这个案例研究的解决方案。这个模型的主要优点是它使用了多种语言并处理了大量的数据集。这也增加了模型的大小。NLP中的Transformers也在实施这个模型中扮演了重要角色。该模型处理给定的转录并预测声音。这经历了一个将文本转换为语音的过程,称为标记化。这涉及将简化的代码转换为声波,以生成人类语音。 该模型具有巨大的对话能力,可以像正常人一样进行对话,并带有一些情感。这些通过AI聊天机器人提供的技术经常被许多跨国公司用于在线呼叫和研讨会。PlayHT2.0模型还通过其中使用的优化技术改进了语音质量。它还可以复制出完全相同的声音。由于模型使用的数据集非常大,该模型在保留原始语音的同时也可以说出其他语言。模型的训练过程经历了大量的epochs和不同的超参数。这导致模型在语音识别技术中表现出各种情感。 该模型仍在不断改进中。研究科学家仍在致力于改进情感。提示工程师和许多研究人员还发现,该模型在未来几周内可以通过速度、准确度和良好的F1分数进行更新。

Leave a Comment

“见ConDistFL:一种在CT数据集中进行器官和疾病分割的革命性联邦学习方法”

计算机断层扫描(CT)图像必须准确地分割腹部器官和肿瘤,以用于计算机辅助诊断和治疗规划等临床应用。在现实世界的医疗保健环境中,更倾向于使用能够同时处理多种器官和疾病的通用模型。尽管主要研究集中在分割单个器官和不带恶性的不同类别的器官上,但还有其他感兴趣的领域。另一方面,传统的监督学习技术依赖于训练数据的数量和质量。不幸的是,由于高质量医学影像数据的昂贵费用,缺乏训练数据。只有合格的专家才能在各种解剖学的医学图像上创建正确的注释。 由于即使专业人士有时只在一个活动上具有专门的专业知识,因此注释不同解剖学和影像模态的器官和相关癌症也很困难。需要更多适用于各种器官和恶性肿瘤的适当注释信息,严重阻碍了通用分割模型的发展。许多研究已经研究了部分标记的数据集,其中每个图像只标记了一部分目标器官和恶性肿瘤,以开发通用的分割模型来解决这个问题。然而,共享机密的医疗统计数据在组织之间存在隐私和法律问题。提出了联邦学习(FL)来解决这些问题。 FL使得多个机构之间可以共同训练一个公共(或“全局”)模型,而不需要将数据集中在一个地方。提高医学图像分割效果的一种潜在方法是使用FL。在FL中,每个客户端仅向服务器发送模型更新,并使用其自己的数据和资源训练本地模型。服务器使用“FedAvg”将这些变化整合到全局模型中。最近的研究已经使用FL来创建使用部分标注的腹部数据集的统一多器官分割模型,如图1所示。然而,这些方法通常忽略了病变区域。只有少数研究努力同时分割各种器官及其肿瘤。 图1 显示了用于从不完整标签中分割多个器官和肿瘤的ConDistFL架构。每个客户端的本地数据库中只标记了一部分目标器官和恶性肿瘤。 由于数据多样性引起的数据异质性处理困难,FL的模型聚合面临着重大挑战。当使用来自不同来源的模型与非IID数据时,性能可能会受到影响。当客户端使用为不同目的注释的数据时,引入了更多标签空间中的领域转移,使问题变得更糟。此外,客户端的数据集大小不同可能会影响具有较少数据的全局模型的性能。本文的台湾大学、名古屋大学和NVIDIA公司的研究人员提供了一种应对部分标注腹部CT图像中数据异质性的策略,用于联邦学习的多类器官和肿瘤分割。 这项工作的主要贡献如下: 1. 他们提出的条件蒸馏联邦学习(ConDistFL)框架使得在不需要额外完全标注数据集的情况下,可以进行腹部器官和恶性肿瘤的多任务分割。 2. 在真实世界的FL环境中,所提出的框架展示了稳定性和性能,具有较长的本地训练步骤和较少的聚合次数,降低了数据流量和训练时间。 3. 他们使用一个未发布的完全标注的公共数据集AMOS22进一步测试了他们的模型。定性和定量评估的结果证明了他们策略的鲁棒性。

Leave a Comment

来自南加州大学和微软的研究人员提出了UniversalNER:一种新的AI模型,通过有针对性的蒸馏训练,可以识别13000多种实体类型,并在43个数据集上以9%的F1值超过ChatGPT的NER准确性

I had trouble accessing your link so I’m going to try to continue without it. ChatGPT和其他大型语言模型(LLM)展示了令人印象深刻的泛化能力,但它们的训练和推理成本通常是不可承受的。此外,对模型权重和推理概率的白盒访问在诸如医疗保健等关键任务应用中经常至关重要,以实现可解释性和信心。因此,指导调整作为一种将LLM压缩为更经济实惠和透明的学生模型的方法已经变得越来越受欢迎。这些学生模型已经展示出模仿ChatGPT的令人信服的能力,就像Alpaca和Vicuna一样。仔细观察发现,它们仍然需要赶上理想的LLM,特别是在特定目标应用中。 由于计算资源有限,通用蒸馏只能在所有可想象的应用中创建原始LLM的表面近似。相反,他们在这项研究中研究了有针对性的蒸馏,通过面向任务的指导调整来训练学生模型,用于开放信息提取等多样化的应用类别。他们证明了在保持其跨语义类型和领域的泛化能力的同时,这可以最大程度地复制LLM在指定应用类别中的能力。由于命名实体识别(NER)是自然语言处理中最基本的问题之一,他们选择了它作为案例研究。最近的研究表明,当有许多注释实例时,LLM仍然需要赶上最先进的监督系统的实体类型。 然而,对于大多数对象类型来说,大多数对象类型都很难进行注释。开发注释示例的成本高昂且耗时,特别是在需要专业知识的生物学等高价值领域。新的实体类型不断涌现。由于受过预先指定的实体类型和领域的训练,监督NER模型在新领域和实体类型上的泛化能力也较差。他们概述了LLM有针对性蒸馏的通用过程,并展示了开放域NER如何使用它。来自南加州大学和微软研究院的研究人员展示了如何利用ChatGPT从大量未标记的在线文本中创建NER的指导调整数据,并使用LLaMA创建UniversalNER模型(简称UniNER)。 他们提出了迄今为止最大、最多样化的NER基准(UniversalNER基准),包括来自9个不同学科的43个数据集,包括医学、编程、社交媒体、法律和金融。LLaMA和Alpaca在这个基准测试中表现不佳(约为0 F1)在零-shot NER上。相比之下,Vicuna在平均F1上表现明显更好,但仍然比ChatGPT落后20个绝对点以上。与此相反,UniversalNER在平均F1上超过Vicuna超过30个绝对点,并在UniversalNER基准测试中实现了最先进的NER准确性,涵盖了数以万计的实体类型。除了复制ChatGPT识别任何实体的能力(7-13亿个参数),UniversalNER在平均F1上还超过了其NER准确性7-9个绝对点。 令人惊讶的是,UniversalNER明显超过了使用监督NER实例的最先进的多任务指导调整系统,如InstructUIE。他们还进行了广泛的消融测试,以评估不同蒸馏组件(如指导提示和负采样)的影响。他们将提供他们的蒸馏配方、数据和UniversalNER模型,并提供一个交互式演示,以帮助进一步研究有针对性的蒸馏。

Leave a Comment