Press "Enter" to skip to content

Month: September 2023

印度总理莫迪关于人工智能监管的愿景:B20峰会2023

随着2023年B20峰会印度在德里落幕,印度总理纳伦德拉·莫迪的话语回响不绝。莫迪在与商业领袖的集会上直言不讳。他强调了印度在塑造全球供应链方面的角色,提倡客户关怀政策,并支持绿色信贷方法。然而,这还不是全部。在他的讲话中,他将聚光灯投向了技术的前沿:人工智能(AI)和加密货币。让我们深入了解莫迪总理关于印度人工智能发展和监管的见解。 另请阅读:《印度在所有OECD和G20国家中在人工智能技能和人才方面排名第一》 历史性的礼物:互信成为中心舞台 莫迪总理强调了印度向世界赠送的历史性礼物:互信。他强调了印度所编织的信任传统,并呼吁商业领袖与人工智能和加密货币正在重塑的勇敢新世界进行接触。 另请阅读:《OpenAI、谷歌、微软和Anthropic联合推动安全人工智能》 从进化到革命:莫迪总理呼吁推行道德人工智能 随着G20峰会临近,莫迪总理呼吁建立一个全球框架,推动“道德”人工智能(AI)的发展,这是一次具有重大意义的举措。这是朝着在正在进行的人工智能和加密货币监管辩论中发挥领导作用迈出的大胆步伐。这一转变表明印度从对人工智能监管的被动立场转变为根据“基于风险、用户伤害”的方法塑造监管规定的积极角色。 另请阅读:《管理道德人工智能:规则和法规防止不道德人工智能》 监管之路:范式转变 变革之风带来了印度在人工智能监管方面的范式转变。一个微弱的呼声已经变成了行动,这可以从印度最高电信监管机构印度电信监管局发布的一份咨询文件得到证明,该文件提出了一个“基于风险的框架”来监管人工智能。该文件还建议通过国际合作建立一个全球机构,负责“负责任地使用”人工智能。 另请阅读:《INDIAai和Meta携手合作:为人工智能创新和合作铺平道路》 全球飞跃:印度对负责任人工智能的立场 印度在B20峰会上对“道德”人工智能的呼吁在全球范围内产生共鸣。它建议建立一个监管机构,监督人工智能的负责任使用,类似于核不扩散的国际机构。这一立场与OpenAI创始人山姆·奥尔特曼关于国际人工智能监管的愿景一致,强调了全球趋同的必要性。 另请阅读:《山姆·奥尔特曼与纳伦德拉·莫迪总理的高风险会晤:描绘印度的人工智能未来》 微软的蓝图:洞察人工智能治理 科技巨头微软已加入人工智能治理对话,提出了《治理人工智能:印度蓝图》。这份蓝图提出了一个以安全为重点的方法,概述了在获得许可的人工智能数据中心部署,并在部署后进行持续监控和保护。 另请阅读: 印度的变革之旅:揭示的机遇 在这些发展中,印度站在技术变革的门槛上,准备利用创新推动经济增长。该国的政策正在适应解决与人工智能相关的隐私问题、系统偏见和知识产权侵权问题。 另请阅读:《AWS和Accel推出“ML Elevate 2023”以推动印度人工智能创业生态系统》 全球局势:多样化的人工智能监管方法 随着人工智能浪潮席卷全球,各国采取了不同的监管方法。欧盟的人工智能法案提出了一种基于侵略性和风险的多层次方法,而英国则采取了更加友好创新的立场。 我们的观点…

Leave a Comment

该新的AI研究通过将预训练的蛋白质语言模型整合到几何深度学习网络中,推进了蛋白质结构分析

在科学探索中,一个引人入胜的谜题等待着解决——蛋白质复杂而多样的结构。这些分子工作马在生物过程中起着关键作用,以令人着迷和神秘的方式发挥着影响力。然而,由于当前分析方法的局限性,解读蛋白质复杂的三维(3D)结构长期以来一直是一个挑战。在这个复杂的谜题中,一个研究努力展开,旨在利用几何神经网络的潜力来理解这些大分子的复杂形态。 揭示蛋白质结构的现有方法是一段艰辛的旅程。这些结构存在于指导其生物功能的三维领域中,使其捕捉成为一项艰巨的任务。传统方法面临着需要更多结构数据的需求,通常在我们的理解中留下了空白。与此同时,另一条探索之路蓬勃发展——蛋白质语言模型。这些模型以氨基酸的线性一维(1D)序列为基础,展现出在各种应用中的卓越能力。然而,它们在理解蛋白质复杂的3D性质方面的局限性促使了一种创新方法的诞生。 https://www.nature.com/articles/s42003-023-05133-1 研究的突破在于将这两个看似不相关的领域融合起来:几何神经网络和蛋白质语言模型。这种巧妙而简洁的方法旨在将几何网络注入到语言模型所获得的见解中。挑战在于弥合1D序列理解和复杂的3D结构理解之间的差距。解决方案是寻求经过良好训练的蛋白质语言模型的帮助,例如著名的ESM-2,以解读蛋白质序列中的微妙之处。这些模型解开了序列的密码,产生了包含重要信息的每个残基表示。这些表示是与序列相关的见解的宝库,它们被融入到先进的几何神经网络的输入特征中。通过这种结合,网络被赋予了理解3D蛋白质结构复杂性的能力,同时又从嵌入在1D序列中的庞大知识库中汲取养分。 所提出的方法通过组织1D序列分析和3D结构理解的两个重要步骤,实现了和谐地融合。旅程从蛋白质序列开始,它们进入蛋白质语言模型的领域。在这个领域中,ESM-2是一座灯塔,它解读了氨基酸序列的神秘语言,产生了每个残基的表示。这些表示类似于拼图碎片,捕捉了序列的复杂性的本质。这些碎片无缝地编织到先进的几何神经网络的结构中,丰富了它们的输入特征。这种共生的融合赋予了网络超越3D结构分析的能力,踏上一段旅程,无缝地融入1D序列中嵌入的智慧。 在科学进步的历史中,几何神经网络和蛋白质语言模型的结合呼唤着一个新时代。这项研究旅程应对了蛋白质结构分析所带来的挑战,提供了超越当前方法局限性的新颖解决方案。随着序列和结构的融合,机遇的全景展现。所提出的方法作为1D序列和3D结构世界之间的桥梁,不仅丰富了蛋白质结构分析,还有望揭示分子生物学更深层次的奥秘。通过这种融合,一个变革性的叙事开始形成,全面的蛋白质分析成为一个灯塔,照亮了以前未知的理解领域。

Leave a Comment

斯坦福的研究人员推出了DSPy:一种用于解决语言模型(LMs)和检索模型(RMs)高级任务的人工智能框架

使用语言模型和检索模型可以轻松解决各种复杂任务。语言模型(如GPT-3)旨在根据接收到的输入生成类似人类的文本。另一方面,检索模型用于从数据库或文档集合中检索相关信息。明确定义要解决的任务,确定任务是否需要生成新文本还是从现有资源中检索数据。 使用GPT-3或类似模型,需要提供描述任务的提示,并让模型基于此生成文本。需要通过实验提示的措辞和结构来获得所需的输出。它涉及将语言模型生成的文本与从数据库中检索到的信息相结合。这可能包括根据检索到的信息生成摘要或洞察。 斯坦福大学的研究人员构建了一个用于使用语言模型(LM)和检索模型(RM)解决高级任务的框架。他们称之为DSPy。 DSPy包含了各种用于提示和微调LM以及改进它们的推理和检索增强的技术。 DSPy基于Pythonic语法,提供了可组合和声明性的模块,用于指导LM的操作。 DSPy还有一个自动编译器,用于训练LM以运行程序中的声明性步骤。这个编译器可以在没有手动中间阶段标签的情况下,从最少的数据中进行微调。它使用可训练的模块化组件的系统空间,而不是字符串操作。 DSPy使用两个简单的概念“签名”和“电视台”来编译您编写的任何程序。签名是DSPy模块的输入/输出行为的声明性规范。相比之下,电视台是功能强大的优化器(包含在DSPy中),它可以学会为任何程序的模块选择有效的提示。 签名包括对子任务的最小描述以及将向LM提问的一个或多个输入问题。它还解释了我们期望从LM获得的问题的答案。电视台是远程自动提示。他们说,与其他方法相比,DSPy需要非常少的标记。它将引导任何需要支持用户流水线的中间标签,其中包括多个复杂步骤。 由于DSPy框架与其他库有很大的区别,因此很容易根据我们的用例来解释何时使用它。研究人员表示,这个统一的框架对于NLP / AI研究人员或正在探索新的流水线或新任务以解决高级和复杂问题的人来说非常有用。为了使它适用于每个人,他们发布了安装用户手册。他们还表示,未来将发布各种入门教程和演示以及参考资料。

Leave a Comment

遇见Nous-Hermes-Llama2-70b:一种在超过300,000条指令上进行优化的最先进语言模型

Hugging Face Transformer是Python中非常受欢迎的库,为各种自然语言处理任务提供了非常有用的预训练模型。它以前只支持PyTorch,但现在也支持Tensorflow。Nous-Hermes-Llama2-70b是NLP语言模型,使用了数十万条指令。该模型使用与旧的Hermes模型相同的数据集,以确保在训练模型时没有严重的广泛变化,并且过程变得更加顺利。该模型仍然存在一些缺陷,如较低的幻觉率和缺乏OpenAI审查。 模型训练是在大型数据集上完成的,这些数据集在处理的数据量和样式方面非常高。数据来自不同的来源,并合并为一个数据集,从而在处理的数据集中获得了多样的知识。数据集收集了来自Teknium、Karan4D、Emozilla、Huemin Art和Pygmalion AI等不同来源的数据。模型使用了Alpaca模型进行训练。研究团队对来自自我指导评估数据集的输入进行了人工评估,以评估Alpaca。研究人员收集了这个评估集,并包含了几乎涵盖了所有内容的多样化用户指令的列表。 研究人员还表示,Prompt工程师也将受益于这个已执行的模型。研究人员相信,发布上述资产将使学术界能够对指令跟踪语言模型进行控制科学研究,并最终导致解决该模型中存在的现有缺陷的新技术的出现。部署Alpaca的交互式演示还存在潜在风险,例如更广泛地传播有害内容并降低垃圾邮件的机会。NLP中的垃圾邮件检测技术在这个模型中也起着重要的作用。研究人员了解到,一旦发布模型权重或用户训练其指令跟踪模型,这些缓解措施就可以得到实现。 该项目的未来计划还包括迭代高质量数据并应用技术来去除低质量数据。研究人员还需要对Alpaca进行更严格的评估。他们还将从HELM模型开始,希望能够捕捉更多生成信息。研究人员还希望研究Alpaca的风险,并努力进一步提高其安全性。

Leave a Comment

顶级低/无代码AI工具(2023年9月)

利用低代码和无代码的人工智能工具和平台,正在开发利用机器学习以新颖方式的应用。AI可以用于创建协调销售和营销工作的网络服务和客户端应用程序。只需要最少的编码专业知识即可利用低代码和无代码解决方案。 无需编码或低代码的人工智能技术反映了计算机科学中长期追求的目标。无代码是一种不需要编写任何代码的软件设计系统。同时,低代码是一种促进更快应用交付的软件开发技术,几乎不需要编码,并且低代码平台是一种使用GUI界面进行应用程序可视化开发的软件工具。该AI工具无需编码,可以使用简单的拖放界面,用于AI应用的无代码或低代码开发环境。 顶级的低代码和无代码AI工具包括以下内容: MakeML 使用MakeML生成用于对象识别和分割的机器学习模型,无需手动编码。它简化了创建和高效管理大型数据集的过程。除了为您的ML模型准备就绪,您还可以进行测试。MakeML是一个在线资源,可以在几小时内教您构建AI软件并将计算机视觉应用于内部问题。在移动设备上还提供视频教程,帮助您掌握机器学习。MakeML的专业人员将帮助您开发计算机视觉解决方案并将其整合到您的产品中。不收取费用提供单个GPU云训练和有限的数据集导入/导出。 Obviously AI 借助Obviously AI的机器学习平台,您可以在几分钟内进行准确的预测,甚至不需要了解编码知识。这包括创建机器学习算法并通过单击鼠标预测其结果。使用数据对话框修改数据集而无需额外的代码,然后在组织中分发或展示您的ML模型。低代码API允许任何人使用算法进行预测,并将这些预测整合到他们的实际应用程序中。此外,Obviously AI为您提供了先进的算法和技术,而不会影响效率。它可用于收入预测、供应链规划和定向广告。实时预测可实现潜在客户转化、动态定价、贷款偿还和其他结果。 SuperAnnotate 使用SuperAnnotate创建AI动力超级数据。它是用于AI相关任务的端到端系统,包括注释、管理和版本控制“ground truth”数据。借助其强大的工具包、顶级的注释服务和可靠的数据管理系统,您的AI流程可以实现三到五倍的更快规模化和自动化。使用行业领先的服务和软件进行高吞吐量数据注释,包括视频、文本和图像。项目管理工具和团队协作可以帮助您的模型在实践中取得成功。建立一个简化的注释工作流程,监控项目质量,与团队分享更新等,所有这些都可以通过SuperAnnotate实现。由于其主动学习和自动化功能,它可以加速您的注释过程。 Teachable Machine Teachable Machine允许您教计算机识别和响应您的声音、手势和照片。无需编写任何代码,它可以快速创建强大的机器学习模型,用于集成到应用程序、网站等中。Teachable Machine是一个基于Web的低代码机器学习平台,可实现广泛可用的机器学习模型的开发。您需要收集并组织示例以教计算机学习新东西。您可以让计算机作为一个学习机器进行测试,然后立即进行测试。您可以在您的在线项目中使用该模型。您还可以将模型托管在线或作为可下载文件分发。最重要的是,该模型完全在您的设备上本地运行,因此您的音频或视频在任何时候都不需要离开系统。借助文件、相机和简短的音频样本,对照片和身体方向进行分类变得轻而易举。 Apple的Create ML 在您的Mac上,发现一种创新的方法来教授和训练ML模型。它使用Apple的Create ML便捷地创建ML模型并在Mac上进行训练。在一个项目中,您可以同时训练多个模型,每个模型都有一个独特的数据集。它包含一个外部图形处理单元,可以提高在Mac上的模型速度。通过暂停和恢复播放等选项,掌握您的训练进度。评估集将告诉您模型的表现如何。通过检查关键绩效指标和相互关系,发现各种提升模型的用例、前景和未来的投资。使用iPhone上的摄像头进行连续预览,体验模型的性能。通过使用硬件加速器在Mac上更快地训练模型。Create ML中的模型可以是各种各样的类型,包括图像、电影、音乐、演讲、文本、表格等。之后,您可以用新的信息和设置训练您的计算机。 PyCaret 通过PyCaret,一个低代码机器学习平台,您可以在Python中自动化机器学习工作流程。使用这个基本、简单的机器学习库,您可以更多地将精力集中在分析上,如数据预处理、模型训练、模型解释性、MLOps和探索性数据分析,而不是编写代码。PyCaret是模块化构建的,不同的模型可以执行各种机器学习操作。在这里,函数是按照一定过程执行任务的集合。使用PyCaret,几乎任何人都可以创建完整的、低代码的机器学习解决方案。提供了快速入门指南、博客、视频和在线论坛供学习使用。创建一个基本的机器学习应用程序,快速训练您的模型,然后经过分析和优化后,立即将其部署为REST…

Leave a Comment

2023年9月最佳40+个生成式人工智能工具

ChatGPT – GPT-4 GPT-4是OpenAI的最新LLM,比其前身更有创造力、准确性和安全性。它还具有多模态能力,即它能够处理图像、PDF、CSV等。通过引入代码解释器,GPT-4现在可以运行自己的代码,以避免幻觉并提供准确的答案。 Bing AI Bing AI由OpenAI的GPT-4模型提供动力,可以遍历网络提供准确的答案。它还具有根据用户提示生成图像的能力。 GitHub Copilot GitHub Copilot是一个AI代码补全工具,它分析代码并提供即时反馈和相关的代码建议。 DALL-E 2 DALL-E 2是OpenAI开发的文本到图像生成工具,它根据用户的提示创建原始图像。它被设计为拒绝不适当的用户请求。 Cohere Generate Cohere Generate利用AI的潜力来增强业务运营。它为电子邮件、落地页、产品描述和其他各种需求提供个性化内容。 AlphaCode AlphaCode由DeepMind开发,能够以竞争水平编写计算机程序。 Adobe Firefly Firefly是一款以提示为图像输出准确性而闻名的图像生成和编辑工具。它包括各种图像修改功能,包括内容类型、颜色、色调、光照和构图工具。…

Leave a Comment

ATLAS研究人员通过无监督机器学习中的异常检测探索新颖现象

自2009年成立以来,大型强子对撞机(LHC)一直是科学探索的先锋工具,旨在揭示超越标准模型边界的粒子和现象。然而,寻找新物理的传统方法涉及复杂的计算机模拟,将观测到的碰撞数据与标准模型和其他理论模型的预测相匹配。这些方法受到预定义模型和模拟的限制,可能忽视不符合这些模型的意外现象。为了解决这个限制,研究人员转向无监督机器学习,以检测碰撞数据中可能表示新物理现象的异常。 目前,寻找新物理涉及模拟,模拟已知粒子的行为,根据已建立的模型。将准确的碰撞数据与这些模拟进行比较,有助于识别可能暗示新现象的偏差。另一种方法是寻找标准模型背景的微小变化,这表明存在新的过程。然而,这些方法受到所测试模型固有假设的限制。 ATLAS的一项新研究提出了一种用于分析LHC碰撞数据的新框架。这个框架利用无监督机器学习技术,特别是一种复杂的神经网络,称为自编码器。与现有方法不同,这种方法不受模型和预设期望的限制。 引入的框架涉及对实际LHC碰撞数据进行复杂神经网络的训练。这个由许多相互连接的“神经元”组成的网络被称为自编码器。训练过程涉及压缩输入数据,然后在比较初始输入和输出时进行解压缩。通过这种比较,自编码器可以识别“典型”的碰撞事件并将其滤除,留下偏离正常的事件-称为“异常”。异常表示神经网络在识别模式时遇到困难,暗示着可能存在新的物理现象。为了评估这些异常,研究人员分析碰撞中粒子的不变质量,并评估它们是否可以归因于标准模型过程。 通过识别和表征异常事件,可以衡量这种方法的成功。自编码器检测到的异常事件被仔细检查,以确定它们与新的物理现象的潜在联系。输入和输出数据之间的重建差异越大,事件与标准模型之外的新物理相关的可能性越大。 总之,尽管传统的LHC寻找新物理的方法有效,但受到对预定义模型和模拟的依赖的限制。研究人员提出的新方法通过自编码器引入了无监督机器学习,实现了对碰撞数据的无模型分析。这个框架有潜力揭示逃脱传统方法的意外现象。通过关注自编码器检测到的异常,科学家可以揭示超出我们对宇宙当前理解的粒子和相互作用的奥秘。

Leave a Comment

每位数据科学爱好者必听的十个播客

介绍 在数据驱动创新的时代,保持更新是至关重要的。幸运的是,数据科学播客成为了一种引人入胜的方式,可以借助专家的集体智慧。无论是寻求立足点的初学者还是力求保持领先的经验丰富的专业人士,这些播客都通过声音传递洞察、轶事和趋势。 深入了解我们精心策划的前十名数据科学播客列表,每个播客都迎合特定的受众,揭示了数据的多维世界。 1. Data Skeptic 在繁忙的数据科学播客领域,“Data Skeptic”以其为初学者和中级学习者提供指导的光芒脱颖而出。这个对话式的教育性播客以可亲近的方式解密复杂的数据科学概念。 格式:对话式,教育性 “Data Skeptic”采用友好、对话式的语调,促进参与和理解。主持人们熟练地讲解复杂的主题,将其分解成易于理解的部分,同时不牺牲深度。这种格式确保听众不会被技术术语所困惑,使其成为初入数据科学领域的最佳选择。 目标受众:初学者和中级学习者 “Data Skeptic”迎合初学者和中级学习者,提供了坚实的基础,同时深入探讨了高级概念。这种双重方法确保新手和有一定背景的人都能在每一集中找到价值。 内容:简化复杂概念 “Data Skeptic”的核心是简化复杂的数据科学主题。该播客涵盖了从机器学习算法到人工智能应用和数据伦理学的广泛领域。内容经过精心策划,提供洞察力,同时不会让听众感到压倒,培养了逐步学习的曲线。 在Spotify、Apple Music和YouTube上找到这个数据科学播客。 2. Not So Standard Deviations 对于热衷于数据科学世界的数据爱好者来说,“Not…

Leave a Comment

这篇AI论文提出了混合NeRF,它由预训练的NeRF和可编辑的NeRF组成,用于基于文本驱动的局部化三维物体编辑

包括绘画、产品设计和动画在内的行业正在受到3D图像合成及相关技术的显著影响。虽然诸如神经辐射场(NeRF)之类的新型3D图像合成方法使得能够大规模生成3D内容成为可能,但由于这些方法使得对物体的形态和颜色进行精确和局部修改变得困难,因此这些方法难以被广泛采用。尽管最近进行了几次3D物体编辑的尝试,但对3D物体进行更局部和精细的操作仍然需要改进和降低成本。这在特定风格的特定物品的添加或删除方面尤为如此。虽然Text2Mesh和TANGO只允许对整个3D物体进行基本纹理和浅层形状的改变,但早期的尝试,如EditNeRF和NeRFEditing,只提供了受限制的、不灵活的编辑可能性。 虽然CLIP-NeRF提出了一种具有解耦条件NeRF的生成技术来进行对象编辑,但只在本地编辑对象的所需部分是具有挑战性的。它需要大量的训练数据来进行预期的编辑类别。它们还提供了一种不同的方法来修改物品的外观,但不是形态:对每个场景进行单个NeRF的微调,以实现以CLIP为驱动的目标。为了通过任何文本提示在规模上实现对3D物体的有效和实际的局部编辑,需要对物体的特定区域进行风格修改,例如选择性地改变颜色,局部添加和删除密度,如图1所示。 图1显示了我们基于文本驱动的局部对象操作策略的结果。基本物体是推土机,每次修改都使用调整颜色、增加密度和减少密度的方法进行。 在这篇论文中,LG电子和首尔国立大学的作者提出了一种先进的局部对象编辑技术,它可以使用文本提示来修改3D物体,提供完整的风格化和基于密度的局部编辑。他们认为,为了完全风格化形状和颜色,仅依赖于一个单一NeRF的简单微调来生成接近低初始密度附近的新密度或通过CLIP驱动目标来修改现有密度是不够的。相反,他们采用了一种方法,将原始的3D物体表示与参数化的隐式3D体积表示子集相结合,然后使用经过训练的可编辑的NeRF架构来自然地生成混合图像。他们使用类似CLIPSeg的预训练视觉语言方法来检测文本输入过程中需要修改的区域。所提出的方法基于一种称为Blending-NeRF的新颖分层NeRF架构,它包括预训练的NeRF和可编辑的NeRF。 在某些情况下,可以使用多个NeRF同时训练来重建一个动态场景的静态和动态元素。然而,他们的方法添加了一个额外的NeRF,以便在预训练的静态场景的特定区域进行基于文本的更改。这些更改包括多个编辑过程,包括颜色调整、密度增加和密度减少。它们可以通过结合两个NeRF的密度和颜色,对3D物体进行精细的局部化修改。 他们提供了创新的Blending-NeRF架构,通过使用多种目标和训练方法将预训练的NeRF与可编辑的NeRF混合起来。 这是他们的贡献概述: • 使用这种方法,可以直观地修改一些3D物体,同时保持其原始外观。 • 他们添加了新的混合技术,用于衡量密度增加、密度减少和颜色修改的程度。他们的方法使得可以精确地定位特定区域进行局部编辑,并由于这些混合过程限制了对象修改的范围。 • 他们进行了多个测试,涉及文本引导的3D物体编辑,例如修改形状和颜色。他们将自己的方法与早期方法及其直接扩展进行了比较,证明了混合-NeRF在质量和数量上都更优秀。

Leave a Comment

一项新的人工智能研究研究了大型语言模型在多项选择题中对选项顺序的敏感性的问题

大型语言模型(LLMs)因其在各种任务上的出色表现而受到了大量关注。它们的开发方式使它们经常在一些情况下超过监督模型甚至人类。尽管它们的能力令人惊叹,但先前的研究表明,某些功能约束可能会影响它们在实际世界中的实用性。这些模型对提示语言的细微差别、少量示范以及这些示范的组织的敏感性构成了一个重要的性能问题。这种敏感性阻碍了对LLMs能力的客观评估。 在Megagon Labs的最新研究中,一组研究人员对LLMs在处理多项选择题中的鲁棒性进行了研究,这是一种用于测试其推理和事实检索能力的流行任务。调查的主要焦点是LLMs对多项选择测试中选项重新排列的响应。经过深入研究后发现,当选项被改变时,跨多个基准测试的性能差异明显,范围从大约13%到75%不等。 经过深入分析后提出了一个假设,即当LLMs在对预测的前2或前3个选项不确定时,观察到的敏感性会发生。由于问题措辞带来的位置偏见,一些选项的顺序可能有利于这些前选项中的某些预测。在前两个选项中可以看到强调或减弱模型对某些选项放置的倾向的有趣模式。 为了突出偏见,团队采用了一种最佳策略,即将前两个列表中的第一个和最后一个替代方案放在一起以强调偏见。另一方面,为了抵抗偏见,建议将这些选择分散在周围的选项中。进行了一系列研究来验证假设的敏感性。此外,还使用了两种不同的校准技术来改进LLMs的预测。在多个模型和基准测试中看到了高达8个百分点的性能提升,这带来了显着改进。 该研究提出了一些问题,包括敏感性的程度,即LLMs在MCQs选项顺序方面受到多大程度的影响,导致LLMs敏感性的因素以及如何增强LLMs对选项顺序的鲁棒性。使用GPT-4和InstructGPT在五个不同的MCQ基准测试上进行了实验证明第一个问题。在零样本情况下发现了高达75%的敏感性差距。关于第二个问题,数据表明位置偏见是导致LLMs敏感性的原因,因为当LLMs不确定最佳选项时,它们倾向于偏好特定的放置方式。为了回答最后一个问题,研究表明使用两种不同的校准技术可以将LLMs的性能提高高达8个百分点。 总之,这项研究强调了面对LLMs对提示方面和排列方式的敏感性的必要性。通过研究LLMs在多项选择题中对选项重新排序的细微差别,它揭示了LLMs的决策过程,这肯定可以提高LLMs在实际情况下的可用性和可靠性。

Leave a Comment

卡内基梅隆大学和清华大学的研究人员提出了Prompt2Model:一种从自然语言指令生成可部署的AI模型的通用方法

假设您希望构建一个自然语言处理(NLP)模型来解决一个给定的问题。您需要定义任务范围,然后找到或创建能够指定预期系统行为的数据,选择适合的模型架构,训练模型,通过评估来评估其性能,然后将其部署供实际使用。研究人员已经通过一行代码使得原型化这种复杂的NLP模型成为可能! https://arxiv.org/abs/2308.12261 Prompt2Model是一个系统,它保留了使用简单提示指定系统行为的能力,并同时提供了一个可部署的特殊目的模型,保留了所有其优点。上图展示了我们Prompt2Model的工作架构。它实际上是一个自动化的流水线,从用户提示中提取关于任务的所有必要细节,然后收集和组合与任务相关的信息,并使用以下不同的通道进行部署。 数据集检索:给定一个提示,第一个任务是发现现有的手动注释数据,以支持用户的任务描述。 数据集生成:为了支持各种任务,存在一个数据集生成器,根据Prompt解析器解析的用户特定要求生成合成训练数据。Prompt解析器包含具有上下文学习的LLM,用于分段用户提示,使用OpenAI的gpt-3.5-turbo-0613。 模型检索:使用提供的提示,选择一个预训练的语言模型,该模型具有适合用户目标的知识。这个选择的模型作为学生模型,进一步进行微调和评估,使用生成的和检索到的数据。 WebApp:最后,存在一个易于使用的图形用户界面,允许下游用户与训练好的模型进行交互。这个使用Gradio构建的Web应用程序可以轻松地在服务器上公开部署。 总之,Prompt2Model是一个快速构建小而有竞争力的NLP系统的工具。它可以直接用于在几小时内产生优于LLM的任务特定模型,无需手动数据注释或架构。鉴于该模型的可扩展设计,它可以提供一个平台,用于探索模型蒸馏、数据集生成、合成评估、数据集检索和模型检索等新技术。 展望未来,我们可以将Prompt2Model视为促进协作创新的催化剂。通过提出不同的挑战,研究人员旨在在未来在框架的各个组件上促进多样化的实现和改进。

Leave a Comment

2023年十大最佳人工智能头像生成器

还记得为您的游戏冒险选择完美的虚拟身份的刺激吗?快进到今天,虚拟身份已经超越了游戏,并融入到我们的在线生活中。它们不仅仅是用于娱乐,它们是我们在社交媒体和数字平台上的代表。人工智能头像生成器广泛用于创建个性化头像。在本文中,我们将介绍10个最佳的人工智能头像生成器。 什么是人工智能头像生成器? 使用神经网络和人工智能算法,人工智能头像生成器可以为每个人和团队创建个性化头像,以打造独特的数字身份。用户必须上传自拍照、肖像、全身照片或文本提示来生成个性化头像。这些头像生成器能够在遵循伦理关注的同时保护隐私。 不同的人工智能头像生成器提供了独特的功能来生成创新和创意的头像。一些人工智能头像生成器是自动化的,而其他人则可以根据用户的需求进行自定义。创建独特头像的目的应该是选择人工智能头像生成器的决定性标准之一。 前10个人工智能头像生成器 以下是您参考的付费和免费人工智能头像生成器列表: PicsArt Synthesia Aragon Fotor AI头像生成器 Lensa AI魔法头像 Magic AI头像 Reface Dawn AI Starry AI Photoleap PicsArt PicsArt与其他软件应用程序不同,不需要文本或提示来创建头像。用户必须选择预设来生成头像,并根据自己的喜好进行自定义。可以通过从图库中选择图像来生成头像。无论是Android还是iPhone,使用PicsArt选择10到30张图片就足以生成50到200个头像。 免费版本不支持头像生成。用户需要访问付费版本的软件以获取高级功能。 功能…

Leave a Comment

“建立对像ChatGPT这样的LLMs背后概念的直观理解 – 第1部分:神经网络、Transformer、预训练和微调”

“我相信我不是唯一一个,但如果从一月份我的推文中还不够明显的话,当我第一次遇到ChatGPT时,我的脑海完全被震撼到了这种经历与众不同…”

Leave a Comment

认识LegalBench:一个由合作构建的开源AI基准,用于评估英语大型语言模型中的法律推理

由于大型语言模型(LLMs)的进步,美国的律师和行政人员正在重新评估法律职业。根据其支持者的说法,LLMs可能会改变律师处理短文写作和公司合规等工作的方式。它们可能最终通过提高法律服务的可及性来解决美国长期存在的司法准入困境。这一观点受到了LLMs具有使它们更适合法律工作的独特特性的影响。与手动数据注释相关的支出,这些支出通常增加了法律语言模型的创建成本,将会因模型能够从少量标记数据中学习新工作而减少。 它们也非常适合进行法律的严格研究,包括解读带有大量术语的复杂文本和进行整合多种思维方式的推理过程。然而,法律应用程序经常涉及高风险,这种热情受到了一定程度的抑制。研究表明,LLMs可能会产生冒犯性、欺骗性和事实错误的信息。如果这些行为在法律环境中重复发生,可能会造成严重的损害,历史上受压迫和资源匮乏的人承受了不成比例的压力。因此,由于安全影响,迫切需要建立法律环境下衡量LLMs的基础设施和程序。 然而,希望判断LLMs是否能够运用法律推理的实践者面临着重重障碍。第一个障碍是法律基准的生态系统很小。例如,大多数现有的基准都集中在模型通过调整或训练特定任务数据来学习的任务上。这些标准无法捕捉到激发对法律实践兴趣的LLMs的特征,特别是它们只需简短提示即可完成各种任务的能力。类似地,基准倡议主要集中在专业认证考试(如统一律师资格考试)上,尽管它们并不总是反映LLMs的实际应用。第二个问题是律师和现有标准对“法律推理”的定义之间存在差异。 目前使用的基准广泛将需要法律信息或法律作为评估“法律推理”的工作进行分类。相反,律师们知道“法律推理”这个词是广泛的,包括各种形式的推理。不同的法律责任需要不同的能力和知识体系。由于现有的法律标准需要识别这些差异,因此对法律从业者来说,将当代LLMs的表现置于他们对法律能力的认知中是具有挑战性的。法律行业不使用与法律标准相同的术语或概念框架。鉴于这些限制,他们认为为了严格评估LLMs的法律推理能力,法律界需要更多地参与基准设计过程。 为此,他们介绍了LEGALBENCH,这是创建一个英文跨学科协作法律推理基准的初始阶段。过去一年,这项研究的作者们共同努力构建了162个任务(来自36个不同的数据源),每个任务都测试了特定形式的法律推理。他们借鉴了各自的法律和计算机科学背景。据他们所知,LEGALBENCH是第一个开源的法律基准项目。这种基准设计方法,即专家积极参与并积极参与评估任务的开发,是LLM研究中一种多学科合作的典范。他们还主张,这表明法律从业者在评估和推进法律中的LLMs中必须发挥的关键作用。 他们强调LEGALBENCH作为研究项目的三个方面: 1. LEGALBENCH是使用预先存在的针对少量样本LLM范式进行重新格式化的法律数据集的组合构建的,并且还包括由法律专家生成和提供的手动制作的数据集,这些法律专家也被列为本文的作者。参与此合作的法律专家被邀请提供测试有趣的法律推理能力或在法律中具有实际价值应用的数据集。因此,在LEGALBENCH任务上的良好表现提供了相关数据,律师可以用来确认对LLM法律能力的意见,或者找到能够提高工作流程效率的LLM。 2. LEGALBENCH上的任务被分为详细的分类,概述了完成任务所需的法律推理类型。由于该分类法借鉴了法律界常见的框架,并使用他们已经熟悉的词汇和概念框架,法律专业人员可以积极参与LLM性能的讨论。 3. 最后,LEGALBENCH的设计旨在作为更多研究的平台。对于没有法律培训的人工智能研究人员来说,LEGALBENCH在了解如何促进和评估各种活动方面提供了实质性的帮助。他们还打算通过不断征求和包括法律从业者的工作来扩大LEGALBENCH,因为法律界与LLMs的潜在影响和功能的互动越来越多。 他们在本文中做出了如下贡献: 1. 他们提供了一种根据必要的证明来分类和描述法律义务的分类法。这种分类法基于律师用来解释法律推理的框架。 2. 接下来,他们概述了LEGALBENCH中的活动,概述了它们是如何创建的,重要的异质性维度和约束条件。在附录中,对每个任务都进行了详细的描述。 3. 为了分析来自11个不同家族的20个LLMs在不同规模点上的情况,他们使用LEGALBENCH作为最后一步。他们对几种提示工程策略进行了初步调查,并对各种模型的有效性做出了评价。 这些研究结果最终揭示了LEGALBENCH可能有助于的几个潜在研究课题。他们预计各种社区都会对这个基准感到有趣。从业人员可以使用这些活动来决定是否以及如何将LLMs纳入当前流程以提高客户结果。LLMs能够进行的各种类型的注释以及它们允许的各种类型的实证学术工作可能会引起法学界的兴趣。在法律这样一个特殊的词汇特征和挑战性任务可能会揭示新的见解的领域中,这些模型的成功可能会引起计算机科学家的兴趣。 在继续之前,他们澄清了这项工作的目标不是评估计算技术是否应该取代律师和法律人员,也不是理解这种替代的利弊。相反,他们希望创建工具来帮助受影响的社区和相关利益相关者更好地理解LLMs在某些法律责任上的表现。鉴于这些技术的普及,他们认为解决这个问题对于确保计算法律工具的安全和道德使用至关重要。

Leave a Comment