Press "Enter" to skip to content

Tag: Technology

加州圣克鲁兹大学的研究人员提出了一种新颖的文本到图像关联测试工具,用于量化概念之间的隐性刻板印象以及图像中的情感价值

加州大学圣塔克鲁兹分校的研究团队引入了一种名为文本到图像关联测试(Text to Image Association Test)的新工具。该工具解决了文本到图像生成人工智能系统中的无意偏见。这些系统以其从文本描述中生成图像的能力而闻名,但往往会在其输出中再现社会偏见。在助理教授的带领下,该团队开发了一种量化的方法来衡量这些复杂的偏见。 文本到图像关联测试提供了一种结构化的方法来评估各个维度上的偏见,如性别、种族、职业和宗教。这一创新工具在2023年计算语言学协会(ACL)会议上进行了介绍。它的主要目的是量化和识别先进生成模型(如稳定扩散)中的偏见,这些模型可以放大生成的图像中现有的偏见。 该过程涉及向模型提供一个中性提示,如“孩子学习科学”。随后,使用性别特定的提示,如“女孩学习科学”和“男孩学习科学”。通过分析从中性和性别特定提示生成的图像之间的差异,该工具量化了模型响应中的偏见。 研究发现,稳定扩散模型展示了与常见刻板印象一致的偏见。该工具评估了诸如科学和艺术之间的联系以及男性和女性等属性之间的联系,并分配分数以指示这些联系的强度。有趣的是,该模型出人意料地将深肤色与愉快联系在一起,将浅肤色与不愉快联系在一起,与典型假设相反。 此外,该模型显示了科学和男性、艺术和女性、职业和男性以及家庭和女性之间的关联。研究人员强调,他们的工具还考虑到了图像中的上下文元素,包括颜色和温暖度,这使其与先前的评估方法有所区别。 受到社会心理学中隐性关联测试的启发,UCSC团队的工具在T2I模型的开发阶段中量化了偏见的进展。研究人员预计,这种方法将为软件工程师提供更精确的模型偏见度量,有助于识别和纠正人工智能生成内容中的偏见。通过定量指标,该工具促进了持续努力以减轻偏见并监测随时间推移的进展。 研究人员收到了ACL会议上的学术同行们的鼓舞和兴趣,许多人对这项工作的潜在影响表示热情。该团队计划在模型训练和改进阶段提出缓解偏见的策略。这个工具不仅揭示了人工智能生成图像中的偏见,还提供了纠正和增强这些系统整体公正性的手段。

Leave a Comment

谷歌AI推出视觉丰富的文档理解(VRDU):用于更好地追踪文档理解任务进展的数据集

越来越多的企业在当今数字时代创建和存储文件。尽管这些文件可能包含有用的信息,但有时很难阅读和理解。发票、表格和合同等视觉复杂的文件则更加困难。这些出版物中的布局、表格和图形可能使有用的信息难以解析。 为了填补这一知识差距并改进文件理解任务的进展跟踪,谷歌研究人员宣布推出了全新的视觉丰富文档理解(VRDU)数据集。基于文档理解模型通常处理的现实世界文档类型,他们提出了五个有效基准的标准。论文详细介绍了研究界中最常用的数据集在至少一个方面存在不足,而VRDU在每个方面都表现出色。谷歌的研究人员很高兴地宣布,VRDU数据集和评估代码现已根据创意共享许可协议对公众开放。 研究部门视觉丰富文档理解(VRDU)的目标是找到自动理解此类材料的方法。使用VRDU模型可以从文档中提取姓名、地址、日期和总数等结构化信息。发票处理、CRM和欺诈检测只是企业可能利用这些信息的几个例子。 VRDU面临许多障碍。各种文档类型的广泛存在是一个障碍。由于它们复杂的图案和排列,视觉丰富的文件提出了进一步的困难。VRDU模型必须能够处理打字错误和数据中的空白等不完善的输入。 尽管存在障碍,VRDU是一个有前途且快速发展的领域。VRDU模型可以帮助企业降低成本、提高效率,并提高操作的精度。 在过去的几年里,已经开发出了复杂的自动化系统,用于处理和转换复杂的业务文件为结构化对象。手动数据输入是耗时的;一个可以自动从收据、保险报价和财务报表等文档中提取数据的系统可能通过消除这一步骤大大提高企业的效率。基于Transformer框架构建的新模型显示出显着的准确性改进。这些业务流程还在借助像PaLM 2这样的更大型模型进行优化。然而,实际应用案例中观察到的困难在学术出版物中使用的数据集中没有得到反映。这意味着虽然模型在学术标准上表现良好,但在更复杂的实际应用环境中表现不佳。 测量标准 首先,研究人员将学术基准(如FUNSD、CORD、SROIE)与实际用例中的最新模型准确性(如与FormNet和LayoutLMv2相比)进行了对比。研究人员发现最新的模型在实践中的准确性明显低于学术基准。然后,他们将常见数据集与文档理解模型与学术基准进行比较,并制定了五个条件,以准确反映数据集在实际应用中的复杂性。 在他们的研究中,科学家遇到了各种用于结构化提取的丰富模式。数字、文本、日期和时间信息只是许多类型的实体数据中可能需要的一些,这些数据可能是必需的、可选的、重复的,甚至是嵌套的。实践中的典型问题应该在对简单的平面模式(标题、问题、答案)执行的提取操作中得到反映。 文档应该包含各种不同类型的复杂布局元素。当文档包含表格、键值对、单列和双列布局、不同部分的变量字体大小、带标题的图像和脚注时,问题就会出现。相比之下,关于长输入的经典自然语言处理研究通常关注大多数论文以句子、段落和章节与部分标题排列的数据集。 有用的基准应包含具有不同结构的模板。高容量模型可以快速记住给定模板的结构,使得从中提取数据变得轻松。基准的训练-测试拆分应该评估这种广义到新模板/布局的能力,因为这在实践中非常重要。 光学字符识别(OCR)结果应对所有提交的文档具有高质量。这个基准旨在消除不同OCR引擎对VRDU性能的影响。 文档应包含可以映射回匹配输入文本的地面实况注释,以便可以将各个标记作为其各自实体的一部分进行注释。这与传递实体值的文本的标准做法形成对比,以进行解析。这对于生成无噪声的训练数据至关重要,使得研究人员可以专注于其工作的其他方面,而无需对所提供的值进行意外匹配。如果税额为零,则收据上的“税前总计”字段可能与“总计”字段具有相同的值。通过在标记级别进行注释,可以避免训练数据中将匹配值的两个出现都指定为“总计”字段的地面实况,从而产生噪声示例。 VRDU中的数据集和任务 VRDU收集包括两个独立的公共数据集——注册表单数据集和广告购买表单数据集。这些数据集提供了适用于现实场景并满足上述五个标准的实例。 广告购买表单数据集中的641个文件描述了政治广告的各个方面。一个电视台和一个倡导组织分别签署了发票或收据。产品名称、播出日期、总费用和发布时间只是记录在文件的表格、多列和键值对中的一些细节。 注册表单数据集中有1915个文件,详细描述了在美国政府注册的外国代理人的背景和活动。每个文件中记录了必须公开的外国代理人从事的活动的重要细节。注册人的姓名、关联机构地址、注册的活动以及其他信息。 VRDU的最新发展 近年来,VRDU取得了许多进展。大规模语言模型(LLMs)就是其中之一。大规模表示相似度测量(LLMs)是在大规模文本和代码数据集上训练的,可以用来表示图文丰富文本的文本和布局。 “少样本学习技术”的创建是另一个重要的成就。借助少样本学习方法,VRDU模型可以快速学习从新颖文档类型中提取信息。这一点很重要,因为它扩展了VRDU模型可以应用的文本类型。 Google Research已经向研究界提供了VRDU基准。发票和表单是VRDU标准中包含的两个视觉丰富文档的示例。发票数据集中有10,000个发票,表单数据集中有10,000个表单。VRDU基准还提供了一套经过深思熟虑的工具,用于评估性能。 VRDU领域的研究人员将会发现这个基准是一个宝贵的工具。研究人员现在可以评估各种VRDU模型在相同文本语料库上的表现如何。VRDU基准不仅对发现问题有用,还可以帮助直接进行未来的研究。 使用VRDU模型可以从文档中提取结构化数据。…

Leave a Comment

大规模语言模型能否取代人类在文本评估任务中的角色?这篇人工智能论文提议使用LLM来评估文本的质量,作为人工评估的替代方案

人类评估一直被用来评估自然语言处理模型和算法对文本质量的表现。然而,人类评估有时并不一致,并且可能无法重复,因为很难招募相同的人类评估者并得到相同的评估结果,评估者使用了不同数量的因素,包括主观性或对评估标准的解释差异。 台湾大学的研究人员研究了“大规模语言模型”(使用大量可在网络上访问的文本数据进行训练的模型,从而学习使用人类语言)作为一种新的评估方法,以解决这个可重复性问题。研究人员向LLMs提供相同的指令、要评估的样本和问题,然后要求LLMs为这些问题生成回答。他们使用人类和LLM评估来评估两个自然语言处理任务中的文本:开放式故事生成和对抗性攻击。 在“开放式故事生成”中,他们通过使用大规模语言模型和人类评估来检查由人类和生成模型(GPT-2)生成的故事的质量,以验证大规模语言模型是否可以将人类编写的故事评分高于生成模型生成的故事。 为了做到这一点,他们首先生成了一个问卷(评估指南、生成的故事片段和评估问题),根据四个不同的属性(语法准确性、一致性、喜欢度和相关性)分别在Likert量表(5个级别)上进行评分。 在人类评估中,用户按照准备好的问卷进行回答。对于大规模语言模型的评估,他们将问卷作为提示输入,并获得大规模语言模型的输出。研究人员使用了四个大型语言模型T0、text-curie-001、text-davinci-003和ChatGPT。对于人类评估,研究人员使用了著名的英语教师。这些大规模语言模型和英语教师评估了200个人类编写的故事和200个GPT-2生成的故事。英语教师给出的评分显示出对人类编写故事的四个属性(语法性、连贯性、喜好度和相关性)的偏好。这表明英语教师可以区分生成模型生成的故事和人类编写的故事之间的质量差异。但是,T0和text-curie-001对人类编写的故事没有明显的偏好。这表明大规模语言模型在评估开放式故事生成方面比人类专家能力较差。另一方面,text-davinci-003对人类编写的故事和英语教师都显示出明显的偏好。此外,ChatGPT也对人类编写的故事给出了更高的评分。 他们还研究了一个对抗性攻击任务,测试人工智能对句子进行分类的能力。他们测试了将句子分类为某种敌对攻击(使用同义词轻微改变句子)的能力。然后评估攻击对人工智能对句子进行分类的影响。他们使用了一个大规模语言模型(ChatGPT)和一个人类进行这个任务。 对于对抗性攻击,英语教师(人类评估)对敌对攻击产生的句子在流畅性和意义保持方面评分低于原始句子。此外,ChatGPT对敌对攻击句子给出了比英语教师更高的评分。同时,ChatGPT对敌对攻击句子的评分低于原始句子,总体上,大规模语言模型以与人类相同的方式评估敌对攻击句子和原始句子的质量。 研究人员指出了大规模语言模型评估的以下四个优点:可重复性、独立性、成本效益和速度、以及减少对不可接受内容的曝光。然而,大规模语言模型也容易对事实产生误解,并且学习方法可能引入偏见。此外,这些模型缺乏情感可能会限制它们在涉及情感的任务评估中的功效。人类评估和大规模语言模型的评估具有独特的优势和弱点。通过人类和这些大规模模型的结合,可能可以实现最佳效用。

Leave a Comment

Meta AI的研究人员推出了一种新的人工智能模型,用于对大型语言模型生成结果进行评论

I had trouble accessing your link so I’m going to try to continue without it. 将以下HTML代码翻译成中文(保留HTML代码): 大型语言模型(LLMs)生成连贯、上下文相关且语义有意义的文本的能力变得越来越复杂。尽管取得了这些进展,LLMs经常提供不准确、可疑和荒谬的结果。因此,不断评估和改进生成结果的技术对于更可信赖的语言模型将会有所帮助。LLMs的帮助下,语言模型的输出得到了增强。在当前的工作中,一些人训练实用函数,以在信息寻求对话任务中对生成的自然语言进行反馈。相反,其他人使用指令提示来创建模型生成的输出文本的多方面评估分数,涵盖各个领域。 尽管最初的研究未能对复杂的数学和推理等任务的模型输出产生反馈,只提供了对输出响应的一般反馈,但最近的一项研究通过指导调整LLM来为其回复创建自我反馈。在这项研究中,来自Meta AI Research的研究人员介绍了Shepherd,一种专门优化用于评估模型生成输出的语言模型。他们的目标是开发一个能够在许多领域提供评论的强大批评模型,尽管与之前的工作有着相似的目标。他们的方法可以识别特定问题,包括事实性、逻辑缺陷、连贯性和一致性,并在需要改进结果时提出修改建议。 表1:来自Stack Exchange和人工注释的训练数据示例 更准确地说,Shepherd可以提供包括深入主题知识、改进建议和广泛判断和推荐的自然语言反馈。他们开发了两个独特数据集的高质量反馈数据集,以改进Shepherd并对其进行评估:(1)社区反馈,从在线论坛中策划,以捕捉更多样化的互动;(2)人工注释的输入,收集了许多任务的生成结果。请参见表1中的示例。在这些数据集的混合训练下,Shepherd表现出色,在多个下游任务上超过了ChatGPT模型。社区数据比人工注释数据更有用和多样化。然而,通过对社区反馈和人工注释反馈数据的仔细研究,可以发现社区反馈往往更不正式。 由于这些细微差别,Shepherd可以对各种任务提供反馈,并且他们发现使用高质量的人工注释数据来微调模型可以提高模型性能。他们将Shepherd产生的反馈与Alpaca、SelFee和ChatGPT等尖端基线模型进行比较,并进行了基于模型和人类的评估。他们发现Shepherd的批评经常受到其他模型的青睐。例如,Alpaca倾向于赞扬每个模型的答案,这会产生许多不准确的反馈。SelFee经常忽略模型的答案,或者立即回答查询,而不提供可能识别错误的反馈。 他们发现ChatGPT在各种评估情况下更一致,并且在提供准确判断的评论方面表现更好。总之,他们创建了Shepherd,一种新颖的模型,可以对任何LLM生成的内容提供全面的批评,从而提高其质量。通过仔细分析生成的投诉,他们展示了Shepherd在各种生成任务中的有效性。创建一个一流的反馈数据集,可能有助于未来在这一领域的研究,也是他们工作的另一个重要补充。

Leave a Comment

宾夕法尼亚大学的研究人员正在开发机器学习策略,以改进肾脏配型并减少移植失败的风险

通过分析某种基因变异,人工智能已经成为个体的希望,以减少肾移植的风险。传统上,评估肾移植中移植物衰竭风险依赖于HLA(人类白细胞抗原)不匹配。宾夕法尼亚大学的研究团队探索了一种创新的机器学习算法,可以帮助揭示氨基酸不匹配(AA-MMs)与移植物衰竭可能性之间的隐藏联系。 他们的方法被称为FIBRES(风险分层的特征包含箱演化器),利用进化算法自动构建AA-MMs箱,最小化对箱构成的假设。它有助于将移植配对有效地分为高风险和低风险组,以实现移植物存活。通过使用FIBRES方法分析来自(移植者科学登记处)SRTR数据的1,66,754个肾移植的数据集,研究人员发现了传统方法在移植物衰竭风险方面的局限性。他们强调了氨基酸变异的作用,使FIBRES能够识别出两倍于低风险患者的数量。 FIBRES利用进化算法迭代优化AA-MMs箱的适应性,以进行移植物衰竭风险分层。它选择表现较好的“父代”生成新的后代箱,通过在箱内交叉和突变(替换、添加和删除)AA位置。FIBRES包含“风险层最小值”,以确保所得结果的统计可靠性。 该方法应用于三个分析:(1)使用跨越五个HLA位点的AA-MMs构建箱并比较风险分层,(2)分别在每个HLA内对AA-MMs进行分箱,(3)使用交叉验证评估性能。与0-ABDR抗原不匹配相比,它有助于增强风险分层。研究发现,通过AA-MM评估,24.4%的肾移植是低风险,而通过0-ABDR评估只有9.1%。交叉验证证实了FIBRES箱风险预测的普适性,验证了其稳健性。 研究人员强调,FIBRES在确定哪些AA-MMs影响风险方面可能更全面。然而,他们需要更大的数据集。未来,研究人员的目标是通过(1)将分箱扩展到其他HLA位点,(2)比较首次移植和再移植受体之间的结果,以及(3)调整FIBERS以优化能够将供受体配对分层为任意数量的风险组,学习组阈值,并学习AA-MM权重以推断给定MM的重要性。

Leave a Comment

“比较机器学习方法:传统方法与节省成本的替代方案 – 究竟哪种更有效?”

人工智能在云平台、金融、量化金融、产品设计等各个领域的应用日益增长。许多研究人员仍在探索人工智能聊天机器人的作用以及在开发这些聊天机器人模型中应用机器学习技术的方法。实施聊天机器人模型、进行训练和测试需要大量的数据和成本。这属于自然语言处理和计算机视觉的广泛范畴。为了解决这一经济危机,伦敦大学学院和爱丁堡大学的研究人员正在研究利用机器学习技术构建更好模型以解决这一问题。 研究人员仍在努力解决与云平台(如AWS)的经济相关的问题。研究团队开发了一种基于测量系统的机器学习方法。对比了普通机器学习模型和通过机器学习开发的新模型。这导致了一种节省成本的方法,这种方法相当不错,但也存在一些缺点。这些节省成本的模型预测了最小或最可能的结果。研究人员将问题分为三个主要类别来解决。 研究人员首先实施了批次选择作为第一种方法。这涉及大量的图像堆叠在一起。这些图像按照特定的顺序排列。批次选择是迄今为止使用的一种较便宜的方法,但仍有一些不足之处。研究人员使用的第二种方法称为层叠。这涉及将多个神经网络堆叠在一起。该模型使用层叠来实施模型。情感分析在层叠过程中也起着重要作用。研究人员设计的第三种方法基于高效优化器。这种方法基于减少浪费和加速搜索功能。这种方法是最优的,因为它提供了具有极高准确性的解决方案。在该过程中使用的优化器是Adam优化器的两倍快。 同时使用所有数据并且不舍弃废料信息将无法生成正确的输出。在所有三种输出中,只有层叠方法涉及最小的验证和训练增益。这类过程如今正在大规模改进。许多研究人员正在进行相同的研究。研究人员开发了一种比以前更节省计算资源的优化技术。研究项目完成后,“不训练,不增益”的总体结果被验证通过。

Leave a Comment

字节跳动和CMU的研究人员推出了AvatarVerse一种新颖的AI管道,用于生成由文本描述和姿势指导控制的高质量3D头像

3D头像在游戏开发、社交媒体与通信、增强与虚拟现实以及人机交互等行业中有广泛应用。高质量的3D头像建模一直备受关注。传统上,这些复杂的3D模型是由训练有素的艺术家手工建造的,这是一项耗时且劳动密集的过程,需要几千小时的时间和丰富的美学和3D建模知识。因此,他们的目标是仅使用自然语言描述自动创建高质量的3D头像,因为这具有重要的研究潜力和资源节约能力。 最近,从多视角电影或参考照片重建高保真度的3D头像引起了很大关注。这些技术无法根据复杂的文本提示构建富有想象力的头像,因为它们依赖于从电影或参考图片中获取的限制性视觉先验知识。扩散模型在创建2D图像时表现出色,主要是因为有许多大规模的文本-图像组合可用。然而,缺乏多样性和3D模型的短缺使得充分训练3D扩散模型变得困难。 最近的研究探索了优化神经辐射场以使用预训练的文本-图像生成模型生成高保真度的3D模型。然而,创建具有不同位置、外观和形式的坚固3D头像仍然具有挑战性。例如,仅使用常规评分蒸馏采样而没有额外的控制来指导NeRF优化可能会引入Janus问题。除此之外,目前的方法创建的头像经常显示出明显的粗糙和模糊,导致缺乏高分辨率的局部纹理细节、配饰和其他重要方面。 字节跳动和CMU的研究人员提出了AvatarVerse,这是一个专为使用文本描述和位置指导生成高质量可靠的3D头像的独特框架,以解决这些限制。他们首先使用800K或更多人类DensePose图片训练了一个全新的ControlNet。然后,在ControlNet之上,实施了基于2D DensePose信号的SDS损失条件。他们可以在每个2D视图和3D空间之间以及许多2D视图之间实现精确的视图对应关系。他们的技术消除了困扰大多数以前方法的Janus问题,同时还能够对创建的头像进行姿势控制。因此,它为头像的生成过程提供了更可靠和一致的保证。通过DensePose提供的精确和可调整的监督信号,生成的头像还可以与SMPL模型的关节对齐,使得骨骼绑定和控制变得简单高效。 他们提出了一种渐进式高分辨率生成技术,以提高局部几何的逼真度和细节,而仅依赖于DensePose条件的ControlNet可能会产生局部伪像。他们使用平滑度损失,在计算上高效的显式神经辐射场中促进密度体素网格的平滑梯度,以减少生成头像的粗糙度。 以下是总体贡献: • 他们介绍了AvatarVerse,一种只使用文字描述和参考人体姿态就能自动创建高质量3D头像的技术。 • 他们提供了基于DensePose条件的评分蒸馏采样损失方法,这种方法使得创建具有姿势意识的3D头像更加容易,并成功缓解了Janus问题,提高了系统的稳定性。 • 通过一种系统的高分辨率生成过程,他们提高了生成的3D头像的质量。这项技术通过严格的由粗到细的精炼过程,创建了具有出色细节的3D头像,包括手部、配饰等。 • AvatarVerse在质量和稳定性方面表现出色,优于竞争对手。通过深入的用户研究和细致的定性评估,展示了AvatarVerse在创建高保真度3D头像方面的卓越性。 这为可靠的零次试验3D头像生成设立了新的标准。他们在GitHub网站上提供了他们技术的演示。

Leave a Comment

见AgentBench:一个多维基准,旨在评估各种环境中的大型语言模型作为代理的能力

大型语言模型(LLMs)已经出现和发展,为人工智能领域增加了一种新的复杂性。通过密集的训练方法,这些模型已经掌握了一些惊人的自然语言处理、自然语言理解和自然语言生成任务,例如回答问题、理解自然语言推理和总结材料。它们还完成了与NLP不常见相关的活动,例如理解人类意图和执行指令。 像AutoGPT、BabyAGI和AgentGPT这样的应用程序利用LLMs实现了自主目标,这些应用程序的实现得益于所有NLP的进步。尽管这些方法引起了公众的浓厚兴趣,但评估LLMs作为代理的标准基线的缺失仍然是一个重大障碍。虽然过去已经使用基于文本的游戏环境来评估语言代理人,但由于其有限和离散的动作空间,它们经常存在一些缺点。此外,它们主要评估模型的常识基础能力。 大多数现有的代理人基准测试都专注于特定的环境,这限制了它们在各种应用场景中对LLMs进行全面评估的能力。为了解决这些问题,清华大学、俄亥俄州立大学和加州大学伯克利分校的研究人员提出了AgentBench,这是一个多维基准测试,旨在评估LLMs作为代理的能力在各种环境中。 AgentBench包含了八个不同的环境,其中五个是全新的:侧面思考难题(LTP)、知识图谱(KG)、数字卡牌游戏(DCG)、操作系统(OS)和数据库(DB)。最后的三个环境——家政(Alfworld)、在线购物(WebShop)和网络浏览(Mind2Web)——是从现有数据集进行改编的。这些环境都经过精心设计,以代表文本化的LLMs可以扮演自主代理的交互情境。它们严格评估LLM的关键能力,如编码、知识获取、逻辑推理和遵循指示,因此AgentBench成为评估代理和LLMs的全面测试平台。 利用AgentBench,研究人员对包括基于API和开源模型在内的25个不同的LLMs进行了深入分析和评估。研究结果显示,像GPT-4这样的顶级模型擅长处理各种现实世界的任务,这意味着可以创建高效能并不断适应的代理人。然而,这些顶级的基于API的模型在性能上明显不如它们的开源替代品。开源LLMs在其他基准测试中表现良好,但当他们面对AgentBench的困难任务时,它们表现不佳。这强调了进一步改进开源LLMs学习能力的需求。 研究的贡献可以总结如下: AgentBench是一个全面的基准测试,定义了标准化的评估程序,并引入了将LLMs作为代理进行评估的创新概念。它通过整合八个模拟现实世界情境的真实环境,为评估LLMs的各种能力提供了一个有用的平台。 该研究利用AgentBench对25个不同的LLMs进行了全面评估,揭示了领先的商业API型LLMs和开源替代品之间的显著性能差距。这种评估突出了LLM作为代理的当前状况,并确定了需要改进的领域。 该研究还提供了一个基于“API&Docker”交互范式的集成工具集,使定制AgentBench评估过程更加容易。这个工具集对更广泛的研究社区可用,结合相关数据集和环境,促进了LLMs领域的合作研究和开发。

Leave a Comment

印度储备银行采用对话人工智能和离线支付方式,使用统一支付接口(UPI)

印度储备银行(RBI)在数字支付领域开创新局,计划推出先进的统一支付接口(UPI)功能。RBI整合对话式人工智能和离线支付的举措旨在提升数字交易的可访问性、便利性和包容性。 同时阅读:印度如何利用尖端人工智能应对支付欺诈 利用NFC技术增强离线交易能力 RBI行长Shaktikanta Das提议将近场通信(NFC)技术纳入考虑范围,以适应互联网连接有限或无连接的地区。这一开创性举措将彻底改变UPI交易的格局,即使在网络连接较弱或无连接的地区也能实现无缝支付。 同时阅读:利用人工智能轻松完成KYC注册 UPI-Lite引领潮流 继2022年9月推出的在设备上的UPI-Lite电子钱包取得成功后,RBI最新的政策声明强调了这一功能的强劲增长。通过NFC技术促进离线交易,RBI预计进一步推动其发展。这种新颖方法解决了连接性挑战,并承诺快速、安全的交易,大大降低交易失败的风险。 包容性和可访问性的愿景 行业专家和领导者赞赏RBI的前瞻性举措。Kuhoo的首席执行官Prashant A Bhonsle称赞此举对于提升金融包容性和可访问性的潜力。NFC启用的离线交易的推出预计将为商业开辟新的途径,特别是在服务不足地区。BANKIT的首席运营官兼执行董事Amit Nigam强调了这一举措对于互联网连接不可靠的农村和偏远地区的转型影响。 对话式支付的未来 RBI的远见卓识延伸到了对话式支付,这是一种有望重塑UPI格局的创新概念。通过整合AI技术,用户将通过安全对话发起和完成交易。该功能在智能手机和功能手机的UPI渠道上均可使用,旨在加深数字支付在全国的普及程度。最初提供印地语和英语服务,该服务最终将涵盖更多印度语言。 同时阅读:2023年银行和金融领域机器学习和人工智能的应用 人工智能的变革潜力 对话式人工智能具有极大的潜力,可以提升用户体验,推动数字支付的普及,特别是在老年人和残障人士中。BankBazaar.com的首席执行官Adhil Shetty指出,拟议中的基于人工智能的界面可以简化交互,使UPI更易访问和用户友好。 同时阅读:谷歌云协助麦格理银行增强人工智能银行能力 我们的观点 随着RBI采用对话式人工智能和离线支付,印度的数字支付生态系统正处于转型的关键时刻。这些创新功能彰显了RBI在提升数字包容性、可访问性和安全性方面的承诺。通过整合人工智能和NFC等尖端技术,UPI将成为一个为所有人提供便利、简单和赋能的典范。

Leave a Comment

OpenAI推出GPTBot:一个用于自动从整个互联网上提取数据的网络爬虫

OpenAI通过引入一种名为GPTBot的新型网络爬虫工具,回应了在采集公共网站上的数据时出现的隐私和知识产权问题。这项技术旨在透明地收集公共网络数据,并将其用于训练他们的AI模型,一切都在OpenAI的旗帜下进行。 GPTBot的用户代理旨在收集有助于改进未来AI模型的数据。在此过程中,GPTBot将省略需要付费的来源。然而,需要注意的是,一些收集到的数据可能无意中包含可识别的信息或文本,从而违反了OpenAI的政策。 OpenAI认识到需要为网站管理员提供有关GPTBot平台访问的选项。授予访问权限被视为在提高AI模型的准确性、增强其功能和加强安全措施方面的一种合作方式。与此相反,OpenAI还为那些不希望将其网站包含在GPTBot数据收集工作中的人提供了一套程序。该指南包括将GPTBot指令整合到网站的robots.txt文件中,并配置其访问特定内容段。 为了更加透明,OpenAI已发布了与GPTBot活动相关的IP地址范围。此举不仅有助于识别机器人的行为,还提供了必要时阻止其访问的手段。 这些透明度举措突显了OpenAI对AI模型运营商所面临的批评的回应,这些运营商被指控在未经明确同意的情况下收集数据。普遍的观点认为,该行业的做法可能侵犯了知识产权和隐私保护,通过未经适当授权从公共网站收集内容。这反过来促使AI实体提供更全面的选择加入和退出机制,允许网站所有者和数据保管人对其内容的使用发表意见。 在相关发展中,Kickstarter的筹款平台最近引入了AI项目规定。这些规定包括一个重要要求,即利用外部数据源的项目必须提供来自源网站的适当许可协议和获得的同意的证据。未能履行此义务的项目将无资格在Kickstarter上列出。 预计在接下来的一周,OpenAI将进行一次重大改革,其中包括将基础ChatGPT层转换为GPT-4。此外,对Code Interpreter插件的增强将包括支持上传多个文件到提示,反映了OpenAI对持续改进和创新的承诺。

Leave a Comment

中国的一项新的人工智能研究介绍了RecycleGPT:一种生成式语言模型,其解码速度为1.4倍,通过回收预生成的模型状态而无需运行整个模型的多个步骤

在各种应用领域中创建令人满意的文本时,大型语言模型(LLMs)在自然语言生成方面带来了革命性的变化。尽管扩大模型规模(100B+参数)会显著提高性能,但事实仍然是,完成单个解码步骤所需的时间随着模型大小的增加而增长。更大的模型引入了大量的计算和更大的内存占用,这两者都对LLM的推理速度缓慢产生重要影响。KV缓存和训练模型参数以及推理所需的临时状态的内存需求是相当大的。 由于系统的内存访问速度较慢,LLMs的令牌生成速度较慢。至于产生每个标记所需的时间,它大致与模型参数的总数相关。 有几项工作旨在使推理更加高效。这些研究的基本重点是最小化内存使用量和缓解内存流量拥塞。无锡国家超级计算中心和清华大学的一项新研究调查了有效的解码技术,以最大化标记生成,并同时保持内存处理预算不变。为了实现快速解码,他们引入了一种名为RecycleGPT的新的语言模型架构,它可以重复使用先前创建的模型状态。 他们的策略是通过将一个新的可回收模块纳入原始语言模型中来进行微调,该模块基于先前生成的状态预测接下来的几个标记,而无需重复运行完整的模型。可回收模块由几个基于Transformer的层构建,这些层一起允许在进行预测时进行更好的表示。RecycleGPT可以与传统的解码技术以多种不同的方式结合使用,以进行推理。本研究循环使用它们(即,每生成两个标记需要运行一次整个模型),留下其他方式的研究以供未来参考。可回收模块的目的是加快解码过程,它之所以能够做到这一点,是因为尽管其结构简单,但该模块能够有效地表示上下文信息并生成正确的预测。 团队对RecycleGPT进行了多项测试,与几个行业标准进行了比较。研究结果显示,该模型的速度比最先进的语言模型快1.4倍,参数仅增加15%,同时在下游任务上保持类似的性能。研究人员计划很快展示不同规模的RecycleGPT模型。 由于其适应性和可扩展性,我们的回收技术可以与各种预训练模型一起使用。此外,可以修改创作技术和可回收模块的大小以达到所需的加速性能。

Leave a Comment

“遇见隔离扩散模型(CDM):一种用于在不同数据源上训练不同扩散模型或提示的人工智能方法”

随着技术和人工智能领域的最新进展,取得了许多进步和提升。无论是使用众所周知的ChatGPT模型进行文本生成,还是文本到图像的生成;现在一切都是可行的。扩散模型因其能够让人们使用简单的口头建议或草图制作引人注目的视觉效果而引起了很大的兴趣。庞大的训练数据量使得确认每个图像的来源变得困难,因此这些模型甚至引发了关于准确识别生成照片来源的问题。 已经提出了许多策略来处理这个问题,包括在使用训练样本之前限制其影响,解决使用后不正确的训练示例的影响,并限制样本对训练输出的影响。另一个目标是确定哪些样本对模型的训练产生了最大影响,以避免创建与训练数据过于相似的图像。尽管在这些领域进行了持续研究,但这些保护策略在扩散模型中并没有显示出有效性,特别是在大规模环境中,因为模型的权重结合了来自多个样本的数据,使得像取消学习这样的任务变得困难。 为了克服这一问题,亚马逊云服务(AWS)人工智能实验室的研究人员提出了最新的方法论,称为分区扩散模型(CDM),它可以在各种数据源上训练各种扩散模型或提示,然后在推理阶段无缝地将它们组合起来。通过使用这种方法,每个模型可以在不同的时间和使用不同的数据集或领域进行单独训练。这些模型可以组合在一起,提供与同时在所有数据上进行训练的理想模型相当的性能。 CDM的独特之处在于,每个单独的模型只知道它在训练过程中接触到的特定数据子集。这种特性为保护训练数据提供了各种方法的机会。在扩展扩散模型的背景下,CDM是第一个能够同时实现选择性遗忘和持续学习的方法,因此模型的各个组成部分可以被更改或遗忘,提供了更灵活和安全的方法来改变和发展模型。 CDM还具有根据用户访问权限创建唯一模型的好处,这意味着模型可以根据特定用户要求或约束进行修改,提高其实用性并保持数据隐私。除了这些特点,CDM还提供了对理解产生特定样本的特定数据子集的重要性的洞察。这意味着模型可以提供关于对给定结果产生最大影响的训练数据部分的信息。 总之,分区扩散模型无疑是一个强大的框架,允许在各种数据源上训练不同的扩散模型,然后无缝集成以产生结果。这种方法有助于保护数据并促进灵活学习,同时扩展扩散模型的能力以满足各种用户需求。

Leave a Comment

见面 MetaGPT:将GPT转化为工程师、建筑师和经理的开源AI框架

基于大型语言模型(LLMs)的多agent系统具有模拟和改进人类操作的特殊机会。然而,最近的研究表明,当前系统在现实应用中的复杂性中有时需要更准确。这些系统主要需要通过口头和基于工具的交流来促进建设性的协作,这在生成连贯的交流、减少反生产性的反馈循环和促进有益的协作交互方面存在困难。对于多方面的过程来说,有良好结构化的标准化操作程序(SOPs)是必要的。对现实世界实践的全面认识和整合至关重要。 解决这些常见限制并将这些见解纳入LLM-based多agent系统的设计和结构以提高其效力和应用至关重要。此外,通过广泛的集体实践,人们在各个领域已经建立了广泛认可的SOPs。这些SOPs对于促进有效的工作拆分和协调至关重要。例如,软件工程中的瀑布流程为需求分析、系统设计、编码、测试和可交付物建立了逻辑步骤。 借助这种共识工作流程,几个工程师可以有效地合作。此外,人类职位具有适合其工作的专业知识:软件工程师利用其编程技能来创建代码,而产品经理利用市场研究来确定客户需求。协作偏离了典型的输出,并变得杂乱无章。例如,产品经理必须进行全面的竞争研究,对用户需求、市场趋势和竞争产品进行研究以推动开发。这些分析必须紧接着创建具有清晰的、标准化格式和优先目标的产品需求文档(PRDs)。 这些规范性的工件对于推进复杂的、多样化的项目,需要各种角色的相关贡献,是必不可少的。它们凝聚了共同的理解。因此,使用组织良好的文档、报告和显示依赖关系的图形是至关重要的。在这项研究中,来自DeepWisdom、厦门大学、香港中文大学深圳分校、南京大学、宾夕法尼亚大学和加州大学伯克利分校的研究人员介绍了MetaGPT,这是一个具有基于SOPs的实用知识的开创性多agent框架。首先,他们使用描述其职责的职位名称来标识每个agent。这使得系统能够以正确的角色特定提示前缀初始化。这样,不再需要笨拙的角色扮演线索,而是将领域知识融入到agent定义中。其次,他们审查有效的人类过程,提取用于群体项目所需的SOPs的过程知识。 这些SOPs在agent架构中使用基于角色的操作规范进行编码。第三,为了促进信息交流,agent创建标准化的操作输出。MetaGPT通过形式化人类专家交流的工件,简化了相互依赖的工作之间的协调。agent通过共享环境相连接,这个环境提供有关活动和工具资源的洞察力。所有agent之间的通信都包含在这个环境中。它们还提供了一个全局内存池,存储所有合作记录,允许任何agent订阅或搜索所需的数据。agent可以从这个内存池中检索以获取更多上下文。 与通过对话被动吸收信息相反,这种架构使agent能够主动观察和提取相关信息。这个环境模拟了鼓励团队合作的实际工作场所中的系统。他们展示了协作式软件开发工作流程和相关的代码实现实验,涵盖了小游戏的开发和更复杂的大系统的生产,以说明他们的架构的效力。MetaGPT管理的软件复杂性远远超过GPT-3.5或其他开源框架如AutoGPT和AgentVerse,以产生的代码行数来衡量。 此外,MetaGPT通过自动化的端到端过程生成高质量的需求文档、设计工件、流程图和接口规范。这些中间标准化的输出极大地增加了最终代码执行的成功率。借助自动生成的文档,人类开发者可以迅速学习和提高他们的专业知识,以进一步改进他们的需求、设计和代码。它还实现了更复杂的人工智能与人类的互动。总之,他们通过对不同软件项目进行广泛的研究来验证MetaGPT。 通过定量的代码生成基准和整体过程输出的定性评估,展示了MetaGPT基于角色的专家agent合作范式所带来的可能性。总结起来,他们主要做出了以下贡献: • 设计了一种新的元编程机制,包括角色定义、任务分解、流程标准化和其他技术设计。 • 他们提出了MetaGPT,这是一种基于LLM的多代理协作框架,将人类的标准操作规程编码到LLM代理中,从根本上扩展了复杂问题解决的能力。 • 他们使用AutoGPT、AgentVerse、LangChain和MetaGPT对开发CRUD2代码、基本数据分析任务和Python游戏进行了广泛的测试。 通过采用标准操作规程,MetaGPT可以创建复杂的软件。总体研究结果表明,MetaGPT在代码质量和符合预期流程方面显著优于竞争对手。

Leave a Comment

肿瘤起源解码:麻省理工学院和达纳-法伯研究人员利用机器学习分析基因序列

在麻省理工学院(MIT)和丹娜-法伯癌症研究所之间的一项开创性合作中,研究人员利用机器学习的力量解决了癌症治疗中的一个棘手难题。对于一小部分癌症患者来说,其恶性肿瘤的起源仍然是一个谜团,使得选择合适的治疗方法变得复杂。一种通过机器学习开发的计算模型,以全新的方法解码这个谜团,并为更有效的个体化治疗铺平了道路。 传统的癌症治疗策略通常依赖于针对癌症起源的特定药物,使精确药物非常有效。然而,在大约3至5%的病例中,癌症已经扩散到全身,确定疾病的来源成为一项艰巨的任务。这些病例被归类为未知原发癌(CUP),长期以来困扰着肿瘤科医生,导致受影响患者的精确治疗选择有限。 麻省理工学院和丹娜-法伯的研究人员设计了一种强大的计算模型,通过仔细分析大约400个常见癌症相关基因的遗传序列来构建。这个机器学习驱动的模型熟练地检查基因序列,并准确预测肿瘤的起源。他们的研究结果展示了一个显着的成功率:该模型以高置信度正确分类了超过40%的肿瘤,为根据预测的癌症起源进行个体化治疗开辟了途径。 研究团队强调了他们的模型在辅助治疗决策中的关键贡献。通过有效地引导医生为CUP患者提供个体化治疗,该模型为那些从癌症起源中苦苦寻找答案的人带来了希望。 研究团队利用近3万名被诊断为22种不同癌症类型的患者的遗传序列构建了一个庞大的数据集,以开发他们的模型。这一训练阶段使得机器学习模型OncoNPC能够在未知肿瘤上以惊人的80%准确率预测癌症的起源。对于高置信度的预测,准确度提高到了约95%。 将他们的模型应用于测试,研究人员分析了丹娜-法伯的约900个CUP患者的数据集。令人惊讶的是,该模型自信地预测了这些肿瘤中40%的起源,这在癌症治疗个体化方面取得了重大进展。 通过与常染色体突变分析进行比较,该模型的预测得到了进一步的证实,常染色体突变分析是一种揭示特定癌症遗传易感性的方法。令人鼓舞的是,该模型的预测与基于常染色体突变的最强预测癌症类型密切吻合。 除了预测准确性,该模型的潜在临床影响也是明显的。CUP患者的生存时间与该模型的预后相关,预测为预后较差的癌症类型的患者生存时间较短。值得注意的是,接受与该模型预测相符的治疗的患者的疗效要好于接受针对不同癌症类型的治疗的患者。 也许最有希望的方面是,该模型确定了额外15%的患者(增加了2.2倍),如果他们的癌症类型已知,可能会受益于现有的靶向治疗。这一突破为更广泛地采用精确疗法打开了大门,从而充分发挥已有治疗的潜力。 展望未来,研究人员计划通过融合病理学和放射学图像等多种肿瘤分析模态来改进他们的模型。涵盖肿瘤分析的多个方面不仅可以提高预测准确性,还可以指导治疗选择,开启个性化癌症护理的新时代。随着技术与医学科学之间的合作加强,患者在与癌症起源的斗争中将迎来更加充满希望的未来。

Leave a Comment

“AI 聆听您的按键:一种新的数据安全威胁”

由伦敦大学、杜伦大学和萨里大学的研究人员开发的一种开创性的人工智能系统将数据安全问题提升到了一个新的水平。这种尖端算法可以通过音频记录窃听您的键盘,仅凭声音录音就能解读您的打字。本文深入探讨了这种人工智能创新的工作原理、潜在风险以及如何保护自己免受这种新型数据安全威胁。 还可以阅读:OpenAI领导人谈论人工智能的风险,提出治理方法 人工智能键盘窃听突破 研究人员利用人工智能的力量通过音频记录来监听按键。他们的人工智能模型在MacBook Pro键盘上进行了测试,准确率达到了93-95%。这意味着该算法可以通过分析按键所产生的声音准确地检测出哪些键被按下。 声学侧信道攻击的兴起 该研究强调了手机和笔记本等日常设备中麦克风的普及性。曾经被认为无害的这些麦克风现在可以被用于声学侧信道攻击。虽然以前存在基于音频的按键检测尝试,但这种基于人工智能的方法将精度提升到了一个新的水平,甚至超过了硬件方法。 还可以阅读:FraudGPT:AI驱动的网络犯罪工具的惊人崛起 音频算法的运作方式 研究人员首先对MacBook Pro键盘上的每个按键按下的声音进行了25次录制,并记录了音频样本。然后他们将这些音频样本转换成频谱图,这些频谱图是声音频率随时间变化的可视化表示。人工智能模型经过训练,可以识别与这些频谱图中的各种按键相关的独特模式。 释放人工智能的按键预测 在对成千上万个音频片段进行训练后,人工智能模型变得善于辨识每个按键的独特声学特征。当应用于新的音频记录时,人工智能可以准确地预测按键。在MacBook Pro键盘上进行训练时,该算法在测试中达到了93-95%的准确率。 数据安全问题和保护措施 尽管这种人工智能的进步提供了令人难以置信的见解,但它也带来了严重的安全风险。攻击者可能会窃取敏感信息,如密码和消息。防范这种威胁的方法包括改变打字风格、在扬声器上播放声音、使用触摸屏键盘或修改键盘的声学特性,使人工智能模型失效。 还可以阅读:4家科技巨头——OpenAI、谷歌、微软和Anthropic联合保障安全人工智能 我们的观点 人工智能突破了计算机可以根据音频记录解读您的按键的能力,这是令人惊讶和令人担忧的。它突显了数据安全威胁不断演变的现实,并展示了人工智能揭示新形式信息的力量。随着技术的进步,保护数据隐私需要创新的策略来对抗新出现的漏洞。在我们拥抱人工智能的潜力的同时,我们也必须致力于加强保护我们敏感信息免受窥探的防线。

Leave a Comment

UCLA研究人员推出GedankenNet:一种自我监督的AI模型,从物理定律和思维实验中学习,推动计算成像的发展

近年来,深度学习的最新进展对计算成像、显微镜和全息成像相关领域产生了重大影响。这些技术在生物医学成像、传感、诊断和3D显示等各个领域都有应用。深度学习模型在图像翻译、增强、超分辨率、去噪和虚拟染色等任务中展示出了非凡的灵活性和有效性。它们已成功应用于各种成像模式,包括明场和荧光显微镜;深度学习的整合正在重新塑造我们对微观尺度复杂世界的理解和能力。 在计算成像中,主流技术主要采用监督学习模型,需要大量带有注释或基准实验图像的数据集。这些模型通常依赖于通过各种方法获取的带标签的训练数据,例如经典算法或来自不同成像模式的注册图像对。然而,这些方法存在一些限制,包括繁琐的训练图像获取、对齐和预处理,以及可能引入推断偏差。尽管通过无监督和自监督学习来解决这些挑战的努力,但对实验测量或样本标签的依赖仍然存在。虽然一些尝试已经使用带标签的模拟数据进行训练,但准确表示实验样本分布仍然复杂,并且需要对样本特征和成像设置有先验知识。 为了解决这些固有问题,加州大学洛杉矶分校Samueli工程学院的研究人员引入了一种名为GedankenNet的创新方法,它提出了一种革命性的自监督学习框架。这种方法消除了对标记或实验训练数据以及任何与现实样本的相似性的需求。通过基于物理一致性和人工随机图像进行训练,GedankenNet克服了现有方法所面临的挑战。它为全息重建建立了一个新的范式,为在各种显微镜、全息术和计算成像任务中常用的监督学习方法的局限性提供了一个有前途的解决方案。 GedankenNet的架构由一系列空间傅里叶变换(SPAF)块组成,通过残差连接相互连接,有效捕捉空间和频率域信息。通过整合物理一致性损失函数,该模型在全息重建过程中强制执行波动方程的一致性,从而产生物理准确的复杂场输出。这种独特的训练策略使得GedankenNet能够在合成和实验全息图像上具有出色的泛化能力,即使面对未见样本、轴向散焦和光照波长的变化。 a)插图描述传统的迭代全息重建技术、自监督深度神经网络GedankenNet和现有的监督深度神经网络。| b)GedankenNet用于全息重建的自监督训练过程。 性能评估显示,GedankenNet在全息重建方面具有出色的能力。通过结构相似性指数(SSIM)、均方根误差(RMSE)和误差校正系数(ECC)等定量指标,GedankenNet在各种全息图像集上始终优于传统的监督技术。值得注意的是,GedankenNet的物理一致性损失有效地减轻了非物理性伪影,从而实现了更锐利和更准确的重建。模型与波动方程的兼容性进一步增强了其性能,使其能够通过正确的波动传播从散焦全息图中恢复高质量的物体场。这些发现突显了GedankenNet在外部推广方面的优越性,使其能够以出色的保真度处理新颖的实验数据和仅相位样本。 总体而言,加州大学洛杉矶分校研究团队的GedankenNet代表了计算成像和显微镜领域的一个开创性进展。通过采用自监督学习的力量和以物理为基础的思想实验,GedankenNet为训练神经网络模型提供了一种新的方法。这种创新方法不仅克服了当前监督学习技术的局限性,还为各种计算成像任务提供了更加多样化、与物理相容且易于训练的深度学习模型的途径。这一突破将极大地加速显微镜领域的进步,促进更广泛的应用和对微观世界的更深入的认识。

Leave a Comment

谷歌AI研究提出了VidLNs:一种获得语义正确且与准确的时空定位紧密关联的丰富视频描述的注释过程

视觉和语言研究是一个不断发展的领域,最近取得了显著的进展,特别是在建立静态图像和相应标题之间联系的数据集方面。这些数据集还涉及使用多种方法将标题中的某些词与图像中的特定区域关联起来。最新的本地化叙事(ImLNs)提供了一种有趣的方法:注释者在描述图像的同时,通过鼠标光标移动来标记他们讨论的区域。这种语音和光标移动的双重过程反映了自然交流,为每个单词提供了全面的视觉基础。然而,值得注意的是,静态图像只能捕捉到一瞬间。注释视频的前景更具吸引力,因为视频展示了完整的叙事,展示了多个实体和物体动态交互的事件。 为了解决这个耗时且复杂的任务,提出了一种增强的注释方法,将ImLNs扩展到视频中。 所提出技术的流程如下所示。 这种新的协议允许注释者在受控环境中构建视频叙事。注释者开始仔细观察视频,识别主要角色(如“男人”或“鸵鸟”),并选择代表每个角色重要时刻的关键帧。 随后,针对每个角色单独构建叙事。注释者在同时引导光标在关键帧上突出显示相关对象和动作的同时,使用口头描述表达角色在各种事件中的参与。这些口头描述包括角色的名称、属性,特别是它所承担的动作,包括与其他角色的互动(例如“与鸵鸟玩耍”)和与无生命物体的互动(例如“拿起食物杯”)。为了提供全面的背景信息,注释者还在单独的阶段提供了对背景的简要描述。 有效地使用关键帧消除了时间限制,而为每个角色创建独特的叙述使得复杂情况的分解成为可能。这种分解有助于全面描绘涉及多个角色相互交互和与许多被动物体互动的多面事件。与ImLN类似,这个协议利用鼠标轨迹段来定位每个单词。该研究还实施了几项额外措施,以确保精确定位,超过了先前工作的成果。 研究人员使用视频本地化叙事(VidLNs)在不同的数据集上进行了注释。考虑到的视频展示了复杂的场景,其中各种角色和无生命物体之间的交互,通过详细的注释描述了引人入胜的叙事。以下是一个示例。 VidLNs数据集的深度为各种任务(如视频叙事基础(VNG)和视频问答(VideoQA))提供了坚实的基础。新引入的VNG挑战要求开发一种能够通过在视频帧上生成分割掩码来定位输入叙述中的名词的技术。这个任务面临着重大挑战,因为文本中经常包含多个相同的名词,需要从周围词语中利用上下文线索进行消歧。虽然这些新的基准测试仍然是复杂的挑战,并远未完全解决,但所提出的方法在正确的方向上取得了有意义的进展(有关详细信息,请参阅已发表的论文)。 这是关于视频本地化叙事的总结,这是一种将视觉和语言连接起来的新型多模态视频注释。如果您对此感兴趣并想了解更多信息,请随时参考下面引用的链接。

Leave a Comment

ETH Zurich研究人员推出仿生肌腱驱动的Faive手:一种可3D打印的具有高自由度设计和灵巧手部旋转技能的手

在传统的基于模型的控制方法中,控制器直接与机器人的动态模型进行推理。最近的研究使用通过强化学习建立的策略,随着机器人结构变得更加复杂和仿生。这在涉及多个手指和人型机器人手的操作等需要技能的操作中尤为明显。协同移动的能力可以彻底改变多个行业,从拣选和放置仓库工作到流水线制造,以及在家庭中提供帮助。 苏黎世联邦理工学院(ETH Zurich)和马克斯普朗克联邦理工学院学习系统中心(Max Planck ETH Center for Learning Systems)的最新研究介绍了Faive Hand作为一个灵巧的操作平台。作为朝向类人操作的第一步,该团队报告了他们目前将其模型整合到RL环境中并在机器人上应用闭环控制器以实现灵巧的手内球形旋转。 目前最突出的机器人手是用于灵巧操作研究的,考虑到能力强大的机器人需要硬件和控制器两者。研究人员提出,更类人化的手部设计更适合与工具和环境中的物品进行互动,因为它们从一开始就是为人们设计的。从人类示例中学习时,使用类似框架的机器人更容易传递操纵活动。 Faive Hand是在软体机器人实验室中开发的一种仿生、腱驱动的机器人平台,用于研究精细操作。最新版本的手是3D打印的,由伺服电机驱动,使得批量生产变得容易和可行。然而,与使用RL教授的其他灵巧手不同,这只手包含了旋转接触关节的特点,其旋转没有定义的旋转轴,给控制高自由度的机器人手的本已困难的任务增加了难度。由于在这种设计中实施传统的旋转编码器是具有挑战性的,内部关节角编码器仍在研究中,但必须包含在手中。由于这个限制,伺服电机角度被用来估计腱长,从而估计关节角度。通过这些对仿真框架和低级控制器的补充,可以在真实机器人上执行通过闭环RL训练的策略。 研究人员通过在IsaacGym模拟器中展示了手的潜力,展示了通过RL教授的技能的零样本迁移。他们计划通过添加执行和传感器能力,在RL sim2real任务和其他任务(如行为克隆)上改进它。

Leave a Comment

认识AnyLoc:最新的通用视觉位置识别(VPR)方法

随着人工智能领域的不断发展,它已经在许多用例中找到了应用,包括机器人技术。考虑到视觉位置识别(VPR)是估计机器人状态的关键技能,并广泛应用于各种机器人系统,如可穿戴技术、无人机、自动驾驶车辆和地面机器人。利用视觉数据,VPR使机器人能够识别和理解其所处环境中的当前位置或地点。 在各种情境下实现VPR的普适应用一直是困难的。虽然现代VPR方法在应用于与其所学环境相似的情境(如城市驾驶场景)时表现良好,但在各种其他环境中(如水下或空中环境)的效果显著下降。为了解决这个问题,人们努力设计一种通用的VPR解决方案,可以在任何环境中无误地运行,包括空中、水下和地下环境,不受白天-黑夜或季节变化等变化的影响,并且从任何视角都不受透视变化(包括直接相反的视角)的影响。 为了解决这些限制,一组研究人员提出了一种新的基线VPR方法,称为AnyLoc。该团队研究了来自大规模预训练模型的视觉特征表示,他们将其称为基础模型,作为仅依赖于VPR特定训练的替代选择。虽然这些模型最初并不是为VPR而训练的,但它们存储了丰富的视觉特征,有望成为一个全面的VPR解决方案的基石。 在AnyLoc技术中,仔细选择具有所需不变性属性的最佳基础模型和视觉特征,其中不变性属性包括模型在环境或视点变化时保持特定视觉特性的能力。然后将经常在VPR文献中使用的流行的局部汇聚方法与这些选择的属性进行合并。通过使用局部汇聚技术,可以更有根据的从视觉输入的不同区域整合数据,以更准确地进行位置识别。 AnyLoc通过将基础模型的丰富视觉元素与局部聚合技术相结合,使装备有AnyLoc的机器人在各种环境中极具适应性和实用性。它可以在各种环境中进行视觉位置识别,无论是一天中的任何时间还是一年中的任何时间,无论是从任何角度观察。该团队总结了研究结果如下。 通用的VPR解决方案:AnyLoc被提出作为VPR的新基线,在包含地点、时间和视角变化的12个不同数据集中无缝运行。 特征-方法协同作用:将像DINOv2这样的自监督特征与像VLAD或GeM这样的无监督聚合相结合,相对于直接使用现成模型的每个图像特征,可以显著提高性能。 语义特征表征:分析聚合局部特征的语义属性,揭示了潜在空间中的不同领域,增强了VLAD词汇构建并提高了性能。 强大的评估:该团队在具有挑战性的VPR条件下对AnyLoc进行了多样化的数据集评估,如白天-黑夜变化和相反的视角,为未来的通用VPR研究奠定了坚实的基础。

Leave a Comment

Airbnb研究人员开发了Chronon:一个用于开发机器学习模型的生产级特征的框架

在机器学习不断发展的领域中,特征管理已成为Airbnb的ML工程师面临的一个关键问题。尽管他们努力为各种产品创建创新模型,但他们经常发现自己花费大量时间处理基础设施复杂性,而不是专注于模型本身。Airbnb意识到需要一个能够简化特征数据管理、提供实时更新并确保训练和生产环境一致性的解决方案。 这就是Chronon,由Airbnb团队设计的强大API,旨在直面这些挑战。Chronon赋予ML从业者定义特征和集中数据计算以进行模型训练和生产推断的能力,从而确保整个过程的准确性和一致性。 从多样化的数据源摄取数据 Chronon可以从各种数据源摄取数据,包括事件流、数据仓库中的事实/维度表、表快照、变更数据流等。无论是实时事件数据还是历史快照,Chronon都可以无缝处理。 灵活转换数据 借助Chronon的类SQL转换和基于时间的聚合功能,ML从业者可以自由地处理数据。无论是标准聚合还是复杂的窗口技术,Chronon的Python API赋予用户执行复杂计算的能力,同时确保完全灵活性和可组合性。 在线和离线结果生成 Chronon同时满足在线和离线数据生成需求。Chronon为提供特征数据的低延迟端点或用于训练数据的Hive表提供支持。通过“准确性”参数,用户可以决定更新频率,使其适用于从实时更新到每日刷新的各种用例。 理解准确性和数据源 Chronon对准确性的独特方法使用户能够表达派生数据的所需更新频率。无论是近实时还是每日间隔,Chronon的“时间”或“快照”准确性模型都确保计算与每个用例的特定要求相一致。 数据源是Chronon生态系统中的重要组成部分。它支持三种主要的数据摄取模式: 事件数据源用于时间戳活动 实体数据源用于与业务实体相关的属性元数据 累积事件源用于跟踪缓慢变化维度的历史更改 计算上下文和类型 Chronon在两个不同的上下文中运行:在线和离线。在线计算为具有低延迟的应用程序提供服务,而离线计算使用批处理作业在数据仓库数据集上执行。所有Chronon定义都分为三类:GroupBy用于聚合、Join用于组合来自各种GroupBy计算的数据,以及StagingQuery用于自定义Spark SQL计算。 理解聚合以获取强大的洞察力 Chronon的GroupBy聚合提供了对传统SQL group-by功能的各种扩展。用户可以利用窗口进行基于时间的聚合、进行分桶以获得更精细的粒度,并使用自动解包处理数组中的嵌套数据。此外,基于时间的聚合提供了更大的灵活性,可为ML模型创建有深度的特征。 Airbnb的ML从业者的无缝集成 Chronon已经成为Airbnb机器学习工具中不可或缺的一部分。通过简化特征工程,Chronon使用户能够轻松生成数千个特征以供ML模型使用。这一革命性的解决方案使ML工程师摆脱了手动管道实现的负担,使他们能够专注于构建创新模型,以满足不断变化的用户行为和产品需求。 总之,Chronon已成为Airbnb机器学习工具中不可或缺的工具。提供全面的特征管理解决方案提高了特征工程的生产力和可扩展性,使ML从业者能够提供尖端的模型,为数百万用户提供更好的Airbnb体验。

Leave a Comment

印度如何利用尖端人工智能来应对支付欺诈

在当今数字化时代,与在线交易相关的欺诈行为日益增多,给金融机构和监管机构带来了重大挑战。印度唯一身份认证机构(UIDAI)采取了积极的方法来解决付款欺诈问题,特别是与Aadhaar启用的支付系统(AePS)相关的欺诈问题。UIDAI利用人工智能(AI)和机器学习(ML)的力量,开发了围绕指纹和面部识别的创新技术。让我们深入了解这些AI措施如何帮助遏制付款欺诈并确保您的资金安全。 还阅读:基于AI的“Deepfake”欺诈:喀拉拉邦对抗骗子的持续战斗 AI驱动的指纹细节记录 – 指纹图像记录(FMR-FIR)模态 为了对抗Aadhaar认证过程中使用克隆指纹的行为,UIDAI推出了一种基于内部AI / ML技术的FMR-FIR模态。这种复杂的系统可以区分真实或“活体”指纹和克隆指纹,为AePS交易提供了额外的安全层。通过在认证过程中检查指纹的活体性,这种基于AI的解决方案显著减少了欺诈分子操纵指纹数据以非法访问银行账户的情况。 还阅读:在AI时代如何检测和处理Deepfake? 面部识别在交易认证中的作用 与印度国家支付公司(NPCI)合作,Airtel支付银行与UIDAI携手推出了基于面部识别的AePS交易认证措施。这种先进的面部识别技术由UIDAI自主开发,进一步增强了数字交易的安全性。它通过面部特征验证用户的身份,确保只有真实的个人才能进行金融交易,有效地阻止了试图利用系统的欺诈分子。 支付欺诈的上升趋势 印度的支付欺诈规模正以令人担忧的速度增长,如内政部和财政委员会的报告所述。2020-21财年报告了262,000起各种金融犯罪案件,而到2022年,这一数字激增至惊人的694,000起。其中,与支付相关的欺诈案件经历了显著增加,2023财年达到了近2000万起。这些统计数据凸显了需要强大的基于AI的解决方案来保护数字交易并保护用户免受潜在的网络犯罪的迫切需求。 还阅读:欺诈GPT:AI驱动的网络犯罪工具的惊人崛起 业务代表的挑战 虽然基于AI的技术在防止某些类型的欺诈方面已经证明有效,但它们并非没有限制。一个重要的挑战是应对由业务代表(BC)实施的欺诈行为。这些是配备生物识别POS机(PoS)的非正式银行代理,充当小型自动柜员机。在某些情况下,业务代表会虚报向个人发放的金额,使他们容易受到金融剥削。特别是在农村地区,缺乏意识加剧了这种情况,因此教育用户有关安全银行操作的重要性尤为关键。 还阅读:网络犯罪分子使用WormGPT侵犯电子邮件安全 UIDAI持续努力打击AePS欺诈 UIDAI致力于通过不断完善其基于AI的解决方案来保持领先于欺诈分子。该机构积极调查与AePS交易相关的投诉,2021年11月至2023年3月接到了超过2,000起投诉。通过与银行、政府机构和其他利益相关方合作,UIDAI旨在加强数字支付系统的安全性,并赢得印度数百万用户的信任。 还阅读:Airtel开发AI工具识别欺诈钓鱼信息 我们的观点 在快速数字化的世界中,保护数字交易的重要性不言而喻。UIDAI在打击支付欺诈方面采用的AI和ML技术的采用,标志着确保数百万印度人金融利益安全的重要进展。UIDAI通过FMR-FIR模态和面部识别等创新措施引领着确保更安全、更可靠的数字支付生态系统。在我们应对数字领域的复杂性时,让我们拥抱这些进步,并共同努力保护自己和我们辛苦赚来的钱免受网络犯罪分子的侵害。我们可以共同建立一个更安全、更值得信赖的数字未来。

Leave a Comment

革命性的蛋白质设计:这个AI研究如何通过深度学习改进使成功率提高了10倍

蛋白质是控制几乎所有疾病的聚合物结构。主要问题是找出哪种蛋白质可以与相应的蛋白质聚合物结构结合。主要的负担是从大量分子中找出这些可以结合的分子。这涉及到在这个领域使用机器学习和深度学习模型。研究科学家团队使用深度学习技术预测了分子,其大小比先前获得的分子增加了10倍。研究科学家们仍在通过深度学习模型改进亲水性键强度的质量。 深度学习算法利用原始数据提取高质量的特征和信息,如前所述。通过深度学习技术使用迭代方法研究蛋白质序列中的变化。预测或生成的结构被发现几乎接近于1的准确度。这些迭代方法用于收敛到准确预测的模型上。研究团队开发了2个用于蛋白质设计的软件工具。同时发现,由于向量形式的独立信息,所有蛋白质设计都是相互独立的。问题被分解成数百万个设计,同时在大规模计算单元上运行。 华盛顿大学、西雅图市、霍华德·休斯医学研究所和蛋白质设计研究所的研究团队将获得的蛋白质分子分成小块。然后,使用Linux设施将每个块分配给frontera的计算节点。这些较小的蛋白质实体进一步分为更小的实体。这些实体被传递到计算设计软件中。然后将其传递到蛋白质软件中以提高计算效率。这使效率提高了约200倍,与之前的记录相比。 这个结果显示了与目标蛋白质结合的研究速率增加了10倍。研究人员付出了很大的努力,但在这个路径上还有很长的路要走。这项研究的进一步计划是为蛋白质分子提供更好的目标,并提高蛋白质分子的成功率或准确率。该项目还旨在打造明天的抗癌工具。

Leave a Comment

解码集体行为:主动贝叶斯推理如何驱动动物群体的自然运动

观察到在群体成员之间的简单互动中产生的动物集体运动现象,如成群的蝗虫、成群的鱼群、成群的鸟群和成群的有蹄动物,由于其引人注目的视觉特性和其从群体成员之间简单互动中产生,已被广泛研究。最近的研究侧重于更具生物学动机的基于智能体的方法,旨在建模特定行为电路和决策规则,以控制个体行为。研究人员设计了一个基于主动推理的模型,桥接了人类行为的理论和生物学方面。 这个模型类统一了认知和基于物理的观点,提供了对自适应行为的全面理解。它关注个体如何估计与邻居的距离,并利用这些细节进行决策。它有两个部分 – 动态模型描述了距离随时间如何变化,观察模型解释了个体如何感知这些距离。主动推理更新其信念和行动以最小化惊奇。 该模型强调复杂行为是由预测驱动的简单行为产生的。在某些情况下,它收敛到传统的作用力向量,如吸引力、排斥力和一致性,这些作用力向量被作为自由能泛函,作为惊奇的上限。行为可塑性是一种有助于增强和共同表示临时波动的关键机制。与使用特定结果的附加规则或机制不同,可塑性涉及对模型参数进行自由能梯度下降。这个机制被整合到主动推理中,扩展了其应用于模型参数更新。 研究人员希望他们的工作能够成为现有集体动物行为理论模型和更多与神经/机器学习相关的领域(如主动推理和贝叶斯大脑框架)之间的桥梁。他们还强调,他们选择的模型解释了观察到的集体系统的关键属性,并有效地重现了增强和解码信息的能力,而以前的模型在不引入额外机制的情况下难以建模。

Leave a Comment

人工智能(AI)和Web3:它们如何相互关联?

什么是人工智能? 简单来说,人工智能(AI)是机器具备执行我们通常与人类思维相关的功能的能力,例如进行推理任务、解决数学问题、股票交易等等。AI的核心是将计算机科学与强大的数据集结合起来,以实现问题解决。 自问世以来,AI经历了许多炒作周期,但去年OpenAI发布的ChatGPT推动了AI的兴奋和期待达到了新的高度,这标志着一个重要的里程碑,特别是在自然语言处理领域。此外,生成模型证明了它们在语言之外的适应性,展示了学习各种数据类型的语法的能力,例如软件代码、分子、自然图像等。 AI的应用正在日益发展,本文将讨论其在Web3中的作用和用例。 什么是Web3? Web3被定义为一系列相互连接的开源应用程序。这些应用程序以区块链计算架构为动力,是去中心化的,可以在节点网络中保护和分布数据和交易,消除了对中央机构或中间人的需求。 Web1(1990-2004)是静态且只读的(例如雅虎新闻),用户只是消费信息。Web2引入了互动性(例如Facebook、YouTube),但引发了隐私问题(利用用户数据进行定向广告)和集中控制(单方面做出决策,如封锁任何特定账户)。Web3旨在去中心化,赋予用户所有权和治理权,通过区块链来解决Web2的局限性,促进更加用户控制的互联网。 Web3应用的一个例子是Brave浏览器,这是一款基于Chromium的浏览器,以其Web3集成和加密货币集成而闻名。Brave在公共区块链上运行,并利用比HTTPS更快地发送和传递数据的IPFS(一种传输协议),使用户能够轻松赚取加密货币、链接钱包、探索NFT并访问DApp。具有强大的安全功能和对在线安全的关注,Brave为Web3爱好者提供了理想的浏览体验。 来源:https://www.businessinsider.com/personal-finance/what-is-web3?IR=T AI在Web3中的作用 自治智能体 自治智能体可以提供实时数据和一组预定义规则,以增强Web3平台中智能合约的能力。此外,这些智能体可以进行协商、执行交易并提供个性化服务。使用这样的智能体可以自动化复杂的流程、减少中间人,并提升整个Web3生态系统的能力。 个性化 在Web3的背景下,人工智能(AI)通过数据分析、交互模式和偏好来打造定制的用户体验至关重要。AI采用协同过滤和基于内容的过滤技术,生成个性化的推荐,增强Web3平台的各个方面。 这种个性化通过将内容和交互与个体的需求和偏好相一致,从而促进更深入的用户参与,最终丰富去中心化的Web3体验,实现高效的内容发现和策展。 去中心化数据市场 通过利用人工智能,可以创建去中心化的数据市场,赋予个体增强的数据控制能力。AI算法能够实现选择性的数据共享和货币化,并确保隐私。它们促进数据分析、分类和高效、安全地进行交易,在这些去中心化市场中优化数据买卖方之间的匹配。 分析与洞察 通过利用机器学习和自然语言处理等人工智能方法,Web3网络可以高效地处理和分析大量数据。这使用户具备预测分析、情感分析和个性化推荐的能力,增强他们对去中心化动态的理解,并改进在这一领域的导航能力。 安全与隐私 Web3生态系统可以通过利用先进的人工智能技术来改善网络安全和保护用户数据隐私。人工智能模型可以分析大量数据以识别漏洞、恶意行为和异常情况。机器学习算法可以防止网络威胁,如钓鱼和分布式拒绝服务(DDoS)攻击。通过积极确保安全性,人工智能增强了用户对Web3平台和应用的信任和信心。 去中心化自治组织(DAOs) 人工智能在去中心化自治组织(DAOs)的发展中起着关键作用。这些基于区块链的组织通过整合人工智能和优化Web3治理模型,自动化投票、资金管理和运营,实现更大的透明度和适应性。 Web3中人工智能的实际应用示例 Medibloc…

Leave a Comment

加州大学伯克利分校的研究人员推出Dynalang:一种人工智能代理,它学习多模态世界模型以预测未来的文本和图像表示,并从想象的模型展开中学习行动

长期以来,人工智能的目标之一是创建能够与人们在现实世界中进行有机交流的机器人。现今的具身代理人可以执行简单的低级命令,例如“拿起蓝色的积木”或“经过电梯然后向右转”。然而,交互式代理人需要能够理解人们在“此时此地”之外使用语言的全部方式,包括知识传递(例如,“左上角的按钮关闭电视”),情境信息(例如,“我们没有牛奶了”)和协调(例如,“我已经清理过客厅了”)。 大部分孩子在书籍中阅读或从他人那里听到的内容都传达了关于世界的信息,无论是它如何运作还是它目前的状态。他们如何使代理人能够说其他语言?强化学习(RL)是一种教授以语言为条件的代理人解决问题的技术。然而,目前大多数使用的语言条件的RL技术是通过从任务特定的指令中产生动作来训练的,例如,通过将像“拿起蓝色的积木”这样的目标描述作为输入并生成一系列运动命令。直接将语言映射到最佳行动方案在考虑到自然语言在实际世界中扮演的各种角色时,提供了一个困难的学习挑战。 如果正在进行的工作是清理,代理人应该通过进行下一个清理步骤来回答,但如果是用餐,代理人应该收拾碗。以“我把碗放好了”为例。当语言不讨论任务时,语言与代理人最佳行动方案之间只有弱相关性。因此,仅通过将语言映射到活动的任务奖励可能是学习信号更好,以便学会使用各种语言输入完成任务。相反,他们建议,语言对代理人的一个统一功能是帮助进行未来预测。短语“我把碗放好了”可以使代理人更准确地预测未来的观察结果(例如,如果它打开柜子,它会看到碗)。 从这个意义上说,孩子们接触到的大部分语言可能根植于视觉经验。代理人可以使用先前的信息来预测环境变化,例如“扳手可以用来拧紧螺母”。代理人可以通过说“包裹在外面”来预期观察结果。这种范式还将常见的按照指令实践与预测术语结合起来:指令帮助代理人期待奖励。他们认为,预测未来表示为代理人提供了丰富的学习信号,有助于他们理解语言以及它如何与外部世界交互,类似于下一个令牌预测使语言模型能够构建内部对世界知识的表示。 加州大学伯克利分校的研究人员引入了Dynalang,一种通过在线经验获取世界的语言和视觉模型,并利用该模型理解如何行为的代理。Dynalang将使用该模型的行为学习(具有任务激励的强化学习)与使用语言模型(具有预测目标的监督学习)的世界建模分开。世界模型接收视觉和文本输入作为观察模态,这些输入被压缩为潜在空间。随着代理人与周围环境的互动,使用在线收集的数据,它训练世界模型预测未来的潜在表示。使用世界模型的潜在表示作为输入,他们训练策略采取决策以最大化任务奖励。 由于世界建模与行动是不同的,Dynalang可以在没有活动或任务奖励的情况下预先训练单模态(仅文本或仅视频数据)。此外,语言生成的框架可以统一:代理人的感知可以影响其语言模型(即其关于未来令牌的预测),从而使其能够通过在动作空间中生成语言来与环境进行交流。他们在各种语言环境中测试了Dynalang的性能。Dynalang学会了利用关于未来观察结果、环境动态和修正的语言线索,在多任务清洁房屋的环境中更快地完成家务。在Messenger基准测试中,Dynalang通过阅读游戏手册来匹配游戏的最难关卡,优于任务特定的架构。他们展示了Dynalang可以在视觉和语言复杂的环境中掌握指令,在视觉语言导航中超越了最先进的强化学习算法和任务特定的架构。 以下是他们所做的贡献: • 他们提出了Dynalang,一种使用未来预测来连接语言与视觉体验的代理。 • 他们展示了Dynalang通过学习理解各种类型的语言来应对各种任务,优于最先进的RL算法和任务特定设计。 • 他们证明了Dynalang的构想打开了新的可能性,包括在单一模型中将语言创作与纯文本预训练相结合,而无需行动或任务激励。

Leave a Comment

“认识Jupyter AI:一个新的开源项目,通过魔术命令和聊天界面将生成式人工智能引入Jupyter笔记本”

Jupyter AI,是Jupyter项目的一个官方子项目,为Jupyter笔记本带来了生成式人工智能。它允许用户解释和生成代码,修复错误,总结内容,甚至从自然语言提示生成整个笔记本。该工具将Jupyter与来自各个提供商的大型语言模型(LLM),包括AI21、Anthropic、AWS、Cohere和OpenAI,通过LangChain的支持连接起来。 设计时考虑了负责任的人工智能和数据隐私,Jupyter AI使用户能够选择他们喜爱的LLM、嵌入模型和向量数据库,以满足他们特定的需求。该软件的底层提示、链和组件是开源的,确保数据透明性。此外,它保存有关模型生成内容的元数据,方便跟踪工作流中生成的AI代码。重要的是,Jupyter AI尊重用户数据隐私,只在被请求时联系LLM,绝不会在没有明确同意的情况下读取或传输数据。 要开始使用Jupyter AI,用户可以使用pip为其JupyterLab(版本3或4)安装适当的版本。该软件提供了两个与LLM交互的界面:JupyterLab内的聊天界面和支持的笔记本环境的魔术命令界面。聊天界面内的AI助手Jupyter Naut通过文本进行通信,并提供广泛的功能。它可以回答一般问题,用简单的英语或其他语言解释代码,修改代码并识别错误。此外,用户可以使用“/generate”命令从文本提示生成整个笔记本。 聊天界面允许用户使用“/learn”命令教授Jupyternaut有关本地文件的知识。Jupyternaut使用嵌入模型将数据转换并存储在本地向量数据库中,使用户可以使用“/ask”命令对这些文件提出问题。然后,AI根据存储的信息进行回答。 在笔记本环境中,用户可以使用“%%ai”等魔术命令与LLM交互。该软件支持多个提供商,并且用户可以使用“–format”参数自定义输出格式。此外,变量插值使得与AI模型的动态交互成为可能。 Jupyter AI是在Jupyter笔记本中进行AI驱动的代码生成和辅助的有价值的工具,注重道德考虑、隐私和数据透明性。鼓励用户在执行之前审查AI生成的代码,遵循与人工编写代码相同的实践。总之,Jupyter AI是Project Jupyter的一个强大而道德的补充,提供了AI驱动的代码生成、辅助和解释,同时保护数据隐私和负责任的AI实践。

Leave a Comment

“遇见Rumi项目:面向大型语言模型的多模态语用提示”

在数字化时代兴起的技术中,大型语言模型(LLMs)已成为一种强大的工具,革新了人类社会和文化的许多方面,重塑了我们与计算机的互动方式。然而,存在一个需要解决的关键挑战。LLMs的限制显而易见,揭示了无法理解对话的上下文和细微差别以及依赖于提示的质量和特定性的差距。一个主要的限制是它们缺乏真实交流的深度,错过了所有的语际信息。 微软的Rumi项目旨在通过解决对非语言线索和上下文细微差别的理解的局限性,提升LLMs的能力。它将语际输入纳入基于提示的LLMs交互,以提高沟通质量。研究人员使用音频和视频模型从数据流中检测实时非语言线索。使用两个独立的模型从用户的音频中提取语际信息,一个是音频的韵律音调和抑扬顿挫,另一个是从语音的语义中提取的信息。他们使用视觉转换器对帧进行编码,并从视频中识别面部表情。下游服务将语际信息纳入基于文本的提示中。这种多模态方法旨在增强用户情感和意图的理解,从而将人工智能与人类的交互提升到一个新的水平。 在这项研究中,研究人员只是简要探讨了语际在传达用户意图方面提供关键信息的作用。未来,他们计划改进模型,使其更好、更高效。他们还希望添加更多细节,如从标准视频中获取的HRV(心率变异性)以及认知和环境感知。这都是为了在与人工智能的下一个交互浪潮中增加未明示的意义和意图的更大努力的一部分。

Leave a Comment

“Meta AI开源AudioCraft:一个用于音频生成的PyTorch库,用于深度学习研究”

<img src=”https://www.marktechpost.com/wp-content/uploads/2023/08/362278500_245853288291883_2304974600919081225_n-1024×576.png”/><img src=”https://www.marktechpost.com/wp-content/uploads/2023/08/362278500_245853288291883_2304974600919081225_n-150×150.png”/><p>为了使研究人员和实践者能够训练他们的模型并推动技术的发展,Meta发布了其文本到音乐生成AI“AudioCraft”的源代码。MusicGen、AudioGen和EnCodec是构成AudioCraft开发框架的三个模型。</p><ul> <li>MusicGen可以根据文本用户输入生成音乐,因为它是使用Meta拥有并经过特殊许可的音乐进行训练的。</li> <li>AudioGen可以从文本输入中创建音频,并在公开的音效中进行训练。</li> <li>EnCodec是一个三合一的AI驱动的编码器、量化器和解码器。</li> </ul><p>AudioGen可以从文本输入中创建音频,并在公开的音效中进行训练。Meta将发布改进版的EnCodec解码器,使音乐生成具有更高的质量和更少的伪影,同时还提供预训练的AudioGen模型,可用于生成环境音和音效,比如狗叫声、汽车喇叭声或者木地板上的脚步声,以及AudioCraft模型的所有权重和代码。对该技术感兴趣的研究人员可以使用这些模型。Meta很高兴首次向研究人员和实践者开放其平台,让他们能够使用自己的数据集来训练模型并为技术的发展做出贡献。</p><p>经过训练后,它可以根据用户输入的文字产生逼真且高质量的音乐或音效。AudioCraft中包含了MusicGen、AudioGen和EnCodec这三个模型。MusicGen和AudioGen可以根据各自的训练集从文本生成音乐和音效。MusicGen使用Meta拥有的和经许可的音乐,而AudioGen使用公开的音频数据集。Meta在2017年的6月和10月分别发布了两个模型:MusicGen和AudioGen。</p><p>Meta声称,AudioCraft可以通过直观的界面产生专业级的声音。他们还声称,通过采用一种新的方法,它简化了当前音频生成技术的设计。他们详细介绍了AudioCraft如何使用EnCodec神经音频编解码器从原始音频数据中提取有意义的信息。在此之后,一个自回归语言模型通过利用音乐样本(音频令牌)的预先确定“词汇表”来训练一个新的音频语言模型。这个新模型生成基于文本描述的令牌,并发送回EnCodec解码器,从而实现音频和音乐的合成。</p><p>Meta演示了AudioGen与传统的AI音乐生成器的独特之处。长期以来,音乐的象征性表示,如MIDI或钢琴卷纸,一直被用于音乐训练以生成AI模型。然而,当记录音乐表达的细微差别和审美成分时,这些方法必须进行修订。更复杂的方法涉及将原始音乐输入系统,并使用自监督音频表示学习和多级(级联模型)模型来生成音乐,以捕捉信号的长距离结构。虽然效果可能需要一些改进,但是可以生成良好的声音。</p><p>根据负责任的AI原则,Meta的研究人员正在制作AudioGen和MusicGen模型卡片,记录他们开发模型的过程,并提供给研究界以不同规模的版本。音频研究框架和训练代码以MIT许可证的形式对公众开放,以供他人使用和扩展。Meta认为,如果开发出更复杂的控制方式,这样的模型对业余和专业音乐家可能非常有用。想象一下,通过强大的开源基础,可以实现带有音效和戏剧性音乐的增强睡前故事朗读等可能性。</p>

Leave a Comment