Press "Enter" to skip to content

Tag: Tech News

这篇人工智能论文提出了一种针对大规模视觉与语言导航(VLN)训练的有效范式,并对管道中的每个组成部分的影响进行了定量评估

已经收集了多个人类演示用于学习视觉导航,最近的大规模数据集包含数百个交互场景,这些都显著提高了智能体的性能。然而,要进行如此大规模的训练需要解决一些关键的子问题,例如如何构建导航图,恢复损坏的渲染图像和生成导航指令。所有这些都对收集的数据质量产生重大影响,因此应该进行深入探索。 研究如何有效利用大规模数据来适当地训练导航智能体非常必要,一个能够理解人类自然语言并在逼真环境中导航的智能体是一个复杂而模块化的系统。 为了训练大规模的视觉与语言导航网络(VLNs),澳大利亚国立大学、OpenGVLab、上海人工智能实验室、UNC教堂山分校、阿德莱德大学和Adobe研究团队提供了一种新的范式,通过统计评估管道中每个组件的影响。他们使用Habitat模拟器,从HM3D和Gibson数据集中使用环境,为环境构建导航图。他们采样新的轨迹,创建指令,并训练智能体解决下游导航问题。 与AutoVLN和MARVAL等先前方法不同,这些导航图通过过度视点采样和聚合过程构建,采用了引入的图形创建启发式方法。这种方法产生了具有广泛室外覆盖范围的全连接网络。 研究人员还训练了Co-Modulated GAN,从HM3D和Gibson环境中的损坏生成图像的破损、变形或缺失部分生成逼真图像,减少了视觉数据噪声的影响。与MARVAL相比,这种大规模训练方案是完全可复现且易于执行的,同时明显提高了智能体的性能。 广泛的实验证明,如果智能体要在特定指令的下游任务(如R2R)上表现更好,导航图必须是完全可遍历的。此外,研究结果还表明,从新场景中学习而不仅仅是增加数据量,智能体通常可以使用更多样化的视觉数据,并提高对新环境的泛化能力。 此外,团队验证了在基于LSTM的基本模型提供的增强指令上训练的智能体在各种导航任务上表现良好。他们得出结论,通过在预训练和微调过程中将增强数据与原始数据整合,可以提高智能体的泛化能力。 令人惊讶的是,通过将上述分析作为数据增强和智能体训练的指导方针,所提出的VLN模型可以通过简单的模仿学习在R2R测试集上实现80%的成功率,而无需预探索、波束搜索或模型集成,并消除了已知和未知环境之间的导航差距。这一结果相比先前最佳方法(73%)有了巨大的改进,将性能差距缩小到了6个百分点以内,接近人类水平。对于诸如CVDN和REVERIE等几个语言引导的视觉导航挑战,该方法推动了最新技术的发展。即使增强数据是离散的,该方法在连续环境(R2R-CE)中将VLN性能提高了5%的成功率,这是一个更为现实但具有挑战性的场景。

Leave a Comment

“遇见LP-MusicCaps:一种利用大型语言模型进行标签到伪字幕生成的方法,以解决自动音乐字幕生成中的数据稀缺问题”

音乐标题生成涉及通过生成给定音乐曲目的自然语言描述来进行音乐信息检索。生成的标题是句子的文本描述,区别于其他音乐语义理解任务,如音乐标记。这些模型通常使用编码器-解码器框架。 关于音乐标题生成的研究有了显著增长。然而,尽管其重要性,研究这些技术的研究人员面临着数据集收集的昂贵和繁琐任务的障碍。此外,可用的音乐-语言数据集数量有限,这也带来了挑战。由于数据集的稀缺性,成功训练音乐标题生成模型并不容易。大型语言模型(LLMs)可能是音乐标题生成的潜在解决方案。LLMs是具有超过十亿个参数的前沿模型,能够在少量或零个示例的情况下处理任务并展现出令人印象深刻的能力。这些模型通过从维基百科、GitHub、聊天记录、医学文章、法律文章、书籍和从互联网爬取的网页等各种来源的大量文本数据进行训练。广泛的训练使它们能够理解和解释各种上下文和领域中的单词。 随后,韩国的一支研究团队开发了一种称为LP-MusicCaps(基于大型语言的伪音乐标题数据集)的方法,通过将LLMs谨慎应用于标记数据集来创建一个音乐标题数据集。他们对大规模音乐标题数据集进行了系统评估,使用了自然语言处理领域中的各种定量评估指标以及人工评估。结果生成了大约220万个与50万个音频剪辑配对的标题。首先,他们提出了一种基于LLM的方法来生成音乐标题数据集LP-MusicCaps。其次,他们提出了一种用于对LLMs生成的音乐标题进行系统评估的方案。第三,他们证明了在LP-MusicCaps上训练的模型在零样本和迁移学习场景中表现良好,证明了使用基于LLM的伪音乐标题的合理性。 研究人员首先从现有的音乐标记数据集中收集多标签标签。这些标签涵盖了音乐的各个方面,如流派、情绪、乐器等。他们仔细构建了任务说明,为音乐曲目生成描述性句子,这些句子作为大型语言模型的输入(提示)。由于其在各种任务中表现出色,他们选择了强大的GPT-3.5 Turbo语言模型来执行音乐标题生成。GPT-3.5 Turbo的训练过程包括一个具有大量数据的初始阶段,并且受益于巨大的计算能力。随后,他们使用增强学习和人类反馈进行微调。这个微调过程旨在提高模型与指令有效交互的能力。 研究人员将基于LLM的标题生成器与基于模板的方法(标签连接、提示模板)和K2C增强进行了比较。在K2C增强的情况下,当指令缺失时,输入标签会被省略在生成的标题中,导致生成的句子可能与歌曲描述无关。另一方面,基于模板的模型表现出更好的性能,因为它从模板中存在的音乐上下文中受益。 他们使用BERT-Score指标评估生成的标题的多样性。这个框架显示出更高的BERT-Score值,生成具有更多样化词汇的标题。这意味着该方法生成的标题提供了更广泛的语言表达和变化,使其更具吸引力和丰富上下文。 随着研究人员不断完善和提升他们的方法,他们也期待利用语言模型的力量来推动音乐标题生成并为音乐信息检索做出贡献。

Leave a Comment

认识LoraHub:一种战略性的人工智能框架,用于组合在不同任务上训练的LoRA(低秩适应)模块,以实现在新任务上的可适应性能

大规模预训练语言模型(LLM)如OpenAI GPT、Flan-T5和LLaMA极大地推动了自然语言处理(NLP)的快速发展。这些模型在各种NLP应用中表现出色。然而,在微调过程中,由于它们庞大的参数规模,计算效率和内存利用存在问题。 近年来,低秩适应(LoRA)的崛起成为一种有效的调优工具。它通过减少所需的内存和计算量来加快LLM的训练。LoRA通过固定主模型的参数(一个LLM)并学习一个小型的补充模块来实现这一目标,该模块可靠地在指定的任务上表现良好。 LoRA所带来的效率提升一直是以前的研究重点,但LoRA模块的模块化和可组合性却受到了极少关注。必须研究LoRA模块是否可以高效地推广到未知问题。 来自Sea AI Lab、华盛顿大学和Allen Institute for AI的研究人员决定利用LoRA的模块化能力,使其能够灵活应对新的挑战,而不仅仅局限于特定任务的训练。他们的方法的关键优势在于,它允许LoRA模块在没有人为干预或专门知识的情况下自动组装。 该方法可以通过使用以前未识别任务的几个样本自动安排合适的LoRA模块。因为研究人员不假设哪些训练在哪些任务上的LoRA模块可以集成,满足要求的所有模块(例如通过利用相同的LLM)都可以进行合并。他们将这种学习技术称为LoraHub学习,因为它使用了已有的几个不同的LoRA模块。 为了确保其有效性,团队使用行业标准的BBH基准和Flan-T5作为底层LLM来评估他们的方法。结果表明,几次少样本的LoraHub学习过程可以为新任务组合LoRA模块,效果接近少样本、上下文学习。与上下文学习相比,消除了LLM的实例输入需求,从而显著降低了推理成本。该学习技术采用无梯度的方法生成LoRA模块的系数,只需要少量的推理步骤。以单个A100为例,在不到一分钟内,该方法可以在BBH上达到顶级性能。 在LoraHub上的学习仅需要了解如何处理LLM推理。因此,它可以在仅有CPU的计算机上完成。这项工作的灵活性和高性能为创建一个平台铺平了道路,在这个领域里,训练过的LoRA模块可以轻松共享、访问和应用于新的任务。团队希望这样的系统能够允许开发一个具有广泛功能的可重用LoRA模块库。该团队正在努力动态组合LoRA节点,以提高LLM的能力,使其适用于所有人。

Leave a Comment

自动欺骗检测:东京大学研究人员利用面部表情和脉搏率通过机器学习揭示欺骗

在数字时代,自动化欺骗检测系统已经成为各个领域的重要组成部分。准确检测的需求在商业、医学、教育、执法和国家安全领域都是显而易见的。人类面试者的局限性存在着错误指控和无效检测的风险。为了解决这些挑战,东京理科大学的研究人员提出了一种结合面部表情和脉搏数据的机器学习方法,以实现全面的欺骗检测。其目标是开发一个公正可靠的系统,能够协助对犯罪受害者、嫌疑人和心理健康问题个体进行面试。研究人员强调了准确嫌疑人分类的重要性,以避免误认和维护道德和法律的考虑;他们提出了一种人工参与的方法。这种创新方法确保了道德合规性,同时在关键决策过程中实现了广泛的应用。 在相关研究中,以往的研究探索了使用各种方法进行欺骗检测。一项研究开发了一个“欺骗分析和推理引擎”,利用视频中的多模态信息来检测欺骗,AUC约为87%。另一项研究则专注于识别真实和欺骗演讲者之间的情感价值和唤醒差异,使用情感、视觉、音频和语言特征,实现了91%的AUC。AUC是欺骗检测等二元分类任务中常用的度量标准。此外,还使用了机器学习方法来基于非语言行为(NVB)检测欺骗,通过识别面部微动、凝视变化和眨眼率等线索,实现了约80%的准确率。然而,在一些研究中观察到了一些限制,因为数据收集采用了不自然的角色扮演方法。 与传统方法相比,这项创新研究引入了一种自然的方法,其中受试者自由地即兴表演欺骗行为,以提高欺骗检测的准确性。所提出的方法采用机器学习,特别是随机森林(RF)技术,创建了一个结合面部表情和脉搏数据的欺骗检测模型。数据是从四名男研究生进行随机图像讨论时进行收集的。面部表情是使用网络摄像头记录的,而脉搏率是在面试期间使用智能手表测量的。 该过程涉及标准的机器学习步骤,包括数据收集、标记、特征提取、预处理和分类。受试者被展示了各种图像,并被鼓励表达他们的想法,包括欺骗性陈述。所得到的数据集是基于受试者的意图进行标记的,特别关注的是有意的欺骗行为,而不是错误或虚假记忆。使用OpenFace库提取了记录视频中的面部关键点,并从这些关键点中提取了各种面部特征,如眉毛倾斜度、眼睛纵横比、嘴巴面积、眨眼率、凝视、头部倾斜度和脉搏率。预处理包括去除缺失值、过滤异常值,并应用欠采样来平衡正负案例。 https://link.springer.com/article/10.1007/s10015-023-00869-9 随机森林(RF)使用10折交叉验证进行训练和评估,使用准确率、精确率、召回率和F1分数等性能指标来评估其效果。值得注意的是,通过实际的远程工作面试进行的实验显示出与交叉验证结果相似的性能,证实了该方法的实际适用性。特征重要性分析突出了特定的面部特征、脉搏率以及凝视和头部运动作为不同受试者欺骗的重要指标。例如,在某些情况下,口部面积的变化、沉默和眨眼表明了欺骗行为,而其他情况则显示出欺骗过程中脉搏率和凝视方向的显著变化。 总体而言,这项研究提供了一种实用且有前景的方法,利用机器学习和面部特征分析来检测远程面试中的欺骗陈述,为实际应用提供了宝贵的见解。所提出的方法消除了人为偏见,在不同受试者中表现出了令人满意的准确度和F1分数,分别介于0.75和0.88之间。观察到了与面部表情和脉搏率相关的共同特征。然而,需要进一步研究来处理多类别分类,并包括心理评估以进行更全面的分析。尽管数据集规模有限,但这项研究为有兴趣利用自动化欺骗检测系统的面试者提供了基础,同时强调了在应用中道德考虑和合规性的重要性。

Leave a Comment

CMU研究人员提出了一种简单而有效的攻击方法,可以使对齐的语言模型以很高的成功率生成令人反感的行为

大型语言模型(LLMs)是深度学习模型在人类语言上的最新进展。这些深度学习训练模型以人类类似的方式理解和生成文本。这些模型是在从互联网、书籍、文章、网站和其他信息来源中抓取的大量数据集上进行训练的。它们可以翻译语言、总结文本、回答问题,并执行各种自然语言处理任务。 最近,人们对它们生成不受欢迎内容的能力及其带来的后果越来越关注。因此,在这个领域进行了重要的研究。 随后,来自卡内基梅隆大学计算机科学学院(SCS)、CyLab安全与隐私研究所以及旧金山人工智能安全中心的研究人员研究了语言模型中生成不受欢迎行为的方法。在他们的研究中,他们提出了一种新的攻击方法,涉及在各种查询后面添加后缀,从而极大地增加了开源和闭源语言模型(LLMs)生成对它们通常会拒绝的问题的肯定回答的可能性。 在他们的调查中,研究人员成功地将攻击后缀应用于各种语言模型,包括ChatGPT、Bard和Claude等公共接口,以及LLMa-2-Chat、Pythia、Falcon等开源LLMs。因此,攻击后缀有效地在这些语言模型的输出中引发了不受欢迎的内容。 这种方法在Vicuna上的100个实例中成功生成了有害行为中的99个。此外,在Vicuna的输出中,它们与目标有害字符串有88个完全匹配。研究人员还测试了他们的攻击方法对其他语言模型的影响,如GPT-3.5和GPT-4,成功率高达84%。对于PaLM-2,成功率为66%。 研究人员表示,目前,通过引导聊天机器人生成不受欢迎或有害内容可能不会对人们造成特别严重的直接伤害。关注点在于这些模型在没有人员监督的自主系统中将扮演更重要的角色。他们进一步强调,在自主系统变得更加现实时,确保我们有可靠的方法来阻止它们被此类攻击劫持将非常重要。 研究人员表示,他们并没有打算攻击专有的大型语言模型和聊天机器人。但是他们的研究表明,即使我们拥有大量参数的闭源模型,人们仍然可以通过查看免费提供的、更小且更简单的开源模型,并学习如何攻击它们来攻击它。 在他们的研究中,研究人员通过在多个提示和模型上训练攻击后缀,扩展了他们的攻击方法。结果,他们在包括Google Bard和Claud在内的各种公共接口中引发了不受欢迎的内容。攻击还影响了像Llama 2 Chat、Pythia、Falcon等开源语言模型,展示了不受欢迎的行为。 这项研究表明他们的攻击方法具有广泛的适用性,可以影响各种语言模型,包括那些具有公共接口和开源实现的模型。他们进一步强调,目前我们没有一种方法来阻止这种对抗性攻击,因此下一步是找出如何修复这些模型。 查看论文和博客文章。此研究的所有荣誉归功于该项目上的研究人员。此外,别忘了加入我们的27k+ ML SubReddit,40k+ Facebook社群,Discord频道和电子邮件通讯,我们在其中分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 本文摘自MarkTechPost,CMU研究人员提出了一种简单而有效的攻击方法,使对齐的语言模型以高成功率生成不受欢迎的行为。

Leave a Comment

用UniDetector检测任何你想要的东西

深度学习和人工智能在近年来在检测模型方面取得了显著的进展。尽管取得了令人印象深刻的进步,但目标检测模型的有效性主要依赖于大规模的基准数据集。然而,挑战在于目标类别和场景的变化。在现实世界中,与现有图像存在显著差异,并且可能出现新的目标类别,因此需要重新构建数据集以确保目标检测器的成功。不幸的是,这严重影响了它们在开放世界情景中的泛化能力。相比之下,即使是儿童,人类也能够在新环境中快速适应和良好泛化。因此,人工智能系统与人类智能之间的普遍性不足仍然是一个值得关注的差距。 克服这一限制的关键是开发一种通用的目标检测器,以实现对任何给定场景中所有类型的目标的检测能力。这样的模型将具备在未知情况下有效运作而无需重新训练的显著能力。这样的突破将显著接近使目标检测系统像人类一样智能的目标。 通用的目标检测器必须具备两个关键能力。首先,它应该使用来自各种来源和多样的标签空间的图像进行训练。在分类和定位方面进行大规模协作训练是确保检测器获得足够信息以有效泛化的关键。理想的大规模学习数据集应包含许多图像类型,涵盖尽可能多的目标类别,具有高质量的边界框注释和广泛的类别词汇。不幸的是,由于人类注释者的限制,实现这样的多样性是具有挑战性的。在实践中,虽然小词汇量的数据集提供了更清晰的注释,但较大的数据集存在噪声并可能存在不一致性。此外,专门的数据集专注于特定类别。为了实现普遍性,检测器必须从具有不同标签空间的多个来源学习,以获得全面和完整的知识。 其次,检测器应该展示对开放世界的强大泛化能力。它应能够准确预测在训练过程中未见过的新类别的标签,而没有显著的性能下降。然而,仅依靠视觉信息无法实现这一目的,因为全面的视觉学习需要人类注释来进行全面监督学习。 为了克服这些限制,提出了一种名为“UniDetector”的新型通用目标检测模型。 架构概述如下图所示。 要实现通用目标检测器的两个关键能力,需要解决两个相应的挑战。第一个挑战是使用多源图像进行训练,其中图像来自不同的来源,并与多样化的标签空间相关联。现有的检测器仅能预测来自一个标签空间的类别,而数据集特定的分类法和数据集之间的标注不一致性使得统一多个异构标签空间变得困难。 第二个挑战涉及新类别的区分。受近期研究中图像-文本预训练的成功启发,作者利用带有语言嵌入的预训练模型来识别未见过的类别。然而,全面监督训练往往会使检测器偏向于关注训练过程中出现的类别。因此,在推断时,模型可能会偏向基础类别,并对新类别产生不自信的预测。尽管语言嵌入提供了预测新类别的潜力,但其性能仍远远落后于基础类别。 UniDetector被设计来解决上述挑战。研究人员利用语言空间探索各种结构,以有效地训练具有异构标签空间的检测器。他们发现采用分区结构可以促进特征共享,同时避免标签冲突,这对于检测器的性能是有益的。 为了增强区域建议阶段对新类别的泛化能力,作者将建议生成阶段与RoI(感兴趣区域)分类阶段解耦,选择分别进行训练而不是联合训练。这种方法利用了每个阶段的独特特征,有助于检测器的整体普遍性。此外,他们引入了一个无类别定位网络(CLN)以实现广义的区域建议。 此外,作者提出了一种概率校准技术来消除预测的偏差。他们估计了所有类别的先验概率,然后根据这个先验概率调整了预测的类别分布。这种校准显著提高了物体检测系统中新类别的性能。根据作者的说法,UniDetector可以超过当前最先进的CNN检测器Dyhead,达到6.3%的平均精度(AP)。 这是UniDetector的摘要,它是一种针对通用物体检测设计的新型人工智能框架。如果您对该工作感兴趣并希望了解更多信息,您可以通过点击下面的链接找到更多信息。

Leave a Comment

释放数据集精简的潜力:SRe^2L在ImageNet-1K上取得了创纪录的准确性

近年来,数据压缩和蒸馏方法备受关注,彻底改革了人工智能研究。这些方法承诺高效地表示大规模数据集,实现更快的模型训练、经济高效的数据存储和关键信息的保留。然而,现有解决方案在压缩高分辨率数据集(如ImageNet-1K)方面面临巨大的计算开销。 来自穆罕默德·本·扎耶德人工智能大学和卡内基梅隆大学的研究团队推出了一个名为“Squeeze, Recover, and Relabel”(SRe^2L)的划时代数据集压缩框架。他们的突破性方法通过保留关键信息,对高分辨率数据集进行压缩,并实现了卓越的准确性。 数据集蒸馏的主要挑战是创建一个能够有效产生压缩样本并确保生成样本保留原始数据集核心信息的生成算法。由于计算和内存限制,现有方法在扩展到更大数据集时遇到困难,对于保留必要信息的能力受到阻碍。 为了解决这些挑战,SRe^2L框架采用了涉及挤压、恢复和重新标记的三阶段学习过程。研究人员首先训练一个模型,从原始数据集中捕捉关键信息。然后,他们进行恢复过程以合成目标数据,然后进行重新标记,为合成数据分配真实标签。 SRe^2L的一个关键创新在于在训练过程中解耦模型和合成数据的双层优化。这种独特的方法确保从原始数据中提取信息与数据生成过程无关。通过避免额外内存需求和防止原始数据影响生成数据的偏差,SRe^2L克服了以前方法面临的重大限制。 为了验证他们的方法,研究团队对两个数据集进行了广泛的数据蒸馏实验:Tiny-ImageNet和ImageNet-1K。结果令人印象深刻,SRe^2L在完整的Tiny-ImageNet和ImageNet-1K上分别实现了42.5%和60.8%的异常准确率。这些结果大幅超过了所有先前最先进方法14.5%和32.9%的差距,同时保持了合理的训练时间和内存成本。 这项工作的一个与众不同之处在于研究人员对可访问性的承诺。通过利用广泛可用的NVIDIA GPU,如3090、4090或A100系列,SRe^2L变得更加易于广大研究人员和从业者使用,促进合作并加速该领域的进展。 在大规模高分辨率数据集需求不断增长的时代,SRe^2L框架成为数据压缩和蒸馏挑战的变革性解决方案。它在高效压缩ImageNet-1K并保留关键信息方面的能力为各种人工智能应用中的快速高效模型训练打开了新的可能性。凭借其验证成功和易于实施的特点,SRe^2L承诺重新定义数据集蒸馏的前沿,为人工智能研究和发展开辟新的道路。

Leave a Comment

来自新加坡国立大学的研究人员提出了Mind-Video:一种利用脑部fMRI数据重现视频图像的新型AI工具

理解人类认知使得从脑部过程中重建人类视觉变得有趣,尤其是在使用功能性磁共振成像(fMRI)等非侵入性技术时。在从非侵入性脑部记录中恢复静止图像方面已经取得了很大进展,但对于连续的视觉体验(如电影)则没有太多进展。 虽然非侵入性技术只能收集有限的数据,因为它们的稳健性较差,容易受到噪声等外界影响。此外,收集神经影像数据是一项耗时且昂贵的过程。 尽管面临这些挑战,但已经取得了一些进展,尤其是通过稀疏fMRI-注释对学习有用的fMRI特征。与静态图像不同,人类的视觉体验是一种不间断、不断变化的景象、动作和物体。因为fMRI测量血氧水平依赖(BOLD)信号,并每隔几秒钟拍摄一次脑部活动的图片,所以恢复动态视觉体验可能很困难。每个fMRI读数可以被视为扫描期间脑部活动的“平均值”。相反,标准视频的帧速率为每秒30帧(FPS)。在获取一个fMRI帧的时间内,可以显示60帧的视频帧作为视觉刺激,这可能使受试者接触到各种各样的物体、动作和场景。因此,通过fMRI解码以比fMRI的时间分辨率更高的FPS检索电影是具有挑战性的。 新加坡国立大学和中国香港中文大学的研究人员引入了MinD-Video,这是一个模块化的脑部解码流水线,包括独立训练的fMRI编码器和增强的稳定扩散模型,然后进行微调。所提出的模型在不同阶段从脑部获取数据,扩展其对语义领域的知识。 首先,团队使用大规模无监督学习和脑部建模来训练通用的视觉fMRI特征。接下来,他们使用注释数据集的多模态性提取语义相关特征,并在对比学习空间的fMRI编码器中进行对比学习训练。然后,使用专门针对fMRI输入的增强稳定扩散模型与学习的特征进行共同训练,以进一步完善它们。 研究人员为生成场景动态视频的稳定扩散模型添加了近帧焦点。他们还开发了一个对抗性引导系统,以针对特定目的调整fMRI扫描。检索到了高质量的视频,并且它们的语义,如动作和场景动态,完全准确。 团队使用视频和帧级别的语义和像素指标评估了结果。在语义指标方面的准确率达到了85%,在SSIM方面为0.19,这一方法比先前最先进的方法提高了49%。研究结果还表明,根据注意力研究的结果,该模型似乎具有生物学上的合理性和可解释性,它映射到视觉皮层和更高级的认知网络。 由于个体差异,该技术在不同受试者之间的普适性尚在研究中。此方法在重建中仅使用了不到10%的皮层体素,而完全利用大脑数据的潜力尚未发挥。研究人员认为,随着构建更复杂的模型,该领域可能在神经科学和脑机接口等领域得到应用。

Leave a Comment

来自德克萨斯大学奥斯汀分校和加州大学伯克利分校的研究人员推出环境扩散:一种仅以损坏数据作为输入来训练/微调扩散模型的人工智能框架

对于学习高维分布和解决逆问题,生成扩散模型正在成为灵活而强大的框架。由于最近的几个进展,像Dalle-2、Latent Diffusion和Imagen这样的文本条件基础模型在通用图片领域取得了显著的性能。扩散模型最近展示了它们从训练集中记忆样本的能力。此外,一个对模型具有简单查询访问权限的对手可以获取数据集样本,引发隐私、安全和版权问题。 研究人员提出了第一个能够从严重受污染样本中学习未知分布的扩散基础框架。这个问题在科学背景下出现,因为获取清洁样本困难或昂贵。由于生成模型从未接触过清洁训练数据,它们不太可能记忆特定的训练样本。核心概念是在扩散过程中通过引入额外的测量失真进一步损坏原始畸变图像,然后挑战模型从另一个损坏图像中预测原始损坏图像。科学研究验证了这种方法能够生成能够根据这种额外的测量失真获取完整未受损图像的条件期望的模型。修补和压缩感知是这种泛化的两种损坏方法。通过在行业标准基准数据集上训练它们,科学家们展示了他们的模型可以学习分布,即使所有训练样本缺少90%的像素。他们还证明,即使没有记忆训练集,基础模型也可以在小规模损坏数据集上进行微调,并学习到清洁分布。 显著特征 这项研究的核心概念是进一步扭曲图像并迫使模型从图像中预测扭曲的图像。 他们的方法使用损坏的训练数据在流行的基准数据集(CelebA、CIFAR-10和AFHQ)上训练扩散模型。 研究人员根据学习到的条件期望为所需分布p0(x0)提供了一个粗略的采样器。 正如研究所示,即使缺少高达90%的像素,人们仍然可以对原始照片的分布了解很多。他们的结果比先前最佳的AmbientGAN和自然基准更好。 在训练过程中从未见过清洁图像的模型被证明在处理特定逆问题时表现出与最先进的扩散模型类似或更好的性能。而基准方法需要很多扩散阶段,这些模型只需要一个预测步骤就能完成任务。 该方法被用于进一步改进研究社区中标准的预训练扩散模型。从少量受损样本中学习分布是可能的,而且细调过程只需要在单个GPU上几个小时。 一些在不同领域的已损坏样本也可以用于微调像Deepfloyd’s IF这样的基础模型。 为了量化学习效果,研究人员通过展示与训练样本的最高相似性分布来比较使用和不使用损坏进行训练的模型。 通过在足够扭曲的数据上训练的模型被证明不会保留任何原始训练数据的知识。他们评估了失真(决定记忆水平)、训练数据和学习生成器质量之间的权衡。 限制 失真程度与生成器的质量成反比。当失真程度增加时,生成器学习记忆的可能性减少,但代价是质量下降。对这种权衡的精确定义仍然是一个未解决的研究问题。为了估计使用训练模型的E[x0|xt],研究人员在这项工作中尝试了基本的近似算法。 此外,为了对任何训练样本的保护提供严格的隐私保证,需要建立关于数据分布的假设。补充材料显示,修复预测器可以精确恢复E[x0|xt],尽管研究人员没有提供具体的技术。 如果测量中还包含噪声,则此方法将无法正常工作。使用SURE正则化可能有助于未来的研究克服这个限制。

Leave a Comment

LLM优于强化学习-遇见SPRING:一种创新的LLM提示框架,旨在实现上下文连贯思考规划和推理能力

SPRING是一种基于LLM的策略,在需要多任务规划和推理的交互环境中胜过强化学习算法。 卡内基梅隆大学、NVIDIA、亚里尔大学和微软的一组研究人员调查了使用大型语言模型(LLM)在游戏的背景下理解和推理人类知识的可能性。他们提出了一种名为SPRING的两阶段方法,其中涉及研究学术论文,然后使用问答(QA)框架来证明所获得的知识。 关于SPRING的更多细节 在第一阶段,作者阅读了Hafner(2021)的原始论文的LaTeX源代码,提取先验知识。他们使用LLM提取相关信息,包括论文中记录的游戏机制和期望的行为。然后,他们使用类似于Wu等人(2023)的QA摘要框架生成基于提取的知识的QA对话,使SPRING能够处理多样的上下文信息。 第二阶段专注于使用LLM进行上下文推理,以解决复杂的游戏。他们构建了一个有向无环图(DAG)作为推理模块,其中问题是节点,问题之间的依赖关系表示为边。例如,问题“对于每个动作,需求是否满足?”与问题“前五个动作是什么?”在DAG中有链接,从后者到前者建立了依赖关系。 通过按拓扑顺序遍历DAG,计算每个节点/问题的LLM答案。DAG中的最后一个节点表示关于采取的最佳行动的问题,LLM的答案直接转化为环境行动。 实验和结果 “Crafter Environment”是Hafner(2021)介绍的一个拥有22个成就的开放世界生存游戏,按照深度为7的技术树进行组织。游戏被表示为一个网格世界,具有自上而下的观察和由17个选项组成的离散动作空间。观察还提供有关玩家当前库存状态的信息,包括生命值、食物、水、休息水平和库存物品。 作者将SPRING与Crafter基准测试中的流行RL方法进行了比较。随后,对体系结构的不同组成部分进行了实验和分析,以考察每个部分对LLM的上下文“推理”能力的影响。 来源:https://arxiv.org/pdf/2305.15486.pdf 作者将各种RL基准与SPRING和基于Hafner(2021)环境论文的GPT-4的性能进行了比较。SPRING在游戏得分方面超过了以前的最先进(SOTA)方法,相对提高了88%,在奖励方面相对最佳RL方法(Hafner等人,2023)提高了5%。 值得注意的是,SPRING利用了阅读论文的先验知识,并且不需要任何训练步骤,而RL方法通常需要数百万次的训练步骤。 来源:https://arxiv.org/pdf/2305.15486.pdf 上图显示了不同任务的完成率的图表,将SPRING与流行的RL基准进行了比较。在技术树较深(深度达到5)且通过随机探索难以达到的成就(如“制作石镐”、“制作石剑”和“收集铁”)方面,SPRING借助先验知识的力量,表现超过RL方法十倍以上。 此外,SPRING在成就“吃牛肉”和“收集饮料”方面表现完美。与此同时,基于模型的RL框架(如Dreamer-V3)在“吃牛肉”方面的解锁率显著较低(低了五倍),这是因为通过随机探索达到移动牛的挑战。值得注意的是,尽管通过随机探索很容易实现,但SPRING不采取“放置石头”这个行动,因为在Hafner(2021)的论文中并未讨论该行动对代理有益。 限制 使用LLM与环境进行交互的一个限制是需要进行物体识别和定位。然而,在提供准确物体信息的环境中,如当代游戏和虚拟现实世界,这个限制是不存在的。虽然预训练的视觉骨干在游戏中表现困难,但在类似真实世界的环境中表现得相当不错。视觉语言模型的最新进展表明了未来在视觉语言理解方面的可靠解决方案的潜力。 结论 总之,SPRING框架展示了语言模型(LLMs)在游戏理解和推理方面的潜力。通过利用学术论文中的先前知识和采用上下文思维链的推理,SPRING在Crafter基准测试中超越了先前的最先进方法,在游戏得分和奖励方面取得了显著的改进。这些结果突显了LLMs在复杂游戏任务中的强大能力,并暗示了未来视觉语言模型的进一步发展可以解决现有的限制,为可靠且具有普适性的解决方案铺平道路。

Leave a Comment

新加坡国立大学(NTU)的研究人员推出了ResShift:一种新的上采样模型,它利用残差位移技术,相比其他方法更快地实现图像超分辨率

低级视觉中的一个基本问题是图像超分辨率(SR),其目标是从低分辨率(LR)图像恢复高分辨率(HR)图像。由于现实环境中降级模型的复杂性和不可知性,这个问题需要解决。扩散模型是一种最近开发的生成模型,在创建图像方面取得了非凡的成功。它还在解决一些下游低级视觉问题方面显示出了显著的潜力,如图像编辑、图像修补和图像上色。此外,研究人员仍在努力确定扩散模型在困难且耗时的SR任务中的表现如何。 一个典型的方法是从头开始,将LR图像引入当前扩散模型(如DDPM)的输入后,使用SR的训练数据重新训练模型。另一种常见方法是在生成所需的HR图像之前,修改无条件预训练扩散模型的反向路径。不幸的是,这两种算法都继承了支撑DDPM的马尔可夫链,可能在推理中效率低下,有时需要几百甚至几千个采样步骤。尽管已经提出了几种加速方法来压缩推理中的采样阶段,但这些策略通常会导致性能显著降低和结果过于平滑。 图1比较了近年来包括BSRGAN、RealESRGAN、SwinIR、DASR和LDM在内的最新技术的质量。对于LDM和他们的方法,他们使用公式“LDM(或我们的)-A”来表示可视化的采样步骤数量,其中“A”是总的采样步骤数。请放大以获得更清晰的查看。 必须创建一种新颖的用于SR的扩散模型,以实现效率和性能的统一,而不会牺牲其中任何一项。让我们回顾一下用于图像生成的扩散模型。在正向过程中,通过许多步骤在观测数据上逐渐构建马尔可夫链,将其转化为预先指定的先验分布,通常是传统的高斯分布。然后,可以通过从先验分布中采样噪声图像并将其输入到马尔可夫链的反向路径中来生成图像。尽管高斯先验对于图像生成是一个不错的选择,但对于SR来说可能不是最佳选择,因为LR图像已经可用。 根据他们在这项研究中的论证,用于SR的适当扩散模型应该以基于LR图像的先验分布为基础,从而实现从LR图像到HR图像的迭代恢复,而不是基于高斯白噪声。这样的设计还可以减少采样所需的扩散步骤数量,提高推理的效率。南洋理工大学的研究人员提出了一种有效的扩散模型,它使用较短的马尔可夫链在HR图像和其等效的LR图像之间进行切换。马尔可夫链的初始状态近似于HR图像的分布,而其结束状态近似于LR图像的分布。 他们精心设计了一个过渡核,逐步调整它们之间的残差,以实现这一目标。残差信息可以在多个阶段中快速传递,使该技术比当前基于扩散的SR方法更加高效。此外,他们的体系结构使得可以以清晰、分析的方式表达证据的下限,简化训练优化目标的归纳过程。他们基于这个构建的扩散核心创建了一个高度灵活的噪声调度,调节残差的移动速率和每个步骤中的噪声水平。 通过调整其超参数,该调度方案可以在检索结果的保真度和真实性之间进行权衡。简而言之,以下是本研究的重要贡献: • 他们为SR提供了一种有效的扩散模型,通过在推理过程中移动两者之间的残差,允许从不理想的LR图像到期望的HR图像的迭代采样过程。广泛的研究表明,他们的方法在效率方面具有优势,只需要15个简单步骤即可获得理想的结果,超过或至少与现有的基于扩散的SR技术相等,后者需要一个冗长的采样过程。图1显示了他们的检索结果与现有技术的对比。 • 对于建议的扩散模型,他们开发了一个高度可变的噪声调度,可以更准确地控制过渡过程中的残差和噪声水平的变化。

Leave a Comment

DeepMind人工智能通过为数百万个视频自动生成描述,为YouTube Shorts的曝光量提供了强大支持

DeepMind与YouTube合作推出了一款先进的AI模型Flamingo,旨在增强YouTube Shorts视频的可搜索性。这些短视频剪辑类似于流行的TikTok平台,通常需要更多的描述性文本和有意义的标题,以便用户更容易找到特定内容。然而,引入Flamingo后,用户现在可以更轻松地发现这些视频。 Flamingo利用其先进的视觉语言模型,通过分析YouTube Shorts视频的初始帧生成解释性文本。例如,它可以将场景描述为“一只猫在玩毛线球”。这个生成的文本被存储为元数据,实现了更高效的视频分类和搜索引擎可访问性。 Flamingo的影响已经显现,数十万个新上传的Shorts视频受益于AI生成的描述。YouTube计划逐步将这项技术应用于所有的Shorts视频,使全球观众更容易找到它们。 Flamingo代表了DeepMind和YouTube之间的最新合作,进一步巩固了DeepMind和Google Brain合并为一个统一的AI业务团队的决策,这一决策是由Google在今年四月宣布的。他们之前的合作项目包括利用DeepMind的AI模型MuZero来增强YouTube的VP9编解码器,以实现压缩传输。此外,DeepMind和YouTube在2018年合作,教育视频创作者如何通过与YouTube政策保持一致来最大化收入。这个合作伙伴关系导致了一个标签质量模型(LQM)的开发,确保更准确的内容标签以提高广告精度,并在平台上建立观众、创作者和广告商之间的信任。 继续他们富有成果的合作,DeepMind和YouTube致力于通过引入视频章节来提升用户体验。这一发展带来了一个能够自主处理视频和音频内容转录的AI系统,为章节分割和标题提供建议。这一革命性的功能被称为AutoChapters,并在2022年的Google I/O大会上由CEO Sundar Pichai公布。有了AutoChapters,用户再也不需要费力地搜索冗长的视频,因为AI系统能够迅速识别关键部分。这个功能已经应用于800万个视频,并且DeepMind计划在未来一年将其推广到8000万个视频。 关于Flamingo,YouTube Shorts制作团队明确表示,AI模型生成的元数据对创作者不可见。主要目标是显著提高搜索准确性。此外,谷歌确保Flamingo生成的文本符合其严格的责任标准,避免对视频内容进行负面描述。 随着Flamingo开始革新YouTube Shorts视频的可搜索性,其AI标签能力的准确性将受到密切关注。在这个先进AI技术的时代,Flamingo证明了DeepMind和YouTube之间的合作。通过他们的共同努力,他们不断重新定义AI创新的边界,为创作者和观众创造了更具吸引力和可访问性的环境。

Leave a Comment

此AI研究就大型语言模型(LLMs)的限制和能力在组合任务上进行了实证和理论的探讨

ChatGPT正成为热门话题,每天有数百万人在使用。凭借其惊人的能力,如问答、生成独特而富有创意的内容、总结海量文本数据、代码补全以及开发非常有用的虚拟助手,ChatGPT使我们的生活更加便捷。ChatGPT由OpenAI开发,基于GPT 3.5(生成式预训练变换器)和GPT 4的变换器架构。GPT 4是由OpenAI发布的最新版本的语言模型,具有多模态性,即它以文本和图像的形式输入,与之前的版本不同。甚至其他大型语言模型(LLM),如PaLM、LLaMA和BERT,也被用于涉及医疗保健、电子商务、金融、教育等各个领域的应用中。 一组研究人员在最近发布的研究论文中强调了类似GPT这样的大型语言模型在复杂任务上表现出色而在简单任务上的困难。研究团队对三个代表性的组合任务进行了实验:多位数相乘、逻辑网格谜题和经典的动态规划问题。这些任务涉及将问题分解为较小的步骤,并将这些步骤组合起来产生准确的解决方案。 为了研究变换器在解决需要多步推理的组合任务方面的限制,作者提出了两个假设。第一个假设是变换器通过将多步推理线性化为路径匹配来完成任务,因此依赖于模式匹配和快捷学习,而不是真正理解和实现开发正确解决方案所需的底层计算规则。这种方法在训练期间可以快速准确地预测相似模式,但无法推广到不常见的复杂示例。第二个假设认为,在尝试解决具有独特模式的高复杂性组合任务时,变换器可能存在固有限制。早期的计算错误可能会传播并导致后续步骤中的严重错误,阻止模型获得正确解决方案。 为了研究这两个假设,作者将组合任务形式化为计算图,以便调查。这些图将解决问题的过程分解为更小、更易管理的子模块化功能步骤,从而实现问题复杂性的结构化度量,并将计算步骤的语言化作为语言模型的输入序列。他们甚至使用信息增益来预测模型可能基于底层任务分布而学习的模式,而无需在图中进行完整的计算。 基于实证结果,作者提出变换器通过将多步推理简化为线性子图匹配来处理组合挑战。他们提供了基于抽象多步推理问题的理论论证,强调随着任务复杂性的增加,变换器的性能迅速下降。这表明模型在处理极度复杂的组合问题方面可能已经受到限制。 总的来说,实证和理论结果表明,与对底层思维过程的深入理解相比,变换器的性能主要受到模式匹配和子图匹配的驱动,这也支持变换器在执行越来越困难的任务时可能遇到困难的观点。

Leave a Comment

2023年最佳18款基于人工智能的网站建设工具

10Web 为了帮助网站所有者更有效地创建和管理他们的网站,10Web提供了一个由AI驱动的WordPress平台。该平台具有AI助手、AI构建器、自动化WordPress托管、BuddyBoss托管、一键迁移、实时备份、安全性和页面速度提升等技术。AI构建器的拖放式Elementor编辑器使用户可以使用AI在几分钟内设计或复制任何网站。 TeleportHQ TeleportHQ是一个由AI驱动的网站和UI构建器,使用OpenAI生成的代码。它为网站设计师提供了更快速和准确的建站方式。开发人员可以使用TeleportHQ的Vision API,将手绘线框转换为数字设计,快速从概念到工作原型。 用户可以使用AI从预制模板开始创建整个网站或特定组件。此外,TeleportHQ还提供了一个低代码环境,用于编辑和协同编辑代码,一个适用于Figma的线框插件,以及快速学习如何使用系统的教程。 AiDA Bookmark的人工智能设计助手(AiDA)通过创建和优化网站来提高用户互动和销售。它使用专利的机器学习算法来分析数百万个数据点,并偶尔提供独特的优化建议,从而消除与网站设计相关的90%的痛点。 AiDA还将提供改进用户网站的建议,以使访问者享受最佳的体验。用户还可以指定AiDA关注特定的业务目标,如生成更多的预约、提高电子商务页面浏览量、生成更多的电子邮件潜在客户、生成更多的电话呼叫,并关注特定的网站区域。 Durable AI Durable AI是一个先进的网站构建工具,利用人工智能(AI)帮助企业主快速简单地创建专业网站。Durable提供了AI生成的功能,如名称生成器、专业图片、AI编写的文本和自定义域名,让用户只需30秒就能构建自己的网站。 编辑器还允许更大程度的网站定制,包括添加标志、图片、独特对象等。Durable提供的其他功能还包括发票、客户关系管理工具、创建促销材料等,一切都在一个地方。 Appy Pie Appy Pie的无代码AI平台可以实现无编码应用程序创建和流程自动化。用户可以利用其拖放功能将他们的数据合并和简化为一个数据源,使之变得简单。他们的平台与不同的数据源和应用程序之间提供无缝的接口,打破了所有关于无代码的障碍和限制。这个平台吸引那些注重效率和价格的人,因为它价格实惠,并且比竞争对手更快地将产品推向市场。 任何需要工作流或业务流程自动化软件的人都可以使用Appy Pie的无代码AI平台,因为它结构良好、易于使用且价格合理。 B12 B12是一个专为专业服务提供商设计的平台和网站构建工具。它的功能使吸引客户、达成交易、满足客户和简化企业流程变得简单。B12的AI驱动平台会自动生成一个行业特定的网站草稿,分配一个包括文案、设计和发布专业人员的团队,帮助定制和发布网站。 OReilly、FastCompany、TechCrunch、The Wall Street…

Leave a Comment

一项新的人工智能研究提出了PanGu-Coder2模型和RRTF框架,有效地提升了预训练大型语言模型用于代码生成的能力

大型语言模型(LLMs)近几个月来引起了大量关注。这些模型通过回答相关问题、生成精确内容、翻译语言、总结长文本段落以及完成代码示例等方式模仿人类。LLMs正在迅速发展,定期推出强大的模型,展示出在代码生成任务中出色的性能。研究人员已经探索了几种技术,包括有监督的微调、指导微调、强化学习等,以提高预训练代码LLMs生成代码的能力。 最近的一项研究中,来自华为云有限公司、中国科学院和北京大学的研究人员团队引入了一种名为RRTF(Rank Responses to align Test&Teacher Feedback)的独特框架,成功而高效地增强了预训练大型语言模型的代码生成能力。RRTF框架旨在提高代码LLMs在代码生成活动中的性能,它使用自然语言LLM对齐技术和评级反馈而不是绝对奖励值。 从人类反馈中进行强化学习的方法,例如使用排名响应作为反馈而不是绝对奖励值的InstructGPT或ChatGPT等模型,为这种新颖方法提供了灵感,该方法将自然语言LLM对齐技术应用于代码LLMs。通过应用RRTF框架,该团队还引入了PanGu-Coder2模型,在OpenAI HumanEval基准测试中,该模型以出色的62.20%的一等通过率位居第一位。 通过在StarCoder 15B上使用该方法,该团队超越了PanGu-Coder并取得了所有记录的代码LLMs中最佳性能,证明了RRTF的实用性。对HumanEval、CoderEval和LeetCode三个基准的全面分析表明,代码LLMs在代码创作任务中可能能够超越相同或更大规模的自然语言模型。该研究还强调了高质量数据在提高模型遵循指令和编写代码能力方面的价值。 该团队总结了以下贡献: 引入了RRTF优化模式,该模式具有许多优点,使其成为一个与模型无关、简单直观和高效的方法。 引入了PanGu-Coder2模型,PanGu-Coder2的性能大幅超越原始模型约30%。HumanEval、CoderEval和LeetCode是一些展示这一显著速度提升的基准。 PanGu-Coder2在代码生成方面超越了所有先前发布的代码LLMs,取得了新的最先进成就。 该团队讨论了他们在构建用于代码生成的良好训练数据方面的想法和实践知识。 使用RRTF框架训练了PanGu-Coder2模型,并提供了有关该过程的有益见解。 除了提高代码生成效率,该团队还提出了PanGu-Coder2使用的优化方法,以保证快速推理。这一领域的发现有助于创建现实部署方案,因为高效的推理对于实际应用至关重要。

Leave a Comment

“认识RAP和LLM推理器:基于相似概念的两个框架,用于LLM的高级推理”

每一天都带来了大型语言模型(LLMs)的显著进展,这些模型在文本生成、情感分类、文本分类和零样本分类等各种任务中表现出色。它们的能力超越了这些领域,使内容创作、客户服务和数据分析实现自动化,从而彻底改变了生产力和效率。 最近,研究人员还开始探索使用LLMs进行推理的用途和效用。这些模型可以理解复杂的文本信息,并从中进行逻辑推理。LLMs擅长于问题回答、问题解决和决策制定等任务。然而,LLMs仍然不能像人类一样解决对人类来说很容易的问题,比如在给定环境中生成执行任务的行动计划,或者进行复杂的数学、逻辑和常识推理。LLMs在某些任务上面临困难,因为它们没有像人类那样的内部世界模型。这意味着它们无法预测在特定情况下事物的发展情况,或者模拟行动的长期结果。人类拥有内部世界模型,即对环境的心理表示,使得人类能够模拟行动及其对世界状态的影响,从而在复杂任务中进行有意识的计划。 为了解决这些问题,研究人员设计了一种新的推理框架,即基于规划的推理(RAP)。该框架使用一个库,使LLMs能够使用先进的推理算法进行复杂的推理。该框架将多步推理方法视为规划,并搜索最优推理链,以实现“世界模型”和“奖励”之间的最佳探索与开发平衡。除了RAP论文外,研究团队还提出了LLM推理器。LLM推理器是一个专门为语言模型(LLMs)设计的AI库,通过使用先进的算法,使其具备进行复杂推理的能力。它将多步推理视为规划,搜索最有效的推理链,并使用“世界模型”和“奖励”的概念优化探索和开发之间的平衡。你只需要定义一个奖励函数和(可选地)一个世界模型。LLM推理器负责处理其余的事情,包括推理算法、可视化、LLM调用等等! 世界模型将部分解决方案视为状态,并将新的行动/思考附加到状态作为状态转换。奖励函数在评估推理步骤的表现好坏方面起着关键作用。其思想是,具有更高累积奖励的推理链更有可能是正确的。 研究人员对该框架进行了广泛的研究。他们将RAP应用于数学推理和逻辑推理等几个具有挑战性的推理问题。这些任务的实际结果表明,RAP优于几种强基准方法。当应用于LLaMA33B时,RAP超越了GPT-4上的CoT,在计划生成方面实现了惊人的33%相对改进。 在推理过程中,LLM通过不断评估最佳推理步骤(行动)巧妙地构建推理树。为此,它使用其世界模型,这与以不同方式使用的相同LLM相同。通过模拟未来结果,LLM估计潜在奖励,并使用此信息更新其对当前推理步骤的信念。通过探索更好的替代方案和改进决策,它改进了推理过程。该框架提供了先进的推理算法,提供直观的可视化和解释,并与任何其他LLM库兼容。 研究人员强调,在对各种具有挑战性的推理问题进行广泛实验后,RAP优于几种基于CoT的当代推理方法。该框架甚至在某些情况下表现优于先进的GPT-4。RAP在设计奖励、状态和行动方面的灵活性展示了其作为灵活的框架处理各种推理任务的潜力。RAP将规划和推理以创新的方式结合在一起,这种方法有可能彻底改变我们对LLM推理的理解方式,为AI系统实现人类级别的战略思考和规划铺平道路。

Leave a Comment

2023年最佳40个生成式人工智能工具

ChatGPT – GPT-4 GPT-4 是 OpenAI 的最新 LLM,比其前身更具创造性、准确性和安全性。它还具备多模态能力,即能够处理图像、PDF、CSV等文件。通过引入代码解释器,GPT-4 现在可以运行自己的代码,避免产生幻觉并提供准确的答案。 Bing AI Bing AI 使用 OpenAI 的 GPT-4 模型,能够遍历网络提供准确的回答。它还具有根据用户提示生成图像的能力。 GitHub Copilot GitHub Copilot 是一种 AI 代码补全工具,可以分析代码并提供即时反馈和相关的代码建议。…

Leave a Comment

这篇来自中国的AI论文提出了HQTrack:一个用于在视频中高质量追踪任何物体的AI框架

视觉目标跟踪是计算机视觉中许多子领域的基础,包括机器人视觉和自动驾驶。该任务旨在可靠地识别视频序列中的目标对象。许多最先进的算法在视觉目标跟踪(VOT)挑战中竞争,因为它是跟踪领域中最重要的比赛之一。 视觉目标跟踪和分割竞赛(VOTS2023)取消了以往VOT挑战所施加的一些限制,使参与者可以更广泛地思考目标跟踪。因此,VOTS2023结合了对单个目标的短期和长期监控以及对多个目标的跟踪,仅使用目标分割作为位置指定。这引入了新的困难,例如精确的掩模估计、多目标轨迹跟踪和对象之间的关系识别。 中国大连理工大学和阿里巴巴达摩院的一项新研究提出了一个名为HQTrack的系统,它代表高质量跟踪。它主要包括一个视频多目标分割器(VMOS)和一个掩模优化器(MR)。为了感知复杂设置中的微小对象,研究人员采用了VMOS,这是DeAOT的增强版本,并在1/8比例上级联了一个门控传播模块(GPM)。此外,他们使用Intern-T作为特征提取器,以提高区分不同类型对象的能力。在VMOS中,研究人员仅保留最近使用的帧在长期记忆中,舍弃旧帧以腾出空间。然而,应用大型分割模型来改进跟踪掩模可能是有用的。复杂结构的对象对SAM的预测尤其具有挑战性,并且在VOTS挑战中经常出现。 使用已经预训练的HQ-SAM模型,团队可以进一步提高跟踪掩模的质量。最终的跟踪结果是从VMOS和MR中选择的,并且使用预测掩模的外包围框作为盒子提示,与原始图像一起输入HQ-SAM以获得优化后的掩模。HQTrack在VOTS2023比赛中以0.615的质量得分获得第二名。

Leave a Comment

Stack Overflow 发布 Overflow 开发者社区与人工智能的融合

Stack Overflow,这个为开发者提供答案和知识的知名平台,迈出了具有重大意义的一步,宣布了其新的路线图,开启了一个全新的时代,以生成式人工智能的整合为标志。这一富有远见的倡议名为OverflowAI,承诺提升平台的能力,改进搜索功能,并为全球的开发者提供无缝体验。 这一变革性计划的核心是引入语义搜索,这是传统词汇搜索方法的强大升级。通过利用向量数据库的潜力,Stack Overflow旨在向用户查询提供更加智能的响应,与他们的研究主题精确对齐。目标是创建一个真正的对话式、以人为本的搜索体验,开发者可以即时访问由GenAI驱动的可靠和准确的解决方案。这种方法的独特之处在于始终专注于信任和归属,确保贡献者的努力得到认可和回报。 OverflowAI的好处不仅限于公共平台,因为这些增强的搜索功能也将集成到Stack Overflow for Teams中。这意味着客户可以快速找到相关的答案,同时利用可信赖的来源,包括Stack Overflow for Teams、公共平台和其他知识库,如Confluence和GitHub。 OverflowAI最令人兴奋的一个方面是为Stack Overflow for Teams引入了“企业知识摄取”。这一突破性功能使用户能够利用现有的、准确和可信赖的内容,在几分钟内建立一个全面的知识库。利用人工智能和机器学习算法,系统将创建初始的标记结构,并根据团队最频繁的查询领域推荐相关的问题和答案。这个由AI驱动的过程高效地启动了一个Stack Overflow社区,使开发者能够专注于策划和完善内容,以确保准确性和相关性。通过投票、编辑、评论和浏览等质量和准确性的指标,所有的知识都可以在内部社区中被发现和重复使用,创建了一个有价值的信息枢纽。 为了进一步提高可访问性,Stack Overflow将Stack Overflow for Teams的知识库与他们的新聊天机器人StackPlusOne无缝集成到了Slack中。这个巧妙的整合允许即时访问最具技术挑战的解决方案,从Teams的实例和Stack Overflow公共平台的经过验证的来源中获取。GenAI以对话形式提供响应,确保组织中非技术性成员也可以轻松理解这些信息。 Stack Overflow不仅将AI整合到平台中,而且还积极培育以AI为中心的知识共享社区。GenAI Stack…

Leave a Comment

纽约大学和Meta AI研究人员通过学习用户和已部署模型之间的自然对话,改进社交对话代理,无需额外注释

人类输入是改善社交对话模型的关键策略。在带有人类反馈的强化学习中,当需要许多人类注释来保证令人满意的奖励函数时,学习从反馈中取得了巨大的改进。反馈的来源包括用户对对话转折或对话情节的数字分数、排名或自然语言评论,以及对机器人转折的二元评估。大多数工作有意利用众包工人收集这些信号,因为自然用户可能不愿意被打扰或者如果他们这样做可能提供不准确的信息。 在这项研究中,来自纽约大学和Meta AI的研究人员考虑到他们有很多部署时的对话情节,这些情节展示了模型与真实用户之间的真实讨论。他们试图确定是否可以从这些自然用户讨论中获取任何隐含的指示,并利用这些信号来增强对话模型。这样做有两个原因。首先,尽管他们可能不提供明确的注释,但自然用户最接近未来部署的数据分布。其次,使用先前对话情节中的隐含信号可以节省用于众包的金钱。 图1:方法的总体概述。从人类和机器人之间的对话中获取隐含信号,例如下一个人类转折是否会很长或很短、快乐或不快乐。 更准确地说,他们研究了是否可以调整聊天机器人以使用最佳的隐含反馈信号,如即将到来的人类答案的数量、长度、情感或响应性。他们使用来自BlenderBot在线部署的公开可用的去标识化数据来研究这个问题。使用这些数据,他们训练样本和重新排序模型,比较各种隐含反馈信号。通过自动化和人工判断,他们发现他们的新模型优于基线回复。此外,他们还询问是否支持这些措施会导致不良行为,因为他们的隐含反馈信号是两个生成质量的粗略代理指标。 是的,这取决于使用的信号。特别是,优化更长的讨论长度可能导致模型提出有争议的观点或以敌对或争斗的方式回复。另一方面,优化积极的回应或情绪相对于基线减少了这些行为。他们得出结论,来自人类的隐含反馈是一种有益的训练信号,可以提高整体性能,但所采用的具体动作具有重要的行为影响。

Leave a Comment

预测高风险妇女的癌前变化:一种突破性的基于乳腺X光摄影的深度学习方法

人工智能和深度学习的进步为改善医学诊断和患者护理开辟了新的途径。《放射学:人工智能》杂志上最近发表的一项研究表明,一种基于乳腺摄影的深度学习(DL)模型在检测高风险乳腺癌女性的癌前变化方面具有潜力。这项研究对于提高乳腺癌检测和风险分层的前景具有重要意义,特别是对于易感人群。 该研究侧重于利用一个DL模型,该模型是在大量筛查乳腺摄影图像的数据集上进行训练的。 使用接收者操作特征曲线下面积(AUC)来评估DL模型的性能,以衡量其预测准确性。结果显示出令人期待的结果,DL模型在一年的AUC方面达到了71%,在五年的AUC方面达到了65%,用于预测乳腺癌。尽管传统的乳腺影像报告和数据系统(BI-RADS)系统在一年的AUC方面稍高达到了73%,但DL模型在长期乳腺癌预测方面表现更好,其五年AUC为63%,而BI-RADS为54%。 该研究还深入探讨了影像在预测未来癌症发展方面的作用,进行了镜像实验,评估DL模型在检测早期或癌前变化方面的准确性,这些变化在标准乳腺摄影图像中可能不明显。结果表明,对于影像中存在未来癌症的情况,正向镜像产生了62%的AUC,而负向镜像则显示了51%的AUC,突显了DL模型在检测癌前或早期恶性变化方面的潜力。 一个特别有前景的发现是DL模型在短期风险分层中作为BI-RADS系统的补充。将DL模型的结果与BI-RADS评分结合起来,可以改善区分度,表明DL工具可以增强筛查乳腺摄影图像的评估,并提供更准确的近期风险评估预测。 研究人员还强调了DL模型的训练数据集侧重于低风险高风险女性,警告不要直接将研究结果推广到乳腺癌平均风险的女性。需要进一步研究探索DL模型在不同人群中的适用性以及其在更广泛的患者群体中辅助乳腺癌检测和风险评估的潜力。 总的来说,该研究强调了DL模型在乳腺癌检测和风险分层方面的巨大潜力,特别是对于高风险个体。它为未来的研究提供了铺路,以改进DL模型,拓展其在不同人群中的应用,最终促进乳腺癌诊断和患者预后的改善。随着技术的进步,基于人工智能的解决方案可以革新乳腺癌筛查和管理,实现早期发现和改善患者护理。

Leave a Comment

麻省理工学院和斯坦福大学的研究人员开发出一种机器学习技术,可以高效地学习控制机器人,从而在使用更少数据的情况下实现更好的性能

来自麻省理工学院和斯坦福大学的研究人员引入了一种新颖的机器学习技术,有潜力在动态环境和快速变化条件下彻底改变机器人(如无人机和自动驾驶车辆)的控制。 这种创新的方法将控制理论原则纳入机器学习过程中,从而可以创建更高效和有效的控制器。研究人员的目标是学习系统动力学内在结构,以设计出更优秀的稳定控制器。 该技术的核心是将控制导向结构整合到模型学习过程中。通过从数据中联合学习系统动力学和这些独特的控制导向结构,研究人员能够生成在真实场景中表现出色的控制器。 与传统的机器学习方法需要单独的步骤来推导或学习控制器不同,这种新方法可以直接从学习到的模型中提取出有效的控制器。此外,由于包含了这些控制导向结构,该技术在少量数据的情况下实现更好的性能,因此在快速变化的环境中特别有价值。 这种方法的灵感来自机器人学家如何利用物理学来推导简化的机器人模型。这些手动推导的模型基于系统的物理特性捕捉了基本的结构关系。然而,在复杂的系统中,手动建模变得不可行,研究人员通常使用机器学习来将模型拟合到数据上。现有方法的挑战在于它们忽视了基于控制的结构,而这对于优化控制器性能至关重要。 麻省理工学院和斯坦福大学团队的技术通过在机器学习过程中引入控制导向结构来解决这个限制。通过这样做,他们可以直接从学习到的动力学模型中提取控制器,有效地将基于物理学的方法与数据驱动的学习相结合。 在测试中,新的控制器紧密地跟随期望的轨迹,并优于各种基准方法。值得注意的是,从学习到的模型中派生的控制器几乎与使用精确系统动力学构建的基准控制器的性能相匹配。 该技术还具有数据效率高的特点,在最少的数据点上取得了出色的性能。相比之下,使用多个学习组件的其他方法在数据集较小时性能迅速下降。 这种数据效率对于机器人或无人机需要快速适应快速变化条件的场景尤其有希望,非常适合实际应用。 研究的一个值得注意的方面是其普适性。该方法可以应用于各种动力系统,包括机器人手臂和在低重力环境中运行的自由飞行航天器。 展望未来,研究人员有兴趣开发更可解释的模型,以便识别动力系统的特定信息。这可能会导致性能更好的控制器,进一步推动非线性反馈控制领域的发展。 该研究的专家们赞扬了将控制导向结构作为学习过程中的归纳偏见的贡献。这种概念创新导致了高效的学习过程,产生了具有有效、稳定和强大控制能力的动态模型。 通过在学习过程中引入控制导向结构,这种技术为更高效和有效的控制器打开了令人兴奋的可能性,使我们离机器人在复杂场景中具有出色的技能和适应性的未来更近了一步。

Leave a Comment

中国的一项新的人工智能研究提出了SHIP:一种即插即用的生成式人工智能方法,用于改进现有的微调方法

本文介绍了一种名为合成提示(SHIP)的新方法,用于改进现有的微调方法。 微调:在预训练之后,模型会在一个较小的、特定任务的数据集上进行微调。这涉及到在新数据上继续训练过程,通常使用较小的学习率。其思想是调整模型从预训练中获得的泛化知识,使其更适用于特定任务。 研究人员要解决的问题是某些类别缺乏数据的情况。他们的目标是训练一个生成模型,可以通过提供类别名称合成特征,从而能够为没有数据的类别生成特征。 为没有数据的类别生成特征是指为训练数据集中不存在的类别或类别合成表示的过程。这在收集某些类别的真实数据可能具有挑战性或不可能的情况下特别有用。 研究人员随后使用现成的方法对CLIP进行了原始标记和新合成特征的微调。然而,一个重要障碍是生成模型通常需要大量数据进行训练,这与他们的数据效率目标相矛盾。他们提出利用变分自编码器(VAE)作为框架,相比于需要对抗训练的模型,在低数据场景中更易于训练且更有效。 尽管GAN和VAE都是能够创建新数据样本的生成模型,但它们在架构、目标和训练方法上存在显著差异。GAN以生成高质量、逼真样本而闻名,但训练难度较大。而VAE提供了一个概率框架,在有限数据的情况下更易于处理,但可能不如GAN产生锐利或逼真的样本。 CLIP(对比式语言-图像预训练)是OpenAI开发的一种模型,可以从文本描述中学习理解和生成图像,反之亦然。它已经在大规模数据集上进行了预训练,并具有对齐的视觉和语言表示。预训练的语言编码器有助于生成更逼真的特征。本文旨在通过利用合成数据来增强CLIP微调方法的性能。研究人员在基于新的泛化、跨数据集迁移学习和广义零样本学习的综合实验中进行了全面的实验,取得了最先进的性能。 所提出的模型架构利用VAE框架对特征进行编码和生成,与CLIP集成以提取图像特征并重构它们。在训练过程中,模型学习将特征编码为潜在空间,然后重构它们。在生成阶段,它使用这个学到的编码为新类别合成特征,允许在某些类别没有数据的情况下对CLIP进行微调。基于CLIP的新颖生成器由轻量级MLP和冻结的CLIP文本编码器组成,在转换潜在代码和构建最终提示符进行特征重构方面起到关键作用。 研究人员观察的实验结果: 基于新的泛化:实验在11个不同的图像分类数据集上进行,包括ImageNet、Caltech101、OxfordPets、StanfordCars、Flowers102、Food101、FGVCAircraft、SUN397、DTD、EuroSAT和UCF101。数据集被分为基类和新类,每个基类以16个样本进行训练。评估同时针对基类和新类进行。 广义零样本设置:本文还在更现实的广义零样本设置下评估了基于新的泛化,其中基类和新类的数据混合在测试数据集中。结果表明,以前的方法在新类别中的性能显著下降,但提出的SHIP方法在新类别中的性能继续提高。 与其他方法的比较:结果与其他方法进行了比较,包括CLIP、CoOp、CLIP-Adapter和Tip-Adapter。提出的SHIP方法在各个数据集中的新类别中表现出了改进的性能。 结论: 本文提出了一种新颖的SyntHesIzed Prompts (SHIP)方法,旨在改进现有的微调方法,特别是在某些类别没有数据的情况下。该方法通过为没有数据的类别合成特征,并使用原始标记和新合成特征对CLIP进行微调,实现了各种任务的最先进性能。本文指出了额外的训练成本作为一种限制,并表达了在未来研究中探索SHIP在密集预测任务中的适用性的意愿。 总体而言,本文通过解决某些类别数据稀缺的挑战,并利用合成数据提高CLIP微调方法的性能,在该领域提出了重要贡献。

Leave a Comment

“认识高级推理基准(ARB):一个评估大型语言模型的新基准”

自然语言处理在最近几年取得了显著进展,特别是创建了复杂的语言模型。几乎所有的自然语言任务,包括翻译和推理,在像GPT 3.5、GPT 4、BERT、PaLM等著名模型的性能方面都取得了显著进步。一些基准用于评估和评估人工智能领域中这些发展。基准基本上是一组标准化任务的集合,用于测试语言模型的能力。 考虑到GLUE和SuperGLUE基准,它们是最早的几个语言理解基准,像BERT和GPT-2这样的模型更具挑战性,因为语言模型一直在击败这些基准,引发了模型开发和基准难度之间的竞争。通过使模型变得更大并在更大的数据集上进行训练,可以提高性能。LLMs在各种基准测试中展示了出色的表现,评估了它们的知识和数量推理能力,但是当这些模型在当前标准上得分更高时,很明显这些基准已不再适用于评估模型的能力。 为了解决这些限制,一组研究人员提出了一个新的独特基准,称为ARB(高级推理基准)。ARB旨在传达各种学科领域(如数学、物理、生物学、化学和法律)中更困难的问题。与早期的基准相比,ARB侧重于复杂的推理问题,以提高LLM的性能。该团队还引入了一组数学和物理问题,作为ARB的子集,需要复杂的符号思维和深入的学科知识。这些问题非常困难,超出了当前LLMs的范围。 该团队对ARB基准进行了评估,包括GPT-4和Claude。这些模型在处理这些困难的复杂性方面遇到了困难,这些发现表明它们在ARB中更困难的任务上的表现得分明显低于50%。该团队还演示了一种基于评分表的评估方法,以改进评估过程。通过使用这种策略,GPT-4可以评估自己的中间推理过程,试图解决ARB问题。这扩大了审查过程的范围,并揭示了模型的问题解决策略。 ARB的符号子集也经过了人工审查。人工注释员被要求解决问题并提供自己的评估。人类评估者和GPT-4的基于评分表的评估分数之间存在有希望的一致性,表明模型的自我评估与人类判断相当一致。在需要专业推理的数量领域中,新数据集明显优于以前的基准,其中有数百个问题。 与过去基准中的多项选择题不同,大部分问题由简答和开放式回答组成,这使得LLMs更难进行评估。通过专家级推理任务和更现实的问题格式的结合,可以更准确地评估模型处理复杂的现实问题的能力。

Leave a Comment

遇见FACTOOL:一种用于检测大型语言模型(例如ChatGPT)生成的文本中事实错误的任务和领域无关框架

GPT-4是生成式人工智能(AI)技术的一个例子,它将自然语言处理中的多个任务结合成一个单一的序列生成问题。这种统一的架构具有卓越的效率和交互性,使用户能够使用自然语言界面执行各种活动(包括代码生成、数学问题解决和科学出版物的创建)。然而,这种生成式范式也带来了一些特定的困难。由于大型语言模型(LLMs)的限制,自动生成的文本经常显示错误或偏离事实。 LLMs往往会创建出令人信服的信息,但可能需要在事实上更准确或精确。这种限制限制了生成式AI在医疗、金融和法律等高风险行业的使用。因此,必须通过系统地识别这些错误来改进所创建材料的实用性和可靠性。例如,用于质量保证的检索增强验证模型、用于文本摘要的幻觉检测模型以及用于代码的执行评估模型等都是当前文献中关注的检测和减轻机器学习模型产生的事实错误的单一特定任务的例子。 鉴于LLMs处理的活动和领域的非凡灵活性,这些方法已经在各自的领域取得了成功。然而,拥有一个更全面的事实性检测和验证框架同样重要。此外,事实性检测的问题在当前文献中通常被概括为:(i)在给定一个主张的情况下评估一个主张是否事实准确,或者(ii)检测生成的主张是否得到给定证据的支持。 在用户与生成模型(如ChatGPT)进行交互时,他们经常需要评估长篇生成的事实准确性,而不是明确的主张和证据,因此需要更好地匹配这个任务定义。在这项研究中,来自上海交通大学、卡内基梅隆大学、香港城市大学、纽约大学、Meta AI、香港科技大学和上海人工智能实验室的研究人员提供了FACTOOL,这是一个任务和领域无关的框架,用于查找LLM生成的文档中的事实错误。在图1中,他们将“工具使用”和“事实性检测”的概念联系起来,并解释了他们的方法。 图1:带有工具增强的事实性检测框架。 为了获得所创建信息的事实性证据,FACTOOL专门使用多种资源,如Google搜索、Google学术、代码解释器、Python甚至LLMs。此外,他们的方法利用LLMs的批判性思维能力,根据可用数据评估内容的事实性。他们创建了一个基准,并对四个任务进行了实验: 基于知识的质量保证 代码生成 解决数学问题 撰写科学文献综述 他们解决了事实性识别的工作,并扩展了它以实现对最新生成式AI模型的更全面审计。根据他们对使用FACTOOL的现代聊天机器人的事实性分析,GPT-4在几乎所有情况下都具有最高的事实性。基于知识的质量保证测试显示,经过精心调整的聊天机器人(Vicuna-13B)具有可观的事实性。然而,它们在撰写科学文献综述和解答算术问题等更困难的任务上还存在困难。

Leave a Comment

谷歌DeepMind与东京大学研究人员推出WebAgent:一种由LLM驱动的代理,可以根据自然语言指令在真实网站上完成任务

通过利用大型语言模型(LLM)的HTML理解和多步推理能力,可以解决一些自然语言任务,包括算术、常识、逻辑推理、问答任务、文本生成,甚至是交互式决策任务。在自主网页导航方面,LLM最近在满足给定的自然语言指令时通过一系列计算机动作控制计算机或浏览互联网展现出了出色的成功。然而,预先定义的动作空间的缺失、与模拟器相比更长的HTML观察以及LLM缺乏HTML领域知识都对实际网站上的网页导航产生了负面影响(图1)。 图1:实际网页导航的困难。现代语言模型代理可以探索虚拟网站,在那里他们控制预定义的操作并接收经过简化且易于理解的HTML文本。然而,在导航实际网站时,代理必须处理开放性任务和包含多个与任务无关的组件的较长HTML文本,因此语言模型代理仍然面临困难。 由于指令的复杂性和开放性的实际网站,预先选择正确的动作空间并不容易。尽管有各种研究表明指令微调或从人类输入中进行强化学习可以提高HTML理解和在线导航的准确性,但目前的LLM只有在处理HTML文本方面偶尔具有最佳性能设计。大多数LLM都优先考虑广泛的任务泛化和模型大小可扩展性,通过优先选择较短的上下文持续时间而不是真实网页中的典型HTML令牌,并且不采用过去用于结构化文档的方法,包括文本-XPath对齐和文本-HTML令牌分离。 即使对这样的长文本应用令牌级别的对齐,成本也相对较低。通过在程序空间中对规范的Web操作进行分组,他们提供了WebAgent,这是一个由LLM驱动的自主代理,可以在实际网站上执行导航任务并遵循人类命令。通过将自然语言指令分解为更小的步骤,WebAgent实现了以下功能: 为每个步骤规划子指令。 基于子指令将较长的HTML页面压缩为与任务相关的片段。 在实际网站上执行子指令和HTML片段。 在这项研究中,来自Google DeepMind和东京大学的研究人员结合了两个LLM,创建了WebAgent:最近创建的HTML-T5是一个专业领域的预训练语言模型,用于工作规划和条件HTML摘要生成。Flan-U-PaLM用于基于代码的生成。通过在编码器中包含本地和全局注意力方法,HTML-T5专门用于更好地捕获较长HTML页面的结构语法和语义。它是自我监督的,使用CommonCrawl1创建的大型HTML语料库进行预训练,并结合了长跨度去噪目标。现有的LLM驱动代理通常使用单个LLM完成决策任务,并为每个任务提示各种示例。然而,对于现实世界的任务来说,这是不够的,因为其复杂性超过了模拟器的复杂性。 通过全面的评估,他们的集成策略与插件语言模型相结合,可以提高HTML理解和连接性,并提供更好的泛化能力。全面的研究表明,将任务规划与HTML摘要结合在专门的语言模型中对于任务性能至关重要,可以使实际在线导航的成功率提高50%以上。与声音基准相比,WebAgent在静态网站理解任务中的问答准确性表现优异,并且具有可比较的性能。此外,HTML-T5还作为WebAgent的关键插件,可以独立地在基于Web的任务上产生尖端结果。在MiniWoB++测试中,HTML-T5比天真的局部-全局注意模型及其指令微调变体表现更好,比以前最佳技术提高了14.9%的成功率。 他们主要做出了以下贡献: • 他们提供了WebAgent,该代理结合了两个LLM,用于实际的网络导航。通用语言模型生成可执行程序,而领域专家语言模型处理规划和HTML摘要。 • 通过采用局部-全局注意力和在大规模HTML语料库上进行长跨度去噪预训练的组合,他们提供了HTML-T5,一种新的HTML特定语言模型。 • 在真实的网站中,HTML-T5的成功率显著提高了50%以上,在MiniWoB++中,它超过了之前的LLM代理14.9%。

Leave a Comment

MLOps覆盖整个机器学习生命周期:论文摘要

这篇AI论文对MLOps领域进行了广泛的研究。 MLOps是一门新兴的学科,专注于自动化整个机器学习生命周期。调查涵盖了广泛的主题,包括MLOps流水线、挑战和最佳实践。它深入探讨了机器学习过程的各个阶段,从模型需求分析、数据收集、数据准备、特征工程、模型训练、评估、系统部署和模型监控等开始。此外,它还讨论了整个生命周期中的业务价值、质量、人类价值和伦理等重要考虑因素。 该论文旨在全面调查MLOps,并强调其在自动化机器学习生命周期中的重要性。调查涵盖了多个主题,包括MLOps流水线、挑战、最佳实践以及机器学习过程的各个阶段。 本文在下图中提供了一个概览: https://arxiv.org/abs/2304.07296:机器学习流程 模型需求分析 为了启动一个机器学习项目,利益相关者必须分析和确定模型需求。本节概述了四个考虑因素:业务价值、模型质量、人类价值(隐私、公平性、安全性和问责制)以及伦理。鼓励利益相关者定义目标,评估用于识别价值和问题的工具,优先考虑需求,涉及相关利益相关者,并确定必要的功能。 数据收集和准备 数据准备阶段在确保机器学习任务的高质量数据方面起着至关重要的作用。本节介绍了数据收集、数据发现、数据增强、数据生成和ETL(提取、转换、加载)过程。强调了数据质量检查、数据清洗、数据合并、数据匹配以及进行探索性数据分析(EDA)以获得数据集洞察的重要性。 特征工程 特征工程对于提高预测建模性能至关重要。本节重点介绍了特征选择和提取、特征构建、特征缩放、数据标记和特征填充等技术。提到了与每种技术相关的具体算法和方法,包括主成分分析(PCA)、独立成分分析(ICA)以及标准化和归一化。 模型训练 模型训练阶段涵盖了不同类型的机器学习模型,包括有监督学习、无监督学习、半监督学习和强化学习。本节讨论了模型选择,包括为特定问题选择适当模型的过程。还探讨了模型选择的方法,如交叉验证、自助法和随机拆分。还讨论了超参数调优,即优化模型参数的过程。 模型评估 模型评估侧重于使用各种指标评估模型的性能。本节介绍了常见的评估指标,如准确率、精确率、召回率、F值和ROC曲线下的面积(AUC)。强调同时考虑模型性能和业务价值的重要性。 系统部署 系统部署涉及选择适当的ML模型操作平台,集成系统,进行系统集成测试,并将系统发布给最终用户。解释了部署策略,包括金丝雀部署和蓝绿部署。还讨论了部署ML系统所面临的挑战,以及实现顺畅部署过程的提示。 模型监控 本文强调在ML系统中进行模型监控的重要性。强调开发人员在ML模型监控和维护方面缺乏知识和经验。本节探讨了模型监控的各个方面,包括漂移检测、模型监控质量、合规性、系统日志记录和模型解释(XAI)。提供了监控数据分布变化、确保模型性能、符合行业特定标准和法规、用于ML流水线的系统日志记录以及实现模型透明度的洞察。 结论 本文通过讨论MLOps的未来以及需要解决的可扩展性和可靠性挑战来总结。它强调了对机器学习模型进行持续监控和维护的重要性,以实现长期成功。 总之,这份综合调研涵盖了MLOps领域内整个机器学习生命周期。它为MLOps管道、挑战、最佳实践、模型需求分析、数据准备、特征工程、模型训练、评估、系统部署和模型监控提供了宝贵的见解。通过详细研究这些主题,本调研旨在帮助研究人员和从业者全面了解MLOps及其实际意义。

Leave a Comment

认识Mentat:一种AI工具,它可以在命令行中协助您完成任何编码任务,并允许它在多个文件中进行编辑协调

术语“Mentat”源于著名作家弗兰克·赫伯特(Frank Herbert)在他的《沙丘》系列科幻书籍中创造的概念。Mentat是经过培训的人类或机器人,类似于人工智能,能够执行复杂的任务,如机器学习和数据分析。他们在执行这些任务时不使用计算机。他们通过大量的训练数据集来增强这些能力。Mentat的角色类似于顾问和分析师。 Mentat是一种能够从命令行协调多个文件的任何编码任务的AI工具。研究人员仍在开发Mentat,因为存在一些问题。最主要的错误是当用户从GitHub账户安装时,总是会出现无效语法的错误。但是,这些问题已经在Python的高级版本中得到解决。第二个错误是由于SSL证书导致的。研究人员表示,SSL证书错误可能是由于证书过期、域名不匹配、自签名证书、不完整的证书链、证书被吊销和弱密码协议等引起的。为了解决这些错误,研究人员建议确保我们在正确的网站上。他们还告诉我清除浏览器中的缓存和Cookie。如果问题仍然存在,他们还提到可以尝试从不同的浏览器访问网站。 Mentat的代码库非常庞大。因此,研究人员建议只检索代码库的一小部分,这样有助于将所有代码库整合到发送给LLM的提示中。提示是与人工智能进行对话的工具。另一个问题涉及使用的API。根据研究团队的说法,用户还可以使用本地llama模型代替OpenAI API。随着问题的解决,Mentat在后期也有所发展。如前所述,Mentat是进化而来的人类机器人,能够执行复杂的数据分析和机器学习任务。 研究人员还提到Mentat在各种领域都有应用。它们也用于处理大型项目。借助Mentat的帮助,可以轻松处理大型项目,因为它们为其提供指导。它们还修复测试错误和清理测试。Mentat还在金融分析和预测、网络安全和威胁分析、医疗保健、自然语言处理、研究、优化、自动驾驶车辆、游戏和欺诈检测等各个领域中找到应用。这些是Mentat应用的一些重要领域。

Leave a Comment

在无源领域适应中突破障碍:NOTELA对生物声学和视觉领域的影响

深度学习在各种应用领域取得了重要的进展。一个重要的贡献因素是越来越大型的数据集和模型的可用性。然而,这一趋势的一个缺点是,训练最先进的模型也变得越来越昂贵,这引起了环境问题,并对一些从业者的可访问性造成了困扰。此外,在部署过程中,直接重用预训练模型可能会导致性能下降,因为面对分布转移。研究人员已经探索了无源域自适应(SFDA)来解决这些挑战。这种技术在没有访问原始训练数据的情况下,将预训练模型适应到新的目标域。本文重点介绍了SFDA问题,并介绍了一种名为NOTELA的新方法,旨在解决音频领域(特别是生物声学)中的分布转移问题。 广泛用于鸟类物种分类的生物声学数据集(XC)包括: 聚焦录音。 在自然条件下针对个体鸟类。 通过全向麦克风获取的声景录音。 它存在独特的挑战,声景录音具有较低的信噪比,同时多只鸟类同时发声,以及环境噪音等显著的干扰因素。此外,声景录音是从不同地理位置收集的,导致标签出现极端转移,因为XC中的物种只有一小部分可能出现在特定区域。此外,源域和目标域都存在类别不平衡问题,并且由于每个录音中存在多个鸟类物种,该问题是一个多标签分类任务。 在这项研究中,Google研究人员首先评估了生物声学数据集上的几种现有SFDA方法,包括熵最小化、伪标注、降噪师生和流形正则化。评估结果显示,虽然这些方法在传统视觉任务中取得了成功,但在生物声学中的表现差异显著。在某些情况下,它们的性能甚至不如没有自适应。这个结果凸显了需要专门的方法来处理生物声学领域的独特挑战。 为了解决这个局限性,研究人员提出了一种名为NOisy student TEacher with Laplacian Adjustment(NOTELA)的新颖方法。这种新方法结合了降噪师生(DTS)方法和流形正则化(MR)技术的原则。NOTELA引入了一种向学生模型添加噪声的机制(受DTS启发),同时在特征空间中强制实施簇假设(类似于MR)。这种组合有助于稳定适应过程,并增强模型在不同领域的泛化能力。该方法将模型的特征空间作为额外的真实信息源,使其能够在具有挑战性的生物声学数据集中取得成功,并实现最先进的性能。 在生物声学领域,NOTELA在源模型之上展现出了显著的改进,并在多个测试目标域中优于其他SFDA方法。它在多标签分类的标准指标——平均精度(mAP)和类别平均精度(cmAP)方面表现出色。它在不同目标域上的显著表现,如S. Nevada(mAP 66.0,cmAP 40.0)、Powdermill(mAP 62.0,cmAP 34.7)和SSW(mAP 67.1,cmAP 42.7),突显了其在处理生物声学数据集的挑战方面的有效性。 在视觉任务的背景下,NOTELA始终展现出强大的性能,优于其他SFDA基线。它在各种视觉数据集上都取得了显著的Top-1准确率结果,包括CIFAR-10(90.5%)和S. Nevada(73.5%)。尽管在ImageNet-Sketch(29.1%)和VisDA-C(43.9%)上的表现略低,但NOTELA在处理生物声学和视觉领域的SFDA问题方面的整体有效性和稳定性是显而易见的。 https://arxiv.org/abs/2302.06658 上图显示了六个声景数据集上多标签分类测试平均精度(mAP)的演变。它将NOTELA和Dropout…

Leave a Comment

KAIST研究人员引入FaceCLIPNeRF:使用可变形NeRF的文本驱动的3D人脸操作流程

3D数字人类内容改进的关键组成部分是能够轻松操纵3D面部表达。虽然神经辐射场(NeRF)在重建3D场景方面取得了重大进展,但其许多操纵技术都集中在刚性几何或颜色操纵上,这需要改进以满足对面部表情具有细粒度控制的工作的需求。尽管最近的一项研究提出了一种区域控制的面部编辑方法,但它需要从选定的训练帧中收集用户注释的面部不同部分的蒙版,然后进行人工属性控制以实现所需的改变。 面部特定的隐式表示技术使用可变形面部模型的参数作为先验,以高保真度地编码观察到的面部表情。然而,它们的手动操作需要涵盖一系列面部表情并且大约包含6000帧的大型训练集。这使得数据收集和操作过程都变得艰巨。与此不同,KAIST和Scatter Lab的研究人员开发了一种方法,该方法通过包含几种不同类型的面部变形实例的动态肖像视频进行训练,从而允许基于文本的修改,如图1所示。 图1 他们的方法在控制面部变形之前使用HyperNeRF从一个规范空间学习并隔离观察到的变形。特别地,通过训练帧间共享的常见潜在代码条件隐式场网络和逐帧变形潜在代码进行教学。他们的基本发现是使用多个空间可变的潜在代码来表示操纵任务的场景变形。这个顿悟是从朴素地将HyperNeRF公式应用于操纵问题的缺点中产生的,即寻找一个编码所需面部扭曲的单个潜在代码。 例如,单个潜在代码无法传达需要许多情况下所见的局部变形混合的面部表情。在他们的研究中,他们将这个问题称为“链接的局部属性问题”,并通过提供具有空间可变潜在代码的修改场景来解决它。为了做到这一点,他们首先将所有观察到的变形编译成一组锚定代码,然后教导多层感知机(MLP)将它们组合起来生成多个位置条件潜在代码。然后,通过将潜在代码的生成图像与CLIP嵌入空间中的目标文本接近,实现了潜在代码对目标文本的视觉特征的反映。总之,他们的工作对以下方面做出了贡献: • 设计一种学习使用具有空间可变潜在代码表示场景的操纵网络 • 提出了基于文本驱动的使用NeRF重建的面部的操纵流程 • 据他们所知,第一个能够操纵使用NeRF重建的面部的文本。

Leave a Comment