IBM和开源AI平台Hugging Face共同宣布发布了watsonx.ai地理空间基础模型。这个出色的AI模型使用了NASA的卫星数据,代表了气候科学和地球研究领域的重大进展。这个合作的主要目标是民主化AI的获取,并促进这些关键领域的创新加速。 在面对不断变化的环境条件下,气候科学领域面临着获得最新数据的紧迫挑战。尽管有大量的数据涌入(预计到2024年将达到250,000 TB),但分析这些广泛的数据集对科学家和研究人员来说仍然是一个难以逾越的任务。为了解决这个问题,IBM今年早些时候与NASA签署了一项太空行动法协议,开发了一个用于地理空间数据的AI基础模型。 通过在Hugging Face上提供地理空间基础模型,这个合作旨在促进AI社区内更大的合作和信息共享。这一举措有望加速开发有益于地球的重大解决方案。 地理空间基础模型是在美国大陆范围内的一年时间内,使用协调的Landsat Sentinel-2卫星数据(HLS)进行联合训练的。该模型在现有技术上表现出令人印象深刻的15%的提升,同时只需要一半的标记数据。该模型可以通过进一步的微调适用于各种任务,包括森林砍伐追踪、作物产量预测以及温室气体的检测与监测。IBM和NASA还与克拉克大学合作,探索时间序列分割和相似性研究等应用。 IBM的地理空间模型利用了其基础模型技术,这是该公司更广泛努力的一部分,旨在为各种任务创建和训练AI模型,并利用场景之间的知识转移。今年7月,IBM推出了Watsonx,这是一个AI和数据平台,使企业能够利用可靠的数据扩展和加速先进AI的影响。集成到IBM环境智能套件(EIS)的商业版本的地理空间模型预计将于今年晚些时候发布。 总之,IBM和Hugging Face之间的合作,加强了NASA的卫星数据的支持,代表了推动科学进步和加深我们对地球气候的理解的有希望的机会。这个模型的开源性有望赋予全球研究人员和科学家在应对紧迫环境挑战方面的能力。
Leave a CommentTag: Technology
近年来,由于生成式人工智能的最新进展,包括医学成像在内的多个领域取得了新的发展。这些生成式模型在异常检测、图像转换、去噪和磁共振成像(MRI)重建等各种用途上有着巨大的潜力。然而,这些模型因其复杂性而闻名,使得应用和复现变得困难。这种复杂性可能会降低进展速度,为用户设下障碍,并阻碍对新方法与已有方法进行比较评估。 为了使生成式模型的构建和部署更加简便和标准化,研究团队创建了一个名为MONAI Generative Models的开源平台。该团队包括来自伦敦国王学院、国家心理健康研究所、爱丁堡大学、巴塞尔大学、韩国科学技术高等研究院、NVIDIA、斯坦福大学、西奈山伊坎医学院和伦敦大学学院的研究人员。 为了证明该技术的有效性,讨论了五项涵盖医学成像相关主题的研究,从分布外检测到图像转换和超分辨率。该平台的适应性通过其在2D和3D场景中使用不同模态和解剖区域的能力得到展示,展示了它作为推动医学成像的新工具的潜力。五个实验如下: 提出的模型可以轻松调整以适应新环境,从而更全面地进行跨多种情况的比较,并扩大其初始范围。为了证明这一特性,研究人员评估了他们的软件包中最先进的模型之一——潜在扩散模型,以及它在包括具有不同体型和活动类型的受试者的各种数据集中生成新信息的能力。 潜在生成模型包括两个基本部分——压缩模型和生成模型,团队展示了这些模型的高度灵活性。 该系统使得在各种医学成像应用中使用生成式模型变得更加容易。研究团队证明了它们可以应用于检测超出正常范围的3D成像数据。 他们还使用稳定扩散2.0升频器方法研究了生成式模型在超分辨率方面的潜力。研究结果表明,生成式模型在超分辨率应用中非常有用,特别是在3D模型中。 团队还测试了他们的模型在超分辨率照片方面的性能。为此,他们将放大的测试集照片与相应的真实图像进行了比较。这些指标确认了该模型在提高图像清晰度方面的卓越超分辨率能力,证明了其效率。 未来,研究人员计划改进对其他应用(如MRI重建)的支持,并引入更多最新模型,以便更轻松地进行模型比较。由于这些发展,医学生成式模型及其应用领域将继续取得进展。
Leave a Comment最近引入的大型语言模型(LLMs)已经在人工智能(AI)社区中引起了轰动。这些模型通过使用超强的自然语言处理(NLP)、自然语言生成(NLG)和自然语言理解(NLU)成功地模仿了人类。LLMs因为能够模仿人类进行真实对话而变得著名,它们能够回答简单和复杂的问题,生成内容,代码补全,机器翻译和文本摘要。NLP的目标是使计算机系统能够理解和响应以自然语言给出的命令,使人们能够以更自然和灵活的方式与它们互动,最好的例子就是指令跟随模型。 这些模型是使用LLMs、有监督的例子或其他类型的监督进行训练,并暴露在成千上万个以自然语言指令编写的任务中。在最近的研究中,来自麦吉尔大学Mila Quebec AI研究所、麦吉尔大学和Facebook CIFAR AI Chair的团队研究了评估指令跟随模型在给定一组文本段落上执行问答(QA)任务的性能。这些模型可以在提供描述任务、问题和由检索器检索到的相关文本段落的提示时回答问题,这些模型产生的响应被认为是自然和信息丰富的,有助于建立用户的信任和参与度。 这些模型可以通过仅向其输入添加检索到的文档和指令来自然而流畅地回答用户的查询。然而,这种额外的冗长使得传统的QA评估指标如完全匹配(EM)和F1分数难以有效地量化模型的性能。这是因为模型的响应可能包含更多细节,而参考答案忽略了这些细节,但仍然准确。为了解决这个问题,团队提供了两个评估指标衡量检索增强的质量保证(QA)中的指令跟随模型。 关于信息必要性、准确性:这个维度评估模型满足用户信息需求的能力。它关注的是生成的响应是否包含相关信息,即使它超出了直接在参考答案中提及的内容。 与所提供的信息的一致性:这个维度评估模型在所提供的知识中是否正确回答问题。一个真实的模型应该避免在呈现无关信息时回答问题,并在有关信息可用时给出准确的答案。 作者在三个不同的QA数据集上评估了几个最近的指令跟随模型:用于开放域QA的自然问题,用于多跳QA的HotpotQA,以及用于对话QA的TopiOCQA。他们手动分析了900个模型的响应,并将结果与不同的自动评估指标进行了比较,以评估准确性和忠实度。他们的研究表明,召回率(衡量参考答案中的标记在模型响应中的占比)与正确性的相关性比EM或F1分数等词汇重叠度量更强。与其他用于忠实度的标记重叠度量相比,K-Precision(模型答案标记在知识片段中存在的百分比)与人类判断更强相关。 总之,本研究旨在更全面地评估指令跟随模型在QA任务中的优势和劣势。该团队通过在GitHub存储库上提供他们的代码和数据,进一步推动了该领域的进展。
Leave a Comment大型语言模型可以实现流畅的文本生成、新颖的问题解决和创造性的散文和代码生成。相比之下,视觉-语言模型可以实现开放词汇的视觉识别,甚至可以对图像中的物体-代理交互进行复杂推理。机器人学习新技能的最佳方式需要进一步明确。与在网络上训练最先进的语言和视觉-语言模型所使用的数十亿个标记和照片相比,从机器人收集的数据量可能无法相提并论。然而,要立即将这些模型适应到机器人活动中也具有挑战性,因为这些模型推理语义、标签和文本提示。相比之下,机器人必须接受低级别的指导,例如使用笛卡尔末端执行器。 Google Deepmind的研究旨在通过直接将基于互联网规模数据训练的视觉-语言模型直接融入端到端的机器人控制中,改善泛化能力并实现新兴语义推理。借助基于网络的语言和视觉-语言数据,我们旨在创建一个综合训练的模型,用于将机器人观察连接到动作。他们提出使用来自机器人轨迹和在互联网上进行的大规模视觉问答练习的数据,一起对最先进的视觉-语言模型进行微调。与其他方法相比,他们提出了一种简单通用的方法:将机器人动作表达为文本标记,并直接将其纳入模型的训练集中,就像处理自然语言标记一样。研究人员研究了视觉-语言-动作模型(VLA),RT-2是其中一个模型的实例。通过严格的测试(6,000个评估试验),他们可以确定RT-2通过基于互联网的训练获得了各种新兴技能,并且该技术导致了有效的机器人策略。 Google DeepMind推出了RT-2,这是一个基于Transformer的模型,它是作为其机器人Transformer模型1的后续而训练的,该模型是使用从网络获取的文本和图像进行训练的,可以直接执行机器人操作。使用机器人动作来表示作为第二语言的信息,可以将其转换为文本标记,并与在线可用的大规模视觉-语言数据集一起进行教学。推断涉及将文本标记解码为机器人行为,然后通过反馈循环进行控制。这使得可以将视觉-语言模型的一部分泛化、语义理解和推理能力转移到学习机器人策略上。在项目网站https://robotics-transformer2.github.io/上,RT-2团队提供了其使用的实时演示。 该模型保留了在机器人数据中发现的物理技能的应用能力。同时,它还通过阅读从网络中获取的视觉和语言命令来学习在新环境中使用这些技能。即使在机器人数据中不包含诸如精确数字或图标之类的语义线索,该模型也可以重新利用其学到的拾取和放置技能。在机器人演示中没有提供这样的关系,但该模型可以正确选择物体并将其放置在正确的位置。此外,如果命令附带一系列思路提示,例如知道岩石是 improvises锤子的最佳选择或者知道能量饮料是疲劳时的最佳选择,模型还可以进行更复杂的语义推理。 Google DeepMind的主要贡献是RT-2,这是一系列通过将基于网络规模数据进行微调的巨型视觉-语言模型创建的模型,用于作为具有泛化能力和语义感知的机器人规则。实验使用了多达550亿个参数的模型,这些参数是从公开可用的数据中学习的,并用机器人运动命令进行了注释。通过6,000个机器人评估,他们证明RT-2在对象、场景和指令的泛化方面取得了显著进展,并展示了一系列新兴能力,这些能力是基于互联网规模的视觉-语言预训练的副产品。 主要特点 RT-2的推理、符号解释和人类识别能力可在广泛的实际场景中使用。 RT-2的结果表明,使用机器人数据预训练VLMs可以使它们成为直接控制机器人的强大视觉-语言-动作(VLA)模型。 一个有希望的方向是构建一个能够思考、解决问题并理解信息以完成实际世界中各种活动的通用物理机器人,就像RT-2一样。 RT-2展示了它在处理各种任务方面的适应性和效率,它可以将语言和视觉训练数据转化为机器人动作。 限制 尽管RT-2具有令人鼓舞的泛化特性,但它也存在一些缺点。研究表明,通过VLMs(视觉语言模型)引入Web规模的预训练可以提高对语义和视觉概念的泛化能力,但这并不意味着机器人在执行动作方面具备了新的能力。尽管模型只能以新颖的方式利用机器人数据中存在的物理能力,但它确实学会了更好地利用自己的能力。研究人员认为,这是因为样本在能力维度上需要更多的多样性。新的数据收集范例,比如人类的电影,为未来研究获取新技能提供了有趣的机会。 总之,Google DeepMind的研究人员证明了大型VLA模型可以实时运行,但这需要相当大的计算开销。随着这些方法被应用于需要高频控制的情况,实时推理风险成为一个重要瓶颈。量化和蒸馏方法可以让这些模型更快地运行或在更便宜的硬件上运行,这是未来研究的有吸引力的领域。这与另一个现有限制相关,即相对较少的VLM模型可以用于开发RT-2。 来自Google DeepMind的研究人员总结了通过将预训练与视觉语言模型(VLMs)和机器人数据进行整合来训练视觉-语言-动作(VLA)模型的过程。然后他们引入了两个VLA的变种(RT-2-PaLM-E和RT-2-PaLI-X),分别受到PaLM-E和PaLI-X的启发。这些模型通过机器人轨迹的数据进行微调,以生成机器人动作,并将其分词为文本。更重要的是,他们证明了这种技术改进了泛化性能和从Web规模的视觉语言预训练中继承的新兴能力,从而导致非常有效的机器人策略。根据Google DeepMind的说法,机器人学习领域现在通过这种简单而通用的方法论得到了从其他领域改进的战略定位。
Leave a Comment大型语言模型(LLMs)在自然语言处理(NLP)领域取得了显著进展。将多模态引入LLMs并将其转化为多模态大型语言模型(MLLMs),可以进行多模态感知和解释,这是一个合乎逻辑的步骤。作为人工通用智能(AGI)的可能步骤,MLLMs在感知(如存在、计数、位置、OCR)、常识推理和代码推理等各种多模态任务中展示出了令人惊讶的新技能。与LLMs和其他任务特定模型相比,MLLMs能够以更类似人类的视角看待环境,提供用户友好的交互界面,并具备更广泛的任务解决能力。 现有的以视觉为中心的MLLMs使用Q-former或基本投影层、预训练的LLMs、视觉编码器和额外的可学习模块。另一种范式是通过API将当前的视觉感知工具(如跟踪和分类)与LLMs相结合,构建一个无需训练的系统。早期在视频领域的一些研究使用了这种范式开发了视频MLLMs。然而,以往从未对基于长时间电影(持续时间超过一分钟)的模型或系统进行过任何研究,并且也没有设定衡量这些系统有效性的标准。 在这项研究中,浙江大学、华盛顿大学、微软亚洲研究院和香港大学的研究人员介绍了一种名为MovieChat的独特框架,用于解决长时间视频解释挑战,将视觉模型与LLMs结合起来。根据他们的说法,扩展视频理解的剩余困难包括计算困难、内存开销和长期时间关联。为了解决这个问题,他们提出了一种基于阿特金森-希夫林(Atkinson-Shiffrin)记忆模型的记忆系统,其中包括快速更新的短期记忆和紧凑持久的长期记忆。 这个独特的框架将视觉模型与LLMs结合起来,是第一个能够进行扩展视频理解任务的框架。该研究通过进行严格的定量评估和案例研究,评估了理解能力和推理成本的性能,并提出了一种记忆机制,以降低计算复杂性和内存成本,同时改善长期时间关联。该研究通过将巨大的语言模型与视频基础模型相结合,提出了一种新颖的理解视频的方法。 该系统通过包含一个受阿特金森-希夫林模型启发的记忆过程来解决分析长电影的困难,其中包括由Transformers中的令牌表示的短期和长期记忆。所提出的系统MovieChat在扩展视频理解方面表现优于之前只能处理几帧电影的算法,并达到了最先进的性能。这种方法解决了长期时间关联问题,同时降低了内存使用和计算复杂性。该研究凸显了记忆过程在视频理解中的作用,使模型能够存储和检索相关信息长时间。MovieChat的普及对包括内容分析、视频推荐系统和视频监控在内的行业具有实际影响。未来的研究可能会探索如何加强记忆系统,并使用其他模态(包括音频)来提高视频理解能力。这项研究为需要全面理解视觉数据的应用创造了可能性。他们的网站上有多个演示。
Leave a Comment对V-Net进行回顾和介绍,它是U-Net在图像分割和医学影像方面的大哥非常适合数据科学家和医疗专业人士
Leave a Comment文本到图像模型已经成为AI领域讨论的基石,该领域的进展相当迅速,因此我们拥有了令人印象深刻的文本到图像模型。生成式人工智能进入了一个新阶段。 扩散模型是这一进展的关键贡献者。它们已经成为一个强大的生成模型类别。这些模型被设计为通过缓慢去噪输入来生成高质量的图像。扩散模型能够捕捉隐藏的数据模式并生成多样且逼真的样本。 基于扩散的生成模型的快速进展已经彻底改变了文本到图像生成方法。你可以要求一个图像,无论你能想到什么,描述出来,模型都能够相当准确地为你生成出来。随着它们的进一步发展,越来越难以理解哪些图像是由人工智能生成的。 然而,这里存在一个问题。这些模型完全依赖于文本描述来生成图像。你只能“描述”你想要看到的内容。此外,它们很难进行个性化,因为在大多数情况下需要进行微调。 想象一下,你正在为你的房子做室内设计,与一位建筑师合作。建筑师只能为你提供他为之前的客户设计的方案,当你试图个性化设计的某个部分时,他只会忽视它并为你提供另一个曾经使用过的风格。听起来不太令人愉快,不是吗?如果你在寻求个性化,这可能是你在使用文本到图像模型时会得到的体验。 幸运的是,已经有人试图克服这些限制。研究人员已经探索了将文本描述与参考图像整合起来以实现更个性化的图像生成。虽然一些方法需要在特定的参考图像上进行微调,但其他方法会在个性化数据集上重新训练基础模型,从而可能出现保真度和泛化性的潜在缺陷。此外,大多数现有算法只适用于特定领域,无法处理多概念生成、测试时微调和开放领域零样本能力。 因此,今天我们将介绍一种接近开放领域个性化的新方法——Subject-Diffusion。 SubjectDiffusion可以生成高保真度的主题驱动图像。来源:https://arxiv.org/pdf/2307.11410.pdf Subject-Diffusion是一种创新的开放领域个性化文本到图像生成框架。它仅使用一个参考图像,消除了测试时微调的需求。为了构建一个大规模的个性化图像生成数据集,它利用了一个自动数据标记工具,生成了令人印象深刻的7600万图像和2.22亿个实体的Subject-Diffusion数据集。 Subject-Diffusion有三个主要组成部分:位置控制、细粒度参考图像控制和注意力控制。位置控制是在噪声注入过程中添加主要主题的遮罩图像。细粒度参考图像控制使用一个组合的文本-图像信息模块来改善两者的整合。为了实现多个主题的平滑生成,训练过程中引入了注意力控制。 SubjectDiffusion概览。来源:https://arxiv.org/pdf/2307.11410.pdf Subject-Diffusion实现了令人印象深刻的保真度和泛化性,能够根据每个主题的一个参考图像生成单个、多个和以人为主题的个性化图像,并进行形状、姿势、背景和风格的修改。该模型还通过特别设计的去噪过程,实现了自定义图像和文本描述之间的平滑插值。定量比较显示,Subject-Diffusion在各种基准数据集上超越或与其他最先进的方法相媲美,无论是否进行测试时微调。
Leave a Comment在最近几个月里,喀拉拉邦目睹了一种利用人工智能驱动的“深度伪造”技术进行欺诈的激增。超过300人损失了惊人的4千万卢比,该邦正面临着新一波网络犯罪的挑战。这种人工智能骗局以诱人的“在家工作”和“家庭业务”机会为目标,针对易受攻击的受害者。本文探讨了这些骗子的作案手法,他们如何使用深度伪造技术,以及喀拉拉邦警察为打击这种危害所做出的努力。 另请阅读:网络犯罪分子使用WormGPT突破电子邮件安全 欺诈浪潮的崛起 根据警方报告,实际案件数量可能要远高于报告的数字。喀拉拉邦是这种欺诈活动猖獗的邦中名列前茅,网络骗子每月从居民手中骗取约1亿卢比。令人震惊的是,女性和家庭主妇成为这些骗局的主要目标。 另请阅读:欺诈GPT:人工智能驱动的网络犯罪工具的惊人崛起 “在家工作”骗子的诱惑 犯罪分子通过WhatsApp或Facebook与受害者联系,提供在家工作的机会。然后,他们以观看商业视频来吸引受害者,承诺通过这种方式获得奖励。然而,这种诱饵很快变成了陷阱,因为受害者被卷入了一系列任务中,积累了积分,最终导致巨额的货币需求。 狡猾的商业欺诈 另一种欺诈方案涉及销售知名品牌的产品,通过诱人的交易吸引受害者。犯罪分子营造出真实交易的假象,在提供更大的购买机会之前,建立受害者的信心。受害者很快感到受骗,因为参与此类骗局的社交媒体群体消失得无影无踪。 另请阅读:罪犯使用人工智能冒充亲友 深度伪造技术的威胁 喀拉拉邦警方最近调查了一起使用人工智能驱动的“深度伪造”技术欺骗受害者4万卢比的案件。通过模仿前同事进行视频通话,骗子以虚构的医疗紧急情况巧妙地欺骗受害者转账。这种高级手法给执法机构追踪和逮捕罪犯带来了重大挑战。 另请阅读:在人工智能时代如何检测和处理深度伪造? 喀拉拉邦警方追求正义 科齐科德市网络警察迅速采取行动,派遣一个团队前往艾哈迈达巴德追踪深度伪造案件中的被告。调查涉及评估在果阿赌场注册的地址的真实性,该地址是罪犯用于注册犯罪中使用的sim卡的。喀拉拉邦警方正在寻求古吉拉特邦警方的帮助,决心将犯罪分子绳之以法。 另请阅读:欧盟呼吁采取措施识别深度伪造和人工智能内容 我们的观点 人工智能驱动的“深度伪造”欺诈的崛起严重威胁着个人和他们辛辛苦苦赚来的钱。随着受害者数量的增加和财务损失的飙升,喀拉拉邦的执法机构正在加大努力打击这种阴险的网络犯罪形式。在先进技术时代,意识和警惕成为保护自己免受这些欺诈计划侵害的关键工具。通过保持了解和在在线互动中采取谨慎行事,公民可以挫败骗子的恶意意图,使数字世界对每个人来说更加安全。
Leave a Comment随着人工智能(AI)继续吸引世界的目光,一项令人称奇的应用在计算机视觉和AI的交叉领域中崭露头角,即人体运动预测(HMP)。这个引人入胜的任务涉及根据观察到的运动序列预测人体主体的未来运动或动作。其目标是预测一个人的身体姿势或动作如何演变。HMP在机器人学、虚拟化身、自动驾驶车辆和人机交互等多个领域都有应用。 随机HMP是传统HMP的扩展,其重点是预测可能未来动作的分布,而不是单一确定的未来。这种方法认识到人类行为的固有自发性和不可预测性,旨在捕捉与未来动作或运动相关的不确定性。随机HMP通过考虑可能未来动作的分布来解决人类行为的可变性和多样性,从而实现更加真实和灵活的预测。在需要预测多种可能行为至关重要的场景中,如辅助机器人或监控应用,随机HMP尤为有价值。 通常使用生成模型(如GAN或VAE)来预测每个观察序列的多个未来动作来处理随机HMP。然而,这种在坐标空间中生成多样化动作的重点导致了不真实和快速发散的动作预测,可能需要更好地与观察到的动作相一致。此外,这些方法通常忽视了预测具有微小关节位移的多样化低范围行为。因此,需要新的方法来考虑行为多样性并在随机HMP任务中产生更加真实的预测。为了解决现有随机HMP方法的局限性,巴塞罗那大学和计算机视觉中心的研究人员提出了BeLFusion。这种新颖的方法引入了一个行为潜空间,以生成真实且多样化的人体运动序列。 生成模型中的快速和发散的动作。 BeLFusion的主要目标是将行为与动作分离,实现观察到的姿势和预测姿势之间的平滑过渡。这通过行为VAE实现,包括行为编码器、行为耦合器、上下文编码器和辅助解码器。行为编码器结合了门控循环单元(GRU)和2D卷积层,将关节坐标映射到潜在分布。然后,行为耦合器将采样的行为转移到进行中的动作,生成多样化且具有上下文适应性的动作。BeLFusion还结合了一种条件潜空间扩散模型(LDM),以准确地编码行为动态并将其有效地转移到进行中的动作,同时最小化潜在和重构错误,以增强生成动作序列中的多样性。 BeLFusion的创新架构还包括一个观察编码器,它是一个从关节坐标生成隐藏状态的自编码器。该模型利用了潜空间扩散模型(LDM),该模型使用了带有交叉注意机制和残差块的U-Net,从中采样出行为与姿势和动作分离的潜在空间。通过从行为的角度促进多样性并与最近的过去保持一致性,BeLFusion在随机HMP中产生了比最先进方法更加真实和连贯的动作预测。通过行为分离和潜空间扩散的独特组合,BeLFusion在人体运动预测方面代表了一个有希望的进展。它具有为各种应用程序生成更自然和上下文适应的动作的潜力。 实验评估显示,BeLFusion具有令人印象深刻的泛化能力,在已知和未知情景中表现出色。在使用Human3.6M和AMASS数据集的具有挑战性结果进行跨数据集评估时,它在各种指标上表现优于最先进的方法。在H36M上,BeLFusion的平均位移误差(ADE)约为0.372,最终位移误差(FDE)约为0.474。同时,在AMASS上,它的ADE约为1.977,FDE约为0.513。结果表明BeLFusion生成准确且多样化预测的能力优越,展示了它在不同数据集和动作类别上进行逼真人体运动预测的有效性和泛化能力。 总体而言,BeLFusion是一种用于人体运动预测的新方法,其在Human3.6M和AMASS数据集的准确性指标中实现了最先进的性能。它利用行为潜空间和潜扩散模型生成多样化且上下文自适应的预测。该方法能够捕捉和转移序列之间的行为,使其对领域转移具有鲁棒性,并提高了泛化能力。此外,定性评估表明,BeLFusion的预测比其他最先进的方法更加逼真。它为人体运动预测提供了有希望的解决方案,在动画、虚拟现实和机器人技术等领域具有潜在应用。
Leave a CommentDeepSwap DeepSwap 是一款基于人工智能的工具,适用于任何想要创建逼真深度伪造视频和图像的人。通过重新面部定位视频、图片、梗、旧电影、GIF 等,您可以轻松地创建自己的内容。该应用没有内容限制,因此用户可以上传任何内容的素材。此外,首次订阅该产品的用户可享受50%的折扣。 Aragon 使用 Aragon 轻松获得令人惊叹的专业头像照片。利用最新的人工智能技术,轻松地为自己创建高质量的头像照片!不需要费心预约摄影工作室或打扮。快速编辑和修饰您的照片,不需要等上几天。获得40张高清照片,为您在下一份工作中带来优势。 AdCreative.ai 使用 AdCreative.ai,提升您的广告和社交媒体能力,这是终极人工智能解决方案。告别数小时的创意工作,欢迎在几秒钟内生成高转化的广告和社交媒体帖子。立即使用 AdCreative.ai,最大化您的成功,最小化您的努力。 Otter AI Otter.AI 借助人工智能技术,为用户提供实时的会议笔记转录,这些转录具有共享、搜索、访问和安全的特点。获得一个会议助手,可以录制音频、撰写笔记、自动捕捉幻灯片并生成摘要。 Notion Notion 正通过利用其先进的人工智能技术来增加其用户群。他们的最新功能 Notion AI 是一个强大的生成式人工智能工具,可以帮助用户完成笔记摘要、会议中的行动项识别、文本的创建和修改等任务。Notion AI 通过自动化繁琐的任务、提供建议和模板,优化了工作流程,简化和改善了用户体验。 Docktopus…
Leave a Comment最近的语言模型可以将长上下文作为输入;需要了解它们如何更好地使用更长的上下文。能否将LLMs扩展到更长的上下文?这是一个未解答的问题。Abacus AI的研究人员进行了多次实验,涉及不同方案来开发Llama的上下文长度能力,该模型在上下文长度2048上进行了预训练。他们使用IFT将这些模型进行线性缩放,缩放比例为4和16。将模型缩放到16倍可以执行长达16k的上下文长度的任务,甚至可以执行长达20-24k的上下文长度的任务。 扩展上下文长度的不同方法包括线性缩放、通过幂将旋转位置嵌入(RoPE)的傅里叶基缩放、截断傅里叶基和随机化位置向量。Abacus AI的研究人员使用这些方法对RedPajama数据集和Vicuna数据集进行了微调。他们发现线性缩放是稳健的,但会增加模型的上下文长度。截断和随机化具有很高的困惑度分数,但在检索任务上表现较差。 为了评估这些模型,研究人员使用了来自LMSys、开放式问答数据集和WikiQA的数据集。LMSys数据集用于在上下文中定位子字符串。WikiQA任务是根据维基百科文档中给出的信息回答问题的任务。 团队根据Google自然问题中的简短回答格式数据构建了一个QA任务。他们确保输出只是从原始文档中复制粘贴的短词回答。这样可以精确定位LLM应该查找的位置,通过将答案放置在不同位置有效地评估扩展上下文长度的每个部分。他们还创建了多个具有不同大小的相同维基百科文档的版本,这使他们能够在模型大小上进行公平评估。 基于维基百科的数据集的问题是模型从其预训练的文本中回答而不是从上下文中回答。研究人员通过创建一个由只有数字答案的问题组成的改编数据集来解决这个问题。他们改变了答案和文档中响应的每个出现,使得如果LLM从其预训练的文本中回忆起来,模型将错误地回答。他们将原始QA任务命名为自由格式QA(FFQA),将改编任务命名为改编数字QA(AltQA)。 AbacusAI的研究人员在两个版本的QA任务中对每个示例进行了存在准确性评估。存在准确性是衡量生成的解决方案中是否存在答案作为子字符串的准确性。他们观察到IFT的准确性提高并不能给模型能够实现的上下文长度范围带来任何扩展。 研究人员表明,通过缩放上下文进行IFT可以显著提高性能。他们观察到在缩放上下文因子插值的所有位置上,FFQA的性能提高了2倍,AltQA的性能提高了2.5倍。最后,他们的研究工作提出了一个更大上下文的语言模型,它通过更好地捕捉文档的主题更容易地提高困惑度。
Leave a Comment融入人类输入是近期大型语言模型(LLM)能力显著提升的关键组成部分,例如ChatGPT和GPT-4。为了有效使用人类反馈,首先必须训练一个融入人类偏好、价值观和伦理问题的奖励模型。然后,在奖励模型的指导下,使用强化学习调整LLM。这个过程被称为从人类反馈中进行强化学习(RLHF),可以成功地使LLM与人类目标协调,显著提升人际交流的质量。 创建一个功能性且基于人类偏好的奖励系统并不容易。当人类标注者无法为特定提示的响应或完成提供一个数字评分时,这变得非常具有挑战性。相反,对于人们来说,根据质量进行完成的两两比较要简单得多,并且这种方法被用于InstructGPT的创建。特别是,人类标注者在看到由LLM生成的许多完成的同一个提示后,将这些完成从最高到最低的感知质量进行排序。 然后,回复根据一个经过训练的神经网络来匹配人类偏好排名的奖励模型进行奖励。尽管有一些优点,比如消除校准问题,但排名并不能充分反映多个提示的各种奖励分布。这是因为当排名较高时,很难清楚地知道一个完成比另一个完成好多少。由于一些RLHF提示是开放式的,或者换句话说,依赖于用户的历史记录,因此奖励分布可能在较大范围内变化;因此,这个问题尤为重要。 相反,有些提示是封闭式的,产生应该获得高或低分的回复,导致奖励分布的近似两点质量分布。第一类提示的例子包括“证明勾股定理”和“鸡是恐龙吗”。第二类提示的例子包括“证明勾股定理”和“写一篇关于100年后人工智能的短篇小说”。只有考虑到各种线索的微妙之处,激励模型才能帮助LLM适当地衡量不确定性。 斯坦福大学、普林斯顿大学和宾夕法尼亚大学的研究人员记录了一个意外现象,显示在根据偏好排名训练奖励模型时,它可以提供独立于提示的相同奖励分布。这个事件发生在训练的最后阶段,被称为奖励崩溃。有趣的是,在这个事件被经验性地证明之前,他们的理论分析就已经预测到了。他们证明了可以使用一个简单的优化程序,甚至更简单的闭式表达式来数值推断奖励崩溃的奖励分布。他们对奖励崩溃的预测与经验结果非常吻合。 他们的第二个重要贡献是引入了一种有原则的策略,利用来自同一个优化程序的数据来防止奖励崩溃。奖励崩溃是不可取的,因为它忽略了不同提示之间微小的区别,并且在使用强化学习和奖励模型训练LLM时可能导致人类选择的错误校准。奖励模型的训练提前结束是解决这个问题的一个简单方法,但这是相当任意的,并且很难决定何时结束。 实质上,他们建议基于提示使用不同的效用函数来训练奖励模型,这样产生的奖励分布可以是广泛分散或紧密集中的,具体取决于提示是开放式还是封闭式。这种基于提示的技术具有明显的优势,可以进行全面的分析,根据需要完全定制奖励分布的结构。他们的研究结果表明,使用这种基于提示的技术可以显著减少奖励崩溃。
Leave a CommentChatGPT和大型语言模型(LLMs)非常灵活,可以创建多种程序。然而,当应用程序受欢迎并且流量增加时,与LLM API调用相关的成本可能变得显著。在处理许多查询时,LLM服务可能还需要较长的等待时间。 为了直面这一困难,研究人员开发了GPTCache,这是一个旨在存储LLM答案的语义缓存项目。开源的GPTCache程序可以通过缓存其输出答案来加快LLMs的速度。当所请求的响应已经在缓存中存储并且之前已经请求过时,这将极大地减少获取它所需的时间。 GPTCache具有灵活和简单的特点,非常适合任何应用。它与许多语言学习机器(LLMs)兼容,例如OpenAI的ChatGPT。 它是如何工作的? 为了正常运行,GPTCache会缓存LLM的最终回复。缓存是用于快速检索最近使用的信息的内存缓冲区。每当向LLM发出新请求时,GPTCache首先查找缓存,以确定所请求的响应是否已经存储在其中。如果答案可以在缓存中找到,它将立即返回。如果缓存中没有找到,LLM将生成响应并将其添加到缓存中。 GPTCache的模块化架构使其易于实施定制的语义缓存解决方案。用户可以通过选择不同的设置来定制每个模块的体验。 LLM适配器通过将各种LLM模型使用的API和请求协议标准化为OpenAI API,统一了它们之间的接口。由于LLM适配器可以在不需要重写代码或熟悉新API的情况下在LLM模型之间移动,它简化了测试和实验。 嵌入生成器使用所请求的模型创建嵌入,以进行相似性搜索。支持的模型可以使用OpenAI的嵌入API。这是使用GPTCache/paraphrase-albert-onnx模型的ONNX,Hugging Face嵌入API,Cohere嵌入API,fastText嵌入API和SentenceTransformers嵌入API。 在缓存存储中,像ChatGPT这样的LLM的响应被保留,直到可以检索。在确定两个实体是否在语义上相似时,会获取缓存的回复并将其发送回请求方。GPTCache与许多不同的数据库管理系统兼容。用户可以选择最符合其性能、可扩展性和最常用数据库成本要求的数据库。 向量存储的选择:GPTCache包括一个向量存储模块,它使用从原始请求中导出的嵌入来识别K个最相似的请求。此功能可用于确定两个请求的相似程度。此外,GPTCache支持多个向量存储,例如Milvus、Zilliz Cloud和FAISS,并为与它们一起使用提供了简单的接口。用户可以选择各种向量存储选项,其中任何一个都可能影响GPTCache的相似性搜索性能。凭借对各种向量存储的支持,GPTCache承诺是可适应的,并满足更多种用例的需求。 GPTCache缓存管理器管理缓存存储和向量存储组件的驱逐策略。当缓存被填满时,替换策略决定哪些旧数据应该从缓存中删除,以为新数据腾出空间。 相似性评估器的信息来自于GPTCache的缓存存储和向量存储部分。它使用几种不同的方法将输入请求与向量存储中的请求进行比较。是否从缓存中提供请求取决于相似度的程度。GPTCache提供了统一的接口和可用实现的库,以确定缓存匹配。GPTCache通过各种相似度算法来确定缓存匹配的能力,使其能够适应大范围的用例和用户需求。 特点和优势 通过GPTCache减少LLM查询延迟,提高响应速度和速度。 由于许多LLM服务采用基于令牌和请求的定价结构,GPTCache可以减少服务成本,限制API调用次数。 GPTCache具有从LLM服务卸载工作的能力,提高可扩展性。随着您接收的请求数量增加,这可以帮助您保持高效运行。 借助GPTCache,可以将创建LLM应用程序的成本降至最低。通过缓存由LLM生成或模拟的数据,您可以在不向LLM服务发出API请求的情况下测试您的应用程序。 GPTCache可以与您选择的应用程序(LLM ChatGPT)、缓存存储(SQLite、PostgreSQL、MySQL、MariaDB、SQL Server或Oracle)和向量存储(FAISS、Milvus、Ziliz Cloud)配合使用。GPTCache项目的目标是在GPT-based应用程序中尽可能地重用先前生成的回复,而不是每次都从空白开始,从而实现对语言模型的最有效利用。
Leave a Comment已经收集了多个人类演示用于学习视觉导航,最近的大规模数据集包含数百个交互场景,这些都显著提高了智能体的性能。然而,要进行如此大规模的训练需要解决一些关键的子问题,例如如何构建导航图,恢复损坏的渲染图像和生成导航指令。所有这些都对收集的数据质量产生重大影响,因此应该进行深入探索。 研究如何有效利用大规模数据来适当地训练导航智能体非常必要,一个能够理解人类自然语言并在逼真环境中导航的智能体是一个复杂而模块化的系统。 为了训练大规模的视觉与语言导航网络(VLNs),澳大利亚国立大学、OpenGVLab、上海人工智能实验室、UNC教堂山分校、阿德莱德大学和Adobe研究团队提供了一种新的范式,通过统计评估管道中每个组件的影响。他们使用Habitat模拟器,从HM3D和Gibson数据集中使用环境,为环境构建导航图。他们采样新的轨迹,创建指令,并训练智能体解决下游导航问题。 与AutoVLN和MARVAL等先前方法不同,这些导航图通过过度视点采样和聚合过程构建,采用了引入的图形创建启发式方法。这种方法产生了具有广泛室外覆盖范围的全连接网络。 研究人员还训练了Co-Modulated GAN,从HM3D和Gibson环境中的损坏生成图像的破损、变形或缺失部分生成逼真图像,减少了视觉数据噪声的影响。与MARVAL相比,这种大规模训练方案是完全可复现且易于执行的,同时明显提高了智能体的性能。 广泛的实验证明,如果智能体要在特定指令的下游任务(如R2R)上表现更好,导航图必须是完全可遍历的。此外,研究结果还表明,从新场景中学习而不仅仅是增加数据量,智能体通常可以使用更多样化的视觉数据,并提高对新环境的泛化能力。 此外,团队验证了在基于LSTM的基本模型提供的增强指令上训练的智能体在各种导航任务上表现良好。他们得出结论,通过在预训练和微调过程中将增强数据与原始数据整合,可以提高智能体的泛化能力。 令人惊讶的是,通过将上述分析作为数据增强和智能体训练的指导方针,所提出的VLN模型可以通过简单的模仿学习在R2R测试集上实现80%的成功率,而无需预探索、波束搜索或模型集成,并消除了已知和未知环境之间的导航差距。这一结果相比先前最佳方法(73%)有了巨大的改进,将性能差距缩小到了6个百分点以内,接近人类水平。对于诸如CVDN和REVERIE等几个语言引导的视觉导航挑战,该方法推动了最新技术的发展。即使增强数据是离散的,该方法在连续环境(R2R-CE)中将VLN性能提高了5%的成功率,这是一个更为现实但具有挑战性的场景。
Leave a Comment音乐标题生成涉及通过生成给定音乐曲目的自然语言描述来进行音乐信息检索。生成的标题是句子的文本描述,区别于其他音乐语义理解任务,如音乐标记。这些模型通常使用编码器-解码器框架。 关于音乐标题生成的研究有了显著增长。然而,尽管其重要性,研究这些技术的研究人员面临着数据集收集的昂贵和繁琐任务的障碍。此外,可用的音乐-语言数据集数量有限,这也带来了挑战。由于数据集的稀缺性,成功训练音乐标题生成模型并不容易。大型语言模型(LLMs)可能是音乐标题生成的潜在解决方案。LLMs是具有超过十亿个参数的前沿模型,能够在少量或零个示例的情况下处理任务并展现出令人印象深刻的能力。这些模型通过从维基百科、GitHub、聊天记录、医学文章、法律文章、书籍和从互联网爬取的网页等各种来源的大量文本数据进行训练。广泛的训练使它们能够理解和解释各种上下文和领域中的单词。 随后,韩国的一支研究团队开发了一种称为LP-MusicCaps(基于大型语言的伪音乐标题数据集)的方法,通过将LLMs谨慎应用于标记数据集来创建一个音乐标题数据集。他们对大规模音乐标题数据集进行了系统评估,使用了自然语言处理领域中的各种定量评估指标以及人工评估。结果生成了大约220万个与50万个音频剪辑配对的标题。首先,他们提出了一种基于LLM的方法来生成音乐标题数据集LP-MusicCaps。其次,他们提出了一种用于对LLMs生成的音乐标题进行系统评估的方案。第三,他们证明了在LP-MusicCaps上训练的模型在零样本和迁移学习场景中表现良好,证明了使用基于LLM的伪音乐标题的合理性。 研究人员首先从现有的音乐标记数据集中收集多标签标签。这些标签涵盖了音乐的各个方面,如流派、情绪、乐器等。他们仔细构建了任务说明,为音乐曲目生成描述性句子,这些句子作为大型语言模型的输入(提示)。由于其在各种任务中表现出色,他们选择了强大的GPT-3.5 Turbo语言模型来执行音乐标题生成。GPT-3.5 Turbo的训练过程包括一个具有大量数据的初始阶段,并且受益于巨大的计算能力。随后,他们使用增强学习和人类反馈进行微调。这个微调过程旨在提高模型与指令有效交互的能力。 研究人员将基于LLM的标题生成器与基于模板的方法(标签连接、提示模板)和K2C增强进行了比较。在K2C增强的情况下,当指令缺失时,输入标签会被省略在生成的标题中,导致生成的句子可能与歌曲描述无关。另一方面,基于模板的模型表现出更好的性能,因为它从模板中存在的音乐上下文中受益。 他们使用BERT-Score指标评估生成的标题的多样性。这个框架显示出更高的BERT-Score值,生成具有更多样化词汇的标题。这意味着该方法生成的标题提供了更广泛的语言表达和变化,使其更具吸引力和丰富上下文。 随着研究人员不断完善和提升他们的方法,他们也期待利用语言模型的力量来推动音乐标题生成并为音乐信息检索做出贡献。
Leave a Comment大规模预训练语言模型(LLM)如OpenAI GPT、Flan-T5和LLaMA极大地推动了自然语言处理(NLP)的快速发展。这些模型在各种NLP应用中表现出色。然而,在微调过程中,由于它们庞大的参数规模,计算效率和内存利用存在问题。 近年来,低秩适应(LoRA)的崛起成为一种有效的调优工具。它通过减少所需的内存和计算量来加快LLM的训练。LoRA通过固定主模型的参数(一个LLM)并学习一个小型的补充模块来实现这一目标,该模块可靠地在指定的任务上表现良好。 LoRA所带来的效率提升一直是以前的研究重点,但LoRA模块的模块化和可组合性却受到了极少关注。必须研究LoRA模块是否可以高效地推广到未知问题。 来自Sea AI Lab、华盛顿大学和Allen Institute for AI的研究人员决定利用LoRA的模块化能力,使其能够灵活应对新的挑战,而不仅仅局限于特定任务的训练。他们的方法的关键优势在于,它允许LoRA模块在没有人为干预或专门知识的情况下自动组装。 该方法可以通过使用以前未识别任务的几个样本自动安排合适的LoRA模块。因为研究人员不假设哪些训练在哪些任务上的LoRA模块可以集成,满足要求的所有模块(例如通过利用相同的LLM)都可以进行合并。他们将这种学习技术称为LoraHub学习,因为它使用了已有的几个不同的LoRA模块。 为了确保其有效性,团队使用行业标准的BBH基准和Flan-T5作为底层LLM来评估他们的方法。结果表明,几次少样本的LoraHub学习过程可以为新任务组合LoRA模块,效果接近少样本、上下文学习。与上下文学习相比,消除了LLM的实例输入需求,从而显著降低了推理成本。该学习技术采用无梯度的方法生成LoRA模块的系数,只需要少量的推理步骤。以单个A100为例,在不到一分钟内,该方法可以在BBH上达到顶级性能。 在LoraHub上的学习仅需要了解如何处理LLM推理。因此,它可以在仅有CPU的计算机上完成。这项工作的灵活性和高性能为创建一个平台铺平了道路,在这个领域里,训练过的LoRA模块可以轻松共享、访问和应用于新的任务。团队希望这样的系统能够允许开发一个具有广泛功能的可重用LoRA模块库。该团队正在努力动态组合LoRA节点,以提高LLM的能力,使其适用于所有人。
Leave a Comment在数字时代,自动化欺骗检测系统已经成为各个领域的重要组成部分。准确检测的需求在商业、医学、教育、执法和国家安全领域都是显而易见的。人类面试者的局限性存在着错误指控和无效检测的风险。为了解决这些挑战,东京理科大学的研究人员提出了一种结合面部表情和脉搏数据的机器学习方法,以实现全面的欺骗检测。其目标是开发一个公正可靠的系统,能够协助对犯罪受害者、嫌疑人和心理健康问题个体进行面试。研究人员强调了准确嫌疑人分类的重要性,以避免误认和维护道德和法律的考虑;他们提出了一种人工参与的方法。这种创新方法确保了道德合规性,同时在关键决策过程中实现了广泛的应用。 在相关研究中,以往的研究探索了使用各种方法进行欺骗检测。一项研究开发了一个“欺骗分析和推理引擎”,利用视频中的多模态信息来检测欺骗,AUC约为87%。另一项研究则专注于识别真实和欺骗演讲者之间的情感价值和唤醒差异,使用情感、视觉、音频和语言特征,实现了91%的AUC。AUC是欺骗检测等二元分类任务中常用的度量标准。此外,还使用了机器学习方法来基于非语言行为(NVB)检测欺骗,通过识别面部微动、凝视变化和眨眼率等线索,实现了约80%的准确率。然而,在一些研究中观察到了一些限制,因为数据收集采用了不自然的角色扮演方法。 与传统方法相比,这项创新研究引入了一种自然的方法,其中受试者自由地即兴表演欺骗行为,以提高欺骗检测的准确性。所提出的方法采用机器学习,特别是随机森林(RF)技术,创建了一个结合面部表情和脉搏数据的欺骗检测模型。数据是从四名男研究生进行随机图像讨论时进行收集的。面部表情是使用网络摄像头记录的,而脉搏率是在面试期间使用智能手表测量的。 该过程涉及标准的机器学习步骤,包括数据收集、标记、特征提取、预处理和分类。受试者被展示了各种图像,并被鼓励表达他们的想法,包括欺骗性陈述。所得到的数据集是基于受试者的意图进行标记的,特别关注的是有意的欺骗行为,而不是错误或虚假记忆。使用OpenFace库提取了记录视频中的面部关键点,并从这些关键点中提取了各种面部特征,如眉毛倾斜度、眼睛纵横比、嘴巴面积、眨眼率、凝视、头部倾斜度和脉搏率。预处理包括去除缺失值、过滤异常值,并应用欠采样来平衡正负案例。 https://link.springer.com/article/10.1007/s10015-023-00869-9 随机森林(RF)使用10折交叉验证进行训练和评估,使用准确率、精确率、召回率和F1分数等性能指标来评估其效果。值得注意的是,通过实际的远程工作面试进行的实验显示出与交叉验证结果相似的性能,证实了该方法的实际适用性。特征重要性分析突出了特定的面部特征、脉搏率以及凝视和头部运动作为不同受试者欺骗的重要指标。例如,在某些情况下,口部面积的变化、沉默和眨眼表明了欺骗行为,而其他情况则显示出欺骗过程中脉搏率和凝视方向的显著变化。 总体而言,这项研究提供了一种实用且有前景的方法,利用机器学习和面部特征分析来检测远程面试中的欺骗陈述,为实际应用提供了宝贵的见解。所提出的方法消除了人为偏见,在不同受试者中表现出了令人满意的准确度和F1分数,分别介于0.75和0.88之间。观察到了与面部表情和脉搏率相关的共同特征。然而,需要进一步研究来处理多类别分类,并包括心理评估以进行更全面的分析。尽管数据集规模有限,但这项研究为有兴趣利用自动化欺骗检测系统的面试者提供了基础,同时强调了在应用中道德考虑和合规性的重要性。
Leave a Comment在一项引人入胜的发展中,来自享有盛名的麻省理工学院(MIT)的一名学生推出了AlterEgo,一款创新的AI设备。AlterEgo允许用户与机器、AI助手、服务甚至其他人进行自然语言对话,而无需大声说出一句话。相反,用户可以在内心表达出话语,使沟通变得无缝和谨慎。AlterEgo由来自印度德里的聪明学生Arnav Kapur开发,利用内部语音表达时的外围神经信号,为人机交互的未来提供了迷人的一瞥。 还可阅读:可以将脑活动转化为文本的AI模型 AlterEgo:不言而喻的发明 AlterEgo代表了一种革命性的通信技术。该设备在用户进行内心表达时捕获内部语音表达器的神经信号。这使得用户可以传输和接收信息,而无需进行任何可观察的动作或外部动作。 还可阅读:语音降噪器:一种语音增强深度学习模型 AI拥抱隐私和谨慎 与传统的通信方法不同,AlterEgo通过消除口头语言或可见动作的需要来尊重用户的隐私。使用该设备,用户可以毫不费力地进行交流,而不会干扰周围环境或与环境脱节,使得沟通更加谨慎和无缝。 还可阅读:联合国教科文组织对AI芯片植入提出隐私担忧 非语言对话的力量 一段展示Kapur在接受采访时佩戴AlterEgo的病毒视频让观众惊叹不已。这位MIT的学生在不说一句话的情况下回答问题,展示了该设备的令人印象深刻的功能,引起了赞叹和兴奋。采访者惊叹地说:“你的头脑里有整个互联网。” 帮助有语言障碍的人 AlterEgo在帮助肌萎缩性侧索硬化症(ALS)和多发性硬化症(MS)等患有语言障碍的人方面具有巨大潜力。通过提供一种替代性的交流方式,该设备为那些在口头表达方面面临挑战的人提供了生命线,为独立和连接性带来了新的可能性。 还可阅读:针对语音障碍的ASR模型的设备个性化 为人机一体化铺平道路 除了支持有语言障碍的个体外,AlterEgo还展望了一个人与计算机和谐交织的未来。通过将计算、互联网和人工智能无缝地整合到日常生活中作为“第二个自我”,该设备增强了人类的认知和能力,承诺一个技术将我们的本能能力扩展的世界。 还可阅读:人机交互(HCI)入门及示例 我们的观点 麻省理工学院学生Arnav Kapur的AlterEgo的发明标志着通信和人机交互领域的一个重要里程碑。通过在内心交流和与机器和其他人轻松交流的能力,该设备为隐私、便利和赋权提供了无限的可能性。AlterEgo通过专注于支持有语言障碍的个体并设想一个无缝的人机一体化的未来,为一个变革性的未来铺平了道路,在这个未来中,技术成为我们生活中固有部分的日益重要。当世界庆祝这一聪明的创造时,我们迫切期待AlterEgo重塑我们所知的通信的那一天。
Leave a Comment大型语言模型(LLMs)是深度学习模型在人类语言上的最新进展。这些深度学习训练模型以人类类似的方式理解和生成文本。这些模型是在从互联网、书籍、文章、网站和其他信息来源中抓取的大量数据集上进行训练的。它们可以翻译语言、总结文本、回答问题,并执行各种自然语言处理任务。 最近,人们对它们生成不受欢迎内容的能力及其带来的后果越来越关注。因此,在这个领域进行了重要的研究。 随后,来自卡内基梅隆大学计算机科学学院(SCS)、CyLab安全与隐私研究所以及旧金山人工智能安全中心的研究人员研究了语言模型中生成不受欢迎行为的方法。在他们的研究中,他们提出了一种新的攻击方法,涉及在各种查询后面添加后缀,从而极大地增加了开源和闭源语言模型(LLMs)生成对它们通常会拒绝的问题的肯定回答的可能性。 在他们的调查中,研究人员成功地将攻击后缀应用于各种语言模型,包括ChatGPT、Bard和Claude等公共接口,以及LLMa-2-Chat、Pythia、Falcon等开源LLMs。因此,攻击后缀有效地在这些语言模型的输出中引发了不受欢迎的内容。 这种方法在Vicuna上的100个实例中成功生成了有害行为中的99个。此外,在Vicuna的输出中,它们与目标有害字符串有88个完全匹配。研究人员还测试了他们的攻击方法对其他语言模型的影响,如GPT-3.5和GPT-4,成功率高达84%。对于PaLM-2,成功率为66%。 研究人员表示,目前,通过引导聊天机器人生成不受欢迎或有害内容可能不会对人们造成特别严重的直接伤害。关注点在于这些模型在没有人员监督的自主系统中将扮演更重要的角色。他们进一步强调,在自主系统变得更加现实时,确保我们有可靠的方法来阻止它们被此类攻击劫持将非常重要。 研究人员表示,他们并没有打算攻击专有的大型语言模型和聊天机器人。但是他们的研究表明,即使我们拥有大量参数的闭源模型,人们仍然可以通过查看免费提供的、更小且更简单的开源模型,并学习如何攻击它们来攻击它。 在他们的研究中,研究人员通过在多个提示和模型上训练攻击后缀,扩展了他们的攻击方法。结果,他们在包括Google Bard和Claud在内的各种公共接口中引发了不受欢迎的内容。攻击还影响了像Llama 2 Chat、Pythia、Falcon等开源语言模型,展示了不受欢迎的行为。 这项研究表明他们的攻击方法具有广泛的适用性,可以影响各种语言模型,包括那些具有公共接口和开源实现的模型。他们进一步强调,目前我们没有一种方法来阻止这种对抗性攻击,因此下一步是找出如何修复这些模型。 查看论文和博客文章。此研究的所有荣誉归功于该项目上的研究人员。此外,别忘了加入我们的27k+ ML SubReddit,40k+ Facebook社群,Discord频道和电子邮件通讯,我们在其中分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 本文摘自MarkTechPost,CMU研究人员提出了一种简单而有效的攻击方法,使对齐的语言模型以高成功率生成不受欢迎的行为。
Leave a Comment深度学习和人工智能在近年来在检测模型方面取得了显著的进展。尽管取得了令人印象深刻的进步,但目标检测模型的有效性主要依赖于大规模的基准数据集。然而,挑战在于目标类别和场景的变化。在现实世界中,与现有图像存在显著差异,并且可能出现新的目标类别,因此需要重新构建数据集以确保目标检测器的成功。不幸的是,这严重影响了它们在开放世界情景中的泛化能力。相比之下,即使是儿童,人类也能够在新环境中快速适应和良好泛化。因此,人工智能系统与人类智能之间的普遍性不足仍然是一个值得关注的差距。 克服这一限制的关键是开发一种通用的目标检测器,以实现对任何给定场景中所有类型的目标的检测能力。这样的模型将具备在未知情况下有效运作而无需重新训练的显著能力。这样的突破将显著接近使目标检测系统像人类一样智能的目标。 通用的目标检测器必须具备两个关键能力。首先,它应该使用来自各种来源和多样的标签空间的图像进行训练。在分类和定位方面进行大规模协作训练是确保检测器获得足够信息以有效泛化的关键。理想的大规模学习数据集应包含许多图像类型,涵盖尽可能多的目标类别,具有高质量的边界框注释和广泛的类别词汇。不幸的是,由于人类注释者的限制,实现这样的多样性是具有挑战性的。在实践中,虽然小词汇量的数据集提供了更清晰的注释,但较大的数据集存在噪声并可能存在不一致性。此外,专门的数据集专注于特定类别。为了实现普遍性,检测器必须从具有不同标签空间的多个来源学习,以获得全面和完整的知识。 其次,检测器应该展示对开放世界的强大泛化能力。它应能够准确预测在训练过程中未见过的新类别的标签,而没有显著的性能下降。然而,仅依靠视觉信息无法实现这一目的,因为全面的视觉学习需要人类注释来进行全面监督学习。 为了克服这些限制,提出了一种名为“UniDetector”的新型通用目标检测模型。 架构概述如下图所示。 要实现通用目标检测器的两个关键能力,需要解决两个相应的挑战。第一个挑战是使用多源图像进行训练,其中图像来自不同的来源,并与多样化的标签空间相关联。现有的检测器仅能预测来自一个标签空间的类别,而数据集特定的分类法和数据集之间的标注不一致性使得统一多个异构标签空间变得困难。 第二个挑战涉及新类别的区分。受近期研究中图像-文本预训练的成功启发,作者利用带有语言嵌入的预训练模型来识别未见过的类别。然而,全面监督训练往往会使检测器偏向于关注训练过程中出现的类别。因此,在推断时,模型可能会偏向基础类别,并对新类别产生不自信的预测。尽管语言嵌入提供了预测新类别的潜力,但其性能仍远远落后于基础类别。 UniDetector被设计来解决上述挑战。研究人员利用语言空间探索各种结构,以有效地训练具有异构标签空间的检测器。他们发现采用分区结构可以促进特征共享,同时避免标签冲突,这对于检测器的性能是有益的。 为了增强区域建议阶段对新类别的泛化能力,作者将建议生成阶段与RoI(感兴趣区域)分类阶段解耦,选择分别进行训练而不是联合训练。这种方法利用了每个阶段的独特特征,有助于检测器的整体普遍性。此外,他们引入了一个无类别定位网络(CLN)以实现广义的区域建议。 此外,作者提出了一种概率校准技术来消除预测的偏差。他们估计了所有类别的先验概率,然后根据这个先验概率调整了预测的类别分布。这种校准显著提高了物体检测系统中新类别的性能。根据作者的说法,UniDetector可以超过当前最先进的CNN检测器Dyhead,达到6.3%的平均精度(AP)。 这是UniDetector的摘要,它是一种针对通用物体检测设计的新型人工智能框架。如果您对该工作感兴趣并希望了解更多信息,您可以通过点击下面的链接找到更多信息。
Leave a Comment近年来,数据压缩和蒸馏方法备受关注,彻底改革了人工智能研究。这些方法承诺高效地表示大规模数据集,实现更快的模型训练、经济高效的数据存储和关键信息的保留。然而,现有解决方案在压缩高分辨率数据集(如ImageNet-1K)方面面临巨大的计算开销。 来自穆罕默德·本·扎耶德人工智能大学和卡内基梅隆大学的研究团队推出了一个名为“Squeeze, Recover, and Relabel”(SRe^2L)的划时代数据集压缩框架。他们的突破性方法通过保留关键信息,对高分辨率数据集进行压缩,并实现了卓越的准确性。 数据集蒸馏的主要挑战是创建一个能够有效产生压缩样本并确保生成样本保留原始数据集核心信息的生成算法。由于计算和内存限制,现有方法在扩展到更大数据集时遇到困难,对于保留必要信息的能力受到阻碍。 为了解决这些挑战,SRe^2L框架采用了涉及挤压、恢复和重新标记的三阶段学习过程。研究人员首先训练一个模型,从原始数据集中捕捉关键信息。然后,他们进行恢复过程以合成目标数据,然后进行重新标记,为合成数据分配真实标签。 SRe^2L的一个关键创新在于在训练过程中解耦模型和合成数据的双层优化。这种独特的方法确保从原始数据中提取信息与数据生成过程无关。通过避免额外内存需求和防止原始数据影响生成数据的偏差,SRe^2L克服了以前方法面临的重大限制。 为了验证他们的方法,研究团队对两个数据集进行了广泛的数据蒸馏实验:Tiny-ImageNet和ImageNet-1K。结果令人印象深刻,SRe^2L在完整的Tiny-ImageNet和ImageNet-1K上分别实现了42.5%和60.8%的异常准确率。这些结果大幅超过了所有先前最先进方法14.5%和32.9%的差距,同时保持了合理的训练时间和内存成本。 这项工作的一个与众不同之处在于研究人员对可访问性的承诺。通过利用广泛可用的NVIDIA GPU,如3090、4090或A100系列,SRe^2L变得更加易于广大研究人员和从业者使用,促进合作并加速该领域的进展。 在大规模高分辨率数据集需求不断增长的时代,SRe^2L框架成为数据压缩和蒸馏挑战的变革性解决方案。它在高效压缩ImageNet-1K并保留关键信息方面的能力为各种人工智能应用中的快速高效模型训练打开了新的可能性。凭借其验证成功和易于实施的特点,SRe^2L承诺重新定义数据集蒸馏的前沿,为人工智能研究和发展开辟新的道路。
Leave a Comment理解人类认知使得从脑部过程中重建人类视觉变得有趣,尤其是在使用功能性磁共振成像(fMRI)等非侵入性技术时。在从非侵入性脑部记录中恢复静止图像方面已经取得了很大进展,但对于连续的视觉体验(如电影)则没有太多进展。 虽然非侵入性技术只能收集有限的数据,因为它们的稳健性较差,容易受到噪声等外界影响。此外,收集神经影像数据是一项耗时且昂贵的过程。 尽管面临这些挑战,但已经取得了一些进展,尤其是通过稀疏fMRI-注释对学习有用的fMRI特征。与静态图像不同,人类的视觉体验是一种不间断、不断变化的景象、动作和物体。因为fMRI测量血氧水平依赖(BOLD)信号,并每隔几秒钟拍摄一次脑部活动的图片,所以恢复动态视觉体验可能很困难。每个fMRI读数可以被视为扫描期间脑部活动的“平均值”。相反,标准视频的帧速率为每秒30帧(FPS)。在获取一个fMRI帧的时间内,可以显示60帧的视频帧作为视觉刺激,这可能使受试者接触到各种各样的物体、动作和场景。因此,通过fMRI解码以比fMRI的时间分辨率更高的FPS检索电影是具有挑战性的。 新加坡国立大学和中国香港中文大学的研究人员引入了MinD-Video,这是一个模块化的脑部解码流水线,包括独立训练的fMRI编码器和增强的稳定扩散模型,然后进行微调。所提出的模型在不同阶段从脑部获取数据,扩展其对语义领域的知识。 首先,团队使用大规模无监督学习和脑部建模来训练通用的视觉fMRI特征。接下来,他们使用注释数据集的多模态性提取语义相关特征,并在对比学习空间的fMRI编码器中进行对比学习训练。然后,使用专门针对fMRI输入的增强稳定扩散模型与学习的特征进行共同训练,以进一步完善它们。 研究人员为生成场景动态视频的稳定扩散模型添加了近帧焦点。他们还开发了一个对抗性引导系统,以针对特定目的调整fMRI扫描。检索到了高质量的视频,并且它们的语义,如动作和场景动态,完全准确。 团队使用视频和帧级别的语义和像素指标评估了结果。在语义指标方面的准确率达到了85%,在SSIM方面为0.19,这一方法比先前最先进的方法提高了49%。研究结果还表明,根据注意力研究的结果,该模型似乎具有生物学上的合理性和可解释性,它映射到视觉皮层和更高级的认知网络。 由于个体差异,该技术在不同受试者之间的普适性尚在研究中。此方法在重建中仅使用了不到10%的皮层体素,而完全利用大脑数据的潜力尚未发挥。研究人员认为,随着构建更复杂的模型,该领域可能在神经科学和脑机接口等领域得到应用。
Leave a Comment对于学习高维分布和解决逆问题,生成扩散模型正在成为灵活而强大的框架。由于最近的几个进展,像Dalle-2、Latent Diffusion和Imagen这样的文本条件基础模型在通用图片领域取得了显著的性能。扩散模型最近展示了它们从训练集中记忆样本的能力。此外,一个对模型具有简单查询访问权限的对手可以获取数据集样本,引发隐私、安全和版权问题。 研究人员提出了第一个能够从严重受污染样本中学习未知分布的扩散基础框架。这个问题在科学背景下出现,因为获取清洁样本困难或昂贵。由于生成模型从未接触过清洁训练数据,它们不太可能记忆特定的训练样本。核心概念是在扩散过程中通过引入额外的测量失真进一步损坏原始畸变图像,然后挑战模型从另一个损坏图像中预测原始损坏图像。科学研究验证了这种方法能够生成能够根据这种额外的测量失真获取完整未受损图像的条件期望的模型。修补和压缩感知是这种泛化的两种损坏方法。通过在行业标准基准数据集上训练它们,科学家们展示了他们的模型可以学习分布,即使所有训练样本缺少90%的像素。他们还证明,即使没有记忆训练集,基础模型也可以在小规模损坏数据集上进行微调,并学习到清洁分布。 显著特征 这项研究的核心概念是进一步扭曲图像并迫使模型从图像中预测扭曲的图像。 他们的方法使用损坏的训练数据在流行的基准数据集(CelebA、CIFAR-10和AFHQ)上训练扩散模型。 研究人员根据学习到的条件期望为所需分布p0(x0)提供了一个粗略的采样器。 正如研究所示,即使缺少高达90%的像素,人们仍然可以对原始照片的分布了解很多。他们的结果比先前最佳的AmbientGAN和自然基准更好。 在训练过程中从未见过清洁图像的模型被证明在处理特定逆问题时表现出与最先进的扩散模型类似或更好的性能。而基准方法需要很多扩散阶段,这些模型只需要一个预测步骤就能完成任务。 该方法被用于进一步改进研究社区中标准的预训练扩散模型。从少量受损样本中学习分布是可能的,而且细调过程只需要在单个GPU上几个小时。 一些在不同领域的已损坏样本也可以用于微调像Deepfloyd’s IF这样的基础模型。 为了量化学习效果,研究人员通过展示与训练样本的最高相似性分布来比较使用和不使用损坏进行训练的模型。 通过在足够扭曲的数据上训练的模型被证明不会保留任何原始训练数据的知识。他们评估了失真(决定记忆水平)、训练数据和学习生成器质量之间的权衡。 限制 失真程度与生成器的质量成反比。当失真程度增加时,生成器学习记忆的可能性减少,但代价是质量下降。对这种权衡的精确定义仍然是一个未解决的研究问题。为了估计使用训练模型的E[x0|xt],研究人员在这项工作中尝试了基本的近似算法。 此外,为了对任何训练样本的保护提供严格的隐私保证,需要建立关于数据分布的假设。补充材料显示,修复预测器可以精确恢复E[x0|xt],尽管研究人员没有提供具体的技术。 如果测量中还包含噪声,则此方法将无法正常工作。使用SURE正则化可能有助于未来的研究克服这个限制。
Leave a CommentSPRING是一种基于LLM的策略,在需要多任务规划和推理的交互环境中胜过强化学习算法。 卡内基梅隆大学、NVIDIA、亚里尔大学和微软的一组研究人员调查了使用大型语言模型(LLM)在游戏的背景下理解和推理人类知识的可能性。他们提出了一种名为SPRING的两阶段方法,其中涉及研究学术论文,然后使用问答(QA)框架来证明所获得的知识。 关于SPRING的更多细节 在第一阶段,作者阅读了Hafner(2021)的原始论文的LaTeX源代码,提取先验知识。他们使用LLM提取相关信息,包括论文中记录的游戏机制和期望的行为。然后,他们使用类似于Wu等人(2023)的QA摘要框架生成基于提取的知识的QA对话,使SPRING能够处理多样的上下文信息。 第二阶段专注于使用LLM进行上下文推理,以解决复杂的游戏。他们构建了一个有向无环图(DAG)作为推理模块,其中问题是节点,问题之间的依赖关系表示为边。例如,问题“对于每个动作,需求是否满足?”与问题“前五个动作是什么?”在DAG中有链接,从后者到前者建立了依赖关系。 通过按拓扑顺序遍历DAG,计算每个节点/问题的LLM答案。DAG中的最后一个节点表示关于采取的最佳行动的问题,LLM的答案直接转化为环境行动。 实验和结果 “Crafter Environment”是Hafner(2021)介绍的一个拥有22个成就的开放世界生存游戏,按照深度为7的技术树进行组织。游戏被表示为一个网格世界,具有自上而下的观察和由17个选项组成的离散动作空间。观察还提供有关玩家当前库存状态的信息,包括生命值、食物、水、休息水平和库存物品。 作者将SPRING与Crafter基准测试中的流行RL方法进行了比较。随后,对体系结构的不同组成部分进行了实验和分析,以考察每个部分对LLM的上下文“推理”能力的影响。 来源:https://arxiv.org/pdf/2305.15486.pdf 作者将各种RL基准与SPRING和基于Hafner(2021)环境论文的GPT-4的性能进行了比较。SPRING在游戏得分方面超过了以前的最先进(SOTA)方法,相对提高了88%,在奖励方面相对最佳RL方法(Hafner等人,2023)提高了5%。 值得注意的是,SPRING利用了阅读论文的先验知识,并且不需要任何训练步骤,而RL方法通常需要数百万次的训练步骤。 来源:https://arxiv.org/pdf/2305.15486.pdf 上图显示了不同任务的完成率的图表,将SPRING与流行的RL基准进行了比较。在技术树较深(深度达到5)且通过随机探索难以达到的成就(如“制作石镐”、“制作石剑”和“收集铁”)方面,SPRING借助先验知识的力量,表现超过RL方法十倍以上。 此外,SPRING在成就“吃牛肉”和“收集饮料”方面表现完美。与此同时,基于模型的RL框架(如Dreamer-V3)在“吃牛肉”方面的解锁率显著较低(低了五倍),这是因为通过随机探索达到移动牛的挑战。值得注意的是,尽管通过随机探索很容易实现,但SPRING不采取“放置石头”这个行动,因为在Hafner(2021)的论文中并未讨论该行动对代理有益。 限制 使用LLM与环境进行交互的一个限制是需要进行物体识别和定位。然而,在提供准确物体信息的环境中,如当代游戏和虚拟现实世界,这个限制是不存在的。虽然预训练的视觉骨干在游戏中表现困难,但在类似真实世界的环境中表现得相当不错。视觉语言模型的最新进展表明了未来在视觉语言理解方面的可靠解决方案的潜力。 结论 总之,SPRING框架展示了语言模型(LLMs)在游戏理解和推理方面的潜力。通过利用学术论文中的先前知识和采用上下文思维链的推理,SPRING在Crafter基准测试中超越了先前的最先进方法,在游戏得分和奖励方面取得了显著的改进。这些结果突显了LLMs在复杂游戏任务中的强大能力,并暗示了未来视觉语言模型的进一步发展可以解决现有的限制,为可靠且具有普适性的解决方案铺平道路。
Leave a Comment低级视觉中的一个基本问题是图像超分辨率(SR),其目标是从低分辨率(LR)图像恢复高分辨率(HR)图像。由于现实环境中降级模型的复杂性和不可知性,这个问题需要解决。扩散模型是一种最近开发的生成模型,在创建图像方面取得了非凡的成功。它还在解决一些下游低级视觉问题方面显示出了显著的潜力,如图像编辑、图像修补和图像上色。此外,研究人员仍在努力确定扩散模型在困难且耗时的SR任务中的表现如何。 一个典型的方法是从头开始,将LR图像引入当前扩散模型(如DDPM)的输入后,使用SR的训练数据重新训练模型。另一种常见方法是在生成所需的HR图像之前,修改无条件预训练扩散模型的反向路径。不幸的是,这两种算法都继承了支撑DDPM的马尔可夫链,可能在推理中效率低下,有时需要几百甚至几千个采样步骤。尽管已经提出了几种加速方法来压缩推理中的采样阶段,但这些策略通常会导致性能显著降低和结果过于平滑。 图1比较了近年来包括BSRGAN、RealESRGAN、SwinIR、DASR和LDM在内的最新技术的质量。对于LDM和他们的方法,他们使用公式“LDM(或我们的)-A”来表示可视化的采样步骤数量,其中“A”是总的采样步骤数。请放大以获得更清晰的查看。 必须创建一种新颖的用于SR的扩散模型,以实现效率和性能的统一,而不会牺牲其中任何一项。让我们回顾一下用于图像生成的扩散模型。在正向过程中,通过许多步骤在观测数据上逐渐构建马尔可夫链,将其转化为预先指定的先验分布,通常是传统的高斯分布。然后,可以通过从先验分布中采样噪声图像并将其输入到马尔可夫链的反向路径中来生成图像。尽管高斯先验对于图像生成是一个不错的选择,但对于SR来说可能不是最佳选择,因为LR图像已经可用。 根据他们在这项研究中的论证,用于SR的适当扩散模型应该以基于LR图像的先验分布为基础,从而实现从LR图像到HR图像的迭代恢复,而不是基于高斯白噪声。这样的设计还可以减少采样所需的扩散步骤数量,提高推理的效率。南洋理工大学的研究人员提出了一种有效的扩散模型,它使用较短的马尔可夫链在HR图像和其等效的LR图像之间进行切换。马尔可夫链的初始状态近似于HR图像的分布,而其结束状态近似于LR图像的分布。 他们精心设计了一个过渡核,逐步调整它们之间的残差,以实现这一目标。残差信息可以在多个阶段中快速传递,使该技术比当前基于扩散的SR方法更加高效。此外,他们的体系结构使得可以以清晰、分析的方式表达证据的下限,简化训练优化目标的归纳过程。他们基于这个构建的扩散核心创建了一个高度灵活的噪声调度,调节残差的移动速率和每个步骤中的噪声水平。 通过调整其超参数,该调度方案可以在检索结果的保真度和真实性之间进行权衡。简而言之,以下是本研究的重要贡献: • 他们为SR提供了一种有效的扩散模型,通过在推理过程中移动两者之间的残差,允许从不理想的LR图像到期望的HR图像的迭代采样过程。广泛的研究表明,他们的方法在效率方面具有优势,只需要15个简单步骤即可获得理想的结果,超过或至少与现有的基于扩散的SR技术相等,后者需要一个冗长的采样过程。图1显示了他们的检索结果与现有技术的对比。 • 对于建议的扩散模型,他们开发了一个高度可变的噪声调度,可以更准确地控制过渡过程中的残差和噪声水平的变化。
Leave a CommentDeepMind与YouTube合作推出了一款先进的AI模型Flamingo,旨在增强YouTube Shorts视频的可搜索性。这些短视频剪辑类似于流行的TikTok平台,通常需要更多的描述性文本和有意义的标题,以便用户更容易找到特定内容。然而,引入Flamingo后,用户现在可以更轻松地发现这些视频。 Flamingo利用其先进的视觉语言模型,通过分析YouTube Shorts视频的初始帧生成解释性文本。例如,它可以将场景描述为“一只猫在玩毛线球”。这个生成的文本被存储为元数据,实现了更高效的视频分类和搜索引擎可访问性。 Flamingo的影响已经显现,数十万个新上传的Shorts视频受益于AI生成的描述。YouTube计划逐步将这项技术应用于所有的Shorts视频,使全球观众更容易找到它们。 Flamingo代表了DeepMind和YouTube之间的最新合作,进一步巩固了DeepMind和Google Brain合并为一个统一的AI业务团队的决策,这一决策是由Google在今年四月宣布的。他们之前的合作项目包括利用DeepMind的AI模型MuZero来增强YouTube的VP9编解码器,以实现压缩传输。此外,DeepMind和YouTube在2018年合作,教育视频创作者如何通过与YouTube政策保持一致来最大化收入。这个合作伙伴关系导致了一个标签质量模型(LQM)的开发,确保更准确的内容标签以提高广告精度,并在平台上建立观众、创作者和广告商之间的信任。 继续他们富有成果的合作,DeepMind和YouTube致力于通过引入视频章节来提升用户体验。这一发展带来了一个能够自主处理视频和音频内容转录的AI系统,为章节分割和标题提供建议。这一革命性的功能被称为AutoChapters,并在2022年的Google I/O大会上由CEO Sundar Pichai公布。有了AutoChapters,用户再也不需要费力地搜索冗长的视频,因为AI系统能够迅速识别关键部分。这个功能已经应用于800万个视频,并且DeepMind计划在未来一年将其推广到8000万个视频。 关于Flamingo,YouTube Shorts制作团队明确表示,AI模型生成的元数据对创作者不可见。主要目标是显著提高搜索准确性。此外,谷歌确保Flamingo生成的文本符合其严格的责任标准,避免对视频内容进行负面描述。 随着Flamingo开始革新YouTube Shorts视频的可搜索性,其AI标签能力的准确性将受到密切关注。在这个先进AI技术的时代,Flamingo证明了DeepMind和YouTube之间的合作。通过他们的共同努力,他们不断重新定义AI创新的边界,为创作者和观众创造了更具吸引力和可访问性的环境。
Leave a CommentChatGPT正成为热门话题,每天有数百万人在使用。凭借其惊人的能力,如问答、生成独特而富有创意的内容、总结海量文本数据、代码补全以及开发非常有用的虚拟助手,ChatGPT使我们的生活更加便捷。ChatGPT由OpenAI开发,基于GPT 3.5(生成式预训练变换器)和GPT 4的变换器架构。GPT 4是由OpenAI发布的最新版本的语言模型,具有多模态性,即它以文本和图像的形式输入,与之前的版本不同。甚至其他大型语言模型(LLM),如PaLM、LLaMA和BERT,也被用于涉及医疗保健、电子商务、金融、教育等各个领域的应用中。 一组研究人员在最近发布的研究论文中强调了类似GPT这样的大型语言模型在复杂任务上表现出色而在简单任务上的困难。研究团队对三个代表性的组合任务进行了实验:多位数相乘、逻辑网格谜题和经典的动态规划问题。这些任务涉及将问题分解为较小的步骤,并将这些步骤组合起来产生准确的解决方案。 为了研究变换器在解决需要多步推理的组合任务方面的限制,作者提出了两个假设。第一个假设是变换器通过将多步推理线性化为路径匹配来完成任务,因此依赖于模式匹配和快捷学习,而不是真正理解和实现开发正确解决方案所需的底层计算规则。这种方法在训练期间可以快速准确地预测相似模式,但无法推广到不常见的复杂示例。第二个假设认为,在尝试解决具有独特模式的高复杂性组合任务时,变换器可能存在固有限制。早期的计算错误可能会传播并导致后续步骤中的严重错误,阻止模型获得正确解决方案。 为了研究这两个假设,作者将组合任务形式化为计算图,以便调查。这些图将解决问题的过程分解为更小、更易管理的子模块化功能步骤,从而实现问题复杂性的结构化度量,并将计算步骤的语言化作为语言模型的输入序列。他们甚至使用信息增益来预测模型可能基于底层任务分布而学习的模式,而无需在图中进行完整的计算。 基于实证结果,作者提出变换器通过将多步推理简化为线性子图匹配来处理组合挑战。他们提供了基于抽象多步推理问题的理论论证,强调随着任务复杂性的增加,变换器的性能迅速下降。这表明模型在处理极度复杂的组合问题方面可能已经受到限制。 总的来说,实证和理论结果表明,与对底层思维过程的深入理解相比,变换器的性能主要受到模式匹配和子图匹配的驱动,这也支持变换器在执行越来越困难的任务时可能遇到困难的观点。
Leave a Comment大型语言模型(LLMs)近几个月来引起了大量关注。这些模型通过回答相关问题、生成精确内容、翻译语言、总结长文本段落以及完成代码示例等方式模仿人类。LLMs正在迅速发展,定期推出强大的模型,展示出在代码生成任务中出色的性能。研究人员已经探索了几种技术,包括有监督的微调、指导微调、强化学习等,以提高预训练代码LLMs生成代码的能力。 最近的一项研究中,来自华为云有限公司、中国科学院和北京大学的研究人员团队引入了一种名为RRTF(Rank Responses to align Test&Teacher Feedback)的独特框架,成功而高效地增强了预训练大型语言模型的代码生成能力。RRTF框架旨在提高代码LLMs在代码生成活动中的性能,它使用自然语言LLM对齐技术和评级反馈而不是绝对奖励值。 从人类反馈中进行强化学习的方法,例如使用排名响应作为反馈而不是绝对奖励值的InstructGPT或ChatGPT等模型,为这种新颖方法提供了灵感,该方法将自然语言LLM对齐技术应用于代码LLMs。通过应用RRTF框架,该团队还引入了PanGu-Coder2模型,在OpenAI HumanEval基准测试中,该模型以出色的62.20%的一等通过率位居第一位。 通过在StarCoder 15B上使用该方法,该团队超越了PanGu-Coder并取得了所有记录的代码LLMs中最佳性能,证明了RRTF的实用性。对HumanEval、CoderEval和LeetCode三个基准的全面分析表明,代码LLMs在代码创作任务中可能能够超越相同或更大规模的自然语言模型。该研究还强调了高质量数据在提高模型遵循指令和编写代码能力方面的价值。 该团队总结了以下贡献: 引入了RRTF优化模式,该模式具有许多优点,使其成为一个与模型无关、简单直观和高效的方法。 引入了PanGu-Coder2模型,PanGu-Coder2的性能大幅超越原始模型约30%。HumanEval、CoderEval和LeetCode是一些展示这一显著速度提升的基准。 PanGu-Coder2在代码生成方面超越了所有先前发布的代码LLMs,取得了新的最先进成就。 该团队讨论了他们在构建用于代码生成的良好训练数据方面的想法和实践知识。 使用RRTF框架训练了PanGu-Coder2模型,并提供了有关该过程的有益见解。 除了提高代码生成效率,该团队还提出了PanGu-Coder2使用的优化方法,以保证快速推理。这一领域的发现有助于创建现实部署方案,因为高效的推理对于实际应用至关重要。
Leave a Comment每一天都带来了大型语言模型(LLMs)的显著进展,这些模型在文本生成、情感分类、文本分类和零样本分类等各种任务中表现出色。它们的能力超越了这些领域,使内容创作、客户服务和数据分析实现自动化,从而彻底改变了生产力和效率。 最近,研究人员还开始探索使用LLMs进行推理的用途和效用。这些模型可以理解复杂的文本信息,并从中进行逻辑推理。LLMs擅长于问题回答、问题解决和决策制定等任务。然而,LLMs仍然不能像人类一样解决对人类来说很容易的问题,比如在给定环境中生成执行任务的行动计划,或者进行复杂的数学、逻辑和常识推理。LLMs在某些任务上面临困难,因为它们没有像人类那样的内部世界模型。这意味着它们无法预测在特定情况下事物的发展情况,或者模拟行动的长期结果。人类拥有内部世界模型,即对环境的心理表示,使得人类能够模拟行动及其对世界状态的影响,从而在复杂任务中进行有意识的计划。 为了解决这些问题,研究人员设计了一种新的推理框架,即基于规划的推理(RAP)。该框架使用一个库,使LLMs能够使用先进的推理算法进行复杂的推理。该框架将多步推理方法视为规划,并搜索最优推理链,以实现“世界模型”和“奖励”之间的最佳探索与开发平衡。除了RAP论文外,研究团队还提出了LLM推理器。LLM推理器是一个专门为语言模型(LLMs)设计的AI库,通过使用先进的算法,使其具备进行复杂推理的能力。它将多步推理视为规划,搜索最有效的推理链,并使用“世界模型”和“奖励”的概念优化探索和开发之间的平衡。你只需要定义一个奖励函数和(可选地)一个世界模型。LLM推理器负责处理其余的事情,包括推理算法、可视化、LLM调用等等! 世界模型将部分解决方案视为状态,并将新的行动/思考附加到状态作为状态转换。奖励函数在评估推理步骤的表现好坏方面起着关键作用。其思想是,具有更高累积奖励的推理链更有可能是正确的。 研究人员对该框架进行了广泛的研究。他们将RAP应用于数学推理和逻辑推理等几个具有挑战性的推理问题。这些任务的实际结果表明,RAP优于几种强基准方法。当应用于LLaMA33B时,RAP超越了GPT-4上的CoT,在计划生成方面实现了惊人的33%相对改进。 在推理过程中,LLM通过不断评估最佳推理步骤(行动)巧妙地构建推理树。为此,它使用其世界模型,这与以不同方式使用的相同LLM相同。通过模拟未来结果,LLM估计潜在奖励,并使用此信息更新其对当前推理步骤的信念。通过探索更好的替代方案和改进决策,它改进了推理过程。该框架提供了先进的推理算法,提供直观的可视化和解释,并与任何其他LLM库兼容。 研究人员强调,在对各种具有挑战性的推理问题进行广泛实验后,RAP优于几种基于CoT的当代推理方法。该框架甚至在某些情况下表现优于先进的GPT-4。RAP在设计奖励、状态和行动方面的灵活性展示了其作为灵活的框架处理各种推理任务的潜力。RAP将规划和推理以创新的方式结合在一起,这种方法有可能彻底改变我们对LLM推理的理解方式,为AI系统实现人类级别的战略思考和规划铺平道路。
Leave a Comment