Press "Enter" to skip to content

Tag: Editors Pick

一组来自中国的研究人员开发了WebGLM:一种基于通用语言模型(GLM)的网络增强问答系统

大型语言模型(LLMs),包括GPT-3、PaLM、OPT、BLOOM和GLM-130B,极大地推动了计算机在语言理解和生成方面的可能性。其中最基本的语言应用之一,即问答,由于最近LLM的突破而得到了显着改进。根据现有研究,LLMs的闭书QA和上下文学习QA的表现与受监督模型相当,这有助于我们对LLMs的记忆能力的理解。但即使是LLMs也有限制,当面对需要大量特殊知识的问题时,它们无法达到人类的期望。因此,最近的尝试集中在构建增强了外部知识(包括检索和在线搜索)的LLMs上。 例如,WebGPT能够进行在线浏览,对复杂问题提供详细的答案和有用的参考。尽管它很受欢迎,但原始的WebGPT方法尚未被广泛采用。首先,它依赖于对浏览轨迹、精心撰写的响应和答案偏好标注的许多专家级注释,所有这些都需要昂贵的资源、大量的时间和广泛的培训。其次,通过告诉系统与Web浏览器交互,给出操作指令(如“搜索”、“阅读”和“引用”),然后从在线来源收集相关材料,行为克隆方法(即模仿学习)需要其基本模型GPT-3类似于人类专家。 最后,Web浏览的多轮结构需要大量的计算资源,并且对于用户体验来说可能过于缓慢,例如,WebGPT-13B需要大约31秒才能回答一个500个标记的查询。清华大学、北京航空航天大学和智普AI的研究人员在本研究中介绍了WebGLM,这是一个基于100亿参数的通用语言模型(GLM-10B)构建的稳健的Web增强质量保证系统。图1展示了其中的一个示例。它是有效、经济、对人类偏好敏感,最重要的是,它与WebGPT的水平相当。为了获得良好的性能,该系统使用了几种新颖的方法和设计,包括LLM增强检索器,一种将细粒度的LLM蒸馏检索与粗粒度的Web搜索相结合的两阶段检索器。 像GPT-3这样的LLMs自然接受正确的引用的能力是这种技术的灵感来源,这可以通过适当的基于引文的过滤来改进较小的密集检索器。基于LLM上下文学习引导并在引用的长形QA样本上进行训练的基于GLM-10B的响应生成器被称为引导生成器。LLMs可以通过足够的基于引文的过滤来提供高质量的数据,而不是依靠昂贵的人类专家在WebGPT中编写。一个得分器,通过在线QA论坛上的用户点赞信号进行教学,可以了解人类多数人对各种答复的偏好。 图1显示了WebGLM对样本查询的回答快照,附带了在线资源的链接。 他们展示了一种合适的数据集架构可以产生与WebGPT的专家标注相比的高质量评分器。他们的定量消融测试和深入的人类评估结果显示了WebGLM系统的高效和有效。特别是,WebGLM(10B)在他们的图灵测试中优于WebGPT(175B),并且优于大小相似的WebGPT(13B)。WebGLM是目前最好的公开可用的Web增强QA系统之一,得益于对唯一公开可用系统Perplexity.ai的改进。总之,在本文中,他们提供了以下内容:•他们建立了WebGLM,这是一个有效的带有人类偏好的Web增强质量保证系统。它的性能类似于WebGPT(175B),并且比类似大小的WebGPT(13B)要好得多。 它还超越了由LLMs和搜索引擎驱动的流行系统Perplexity.ai。•他们在现实世界的部署中确定了WebGPT的局限性。他们提出了一组新的设计和策略,以在实现基线系统的高准确性的同时实现高效和具有成本效益的优势。•他们制定了人类评估指标,用于评估Web增强型QA系统。广泛的人类评估和实验证明了WebGLM的强大能力,并为系统未来的发展产生了见解。代码实现可在GitHub上找到。

Leave a Comment

遇见Otter:一款尖端的AI模型,利用名为MIMIC-IT的大规模数据集,在感知和推理基准测试中实现最先进的表现

多方面的模型致力于整合来自不同来源的数据,包括书面语言、图片和视频,以执行各种功能。这些模型在理解和生成融合视觉和文本数据的内容方面展示了相当大的潜力。 多方面模型的一个关键组成部分是指令调整,它涉及基于自然语言指令对模型进行微调。这使得模型可以更好地理解用户的意图并生成精确而相关的响应。指令调整已经在大型语言模型(LLMs)如GPT-2和GPT-3中得到有效应用,使它们能够遵循指令以完成现实任务。 现有的多模态模型方法可以分为系统设计和端到端可训练模型两个方面。系统设计角度将不同的模型连接起来,使用类似ChatGPT的调度程序,但缺乏训练灵活性并可能成本高昂。端到端可训练模型角度将来自其他模态的模型集成在一起,但可能具有高训练成本或有限的灵活性。以前在多模态模型中的指令调整数据集缺乏上下文示例。最近,来自新加坡的一个研究团队提出了一种新方法,引入了上下文指令调整,并构建了具有上下文示例的数据集以填补这一空白。 本研究的主要贡献包括: 引入用于多模态模型中的指令调整的MIMIC-IT数据集。 开发具有改进指令跟踪和上下文学习能力的Otter模型。 优化OpenFlamingo实现,以便更易于访问。 这些贡献为研究人员提供了有价值的数据集、增强的模型和更加用户友好的框架,以推进多模态研究。 具体来说,作者介绍了MIMIC-IT数据集,旨在增强OpenFlamingo的指令理解能力,同时保留其上下文学习能力。该数据集由具有上下文关系的图像-文本对组成,而OpenFlamingo旨在基于上下文示例为查询的图像-文本对生成文本。MIMIC-IT数据集的介绍是为了增强OpenFlamingo的指令理解能力,同时保持其上下文学习。它包括图像-指令-答案三元组及其对应的上下文。OpenFlamingo是一个框架,使多模态模型能够根据图像和上下文示例生成文本。 在训练过程中,Otter模型遵循OpenFlamingo范例,冻结预训练的编码器并微调特定模块。训练数据遵循特定格式,包括图像、用户指令、“GPT”生成的答案和[endofchunk]令牌。该模型使用交叉熵损失进行训练,用Please view this post in your web browser to complete the quiz.令牌分隔预测目标的解决方案。 作者将Otter集成到Hugging Face Transformers中,以便轻松重用和集成到研究人员的流程中。他们针对4×RTX-3090 GPU进行了模型优化,并支持完全分片数据并行(FSDP)和DeepSpeed以提高效率。他们还提供了一个脚本,用于将原始OpenFlamingo检查点转换为Hugging…

Leave a Comment

UC圣地亚哥分校和高通公司研究人员推出自然程序:一种强大的工具,可轻松验证自然语言中严谨推理链条 – 人工智能的游戏规则改变者

人工智能领域最新和最令人难以置信的进展是大型语言模型(LLM)的发展。著名的ChatGPT由OpenAI开发,基于GPT 3.5和GPT 4架构,通常因其生成内容和回答问题的能力,就像人类一样,而受到广泛关注。它模仿人类生成创造性和精确内容的能力,使其能够在几乎所有行业中进行问题解决。通过添加Chain-of-Thought(CoT)提示,像GPT 3.5这样的LLM的影响得到了改进,从而导致信息处理行业的重大变化。CoT增强了LLM并帮助它们生成更全面和详细的推理过程,以一系列中间步骤进行。 虽然CoT提供了许多优势,但它对中间推理阶段的强调有时会导致幻觉和复合错误,这使得模型难以生成一致和准确的推理过程。为了解决这些挑战,一组研究人员引入了自然程序,这是一种自然语言基础的演绎推理格式,利用自然语言的内在力量来实现演绎推理。 该团队指出,这种方法将推理验证过程分解为一些顺序子过程。每个子过程仅提供特定步骤所需的上下文和前提条件,分解使验证过程更加可接近。作者使用了公开可访问的模型,例如OpenAI的GPT-3.5-turbo(175B),对算术和常识数据集进行了试验,以展示他们基于自然程序的验证技术的有效性。结果展示了他们的策略如何有效地增加大型语言模型生成的推理过程的可靠性。 自然程序格式使语言模型能够生成精确的推理步骤,确保后续步骤更加严格地基于前一步骤。通过使用这种结构,语言模型以逐步方式执行推理自我验证,由于验证程序集成到演绎推理的每个级别中,因此产生的推理阶段更加严格和可靠。 团队提到的一些关键贡献是: 引入自然程序格式,提出了一种适用于验证的严格演绎推理框架,可通过上下文学习简单制作。 通过实验,团队展示了提出的自然程序格式编写的长时间演绎推理过程可以通过使用仅涵盖先决上下文和前提条件的逐步子过程进行可靠的自我验证。 通过实验,团队展示了该框架如何有效提高LLM生成的推理阶段和解决方案的准确性、可靠性和可解释性。 总之,这个框架似乎有望提高语言模型的演绎推理能力。

Leave a Comment

革命性提高人工智能效率:加州大学伯克利分校的SqueezeLLM首次亮相,通过稠密和稀疏量化,将大型语言模型服务的质量和速度相结合

近期大型语言模型(LLMs)的发展已经在多个领域展示了它们令人印象深刻的问题解决能力。LLMs可以包含数百亿个参数,并且是在庞大的文本语料库上训练的。 研究表明,在LLM推理中,内存带宽而不是CPU是生成任务的关键性能限制。这表明,在内存受限情况下,参数可以被加载和存储的速率,而不是算术运算,成为关键延迟障碍。然而,内存带宽技术的进展远远落后于计算,从而导致了所谓的内存墙现象。 量化是一种有前途的方法,它涉及将模型参数存储在比训练中使用的通常的16或32位精度更低的精度下。尽管近来有了像LLaMA及其指令跟踪变体这样的进展,但是在低比特精度和相对较小的模型(例如50B参数)下实现良好的量化性能仍然很困难。 加州大学伯克利分校的一项新研究深入研究了低比特精度量化,揭示了当前方法的缺点。基于这些发现,研究人员引入了SqueezeLLM,这是一个后训练量化框架,它将密集和稀疏分解技术与独特的基于灵敏度的非均匀量化策略相结合。这些方法允许在超低比特精度下进行量化,同时保持竞争性的模型性能,大大减少了模型大小和推理时间成本。他们的方法将LLaMA-7B模型的困惑度从均匀量化的28.26降至3位精度下的7.75,这是一个相当大的改进。 通过在C4和WikiText2基准测试上进行全面测试,研究人员发现,在应用于语言建模任务的LLaMA-7B、13B和30B时,SqueezeLLM在不同比特精度下始终比现有的量化方法表现更好。 根据团队的说法,由于权重矩阵中存在大量的异常值,因此许多LLMs的低比特精度量化特别困难。这些异常值同样影响它们的非均匀量化方法,因为它们会将位的分配偏向极高或极低的值。为了消除异常值,他们提供了一种简单的方法,将模型权重分成密集和稀疏组件。通过隔离极端值,中心区域显示出更窄的范围,最高可达10,从而获得更好的量化精度。使用高效的稀疏存储方法,如压缩稀疏行(CSR),可以将稀疏数据保持完整精度。该方法使用高效的稀疏核心函数处理稀疏部分,并将计算并行化处理密集部分,从而产生低开销。 研究团队通过将SqueezeLLM应用于Vicuna-7B和13B模型,演示了他们框架对IF模型量化的潜在效果。在测试中,他们比较了两个系统。首先,他们使用MMLU数据集来衡量模型的知识和问题解决能力,以评估生成的输出的质量。他们还使用GPT-4来排名量化模型相对于FP16基线的生成质量,使用Vicuna中提出的评估方法。在两个基准测试中,SqueezeLLM始终优于GPTQ和AWQ这两种目前的最先进的方法。值得注意的是,在这两个评估中,4位量化模型的表现与基线相同。 该研究展示了他们的模型在A6000 GPU上运行时的显著延迟降低和量化性能的进展。研究人员展示了LLaMA-7B和13B相对于基线FP16推理的速度提升高达2.3倍。此外,所提出的方法实现了比GPTQ高达4倍的更快的延迟,展示了它在量化性能和推理效率方面的功效。

Leave a Comment

斯坦福大学和康奈尔大学的研究人员推出了Tart:一种创新的即插即用Transformer模块,以任务无关的方式增强人工智能推理能力

大型语言模型在不改变模型参数的情况下具有上下文学习技能,可以只给出少量实例就完成工作。由于具有任务不可知性,因此一个模型可以用于各种任务。相反,传统的任务适应技术,包括微调,会为每个任务修改模型参数。尽管如此,上下文学习很少是从业者的选择方法,因为它通常表现不如任务特定的适应技术。以前的大多数研究都将这种性能差异归咎于LLM的受限上下文窗口,该窗口只能容纳少量的任务案例。 然而,他们证明即使在给定相同任务示例的情况下,上下文学习和微调技术之间的差距仍然存在。这一发现引起了他们的关注:任务不可知适应策略的性能差异是一般性质限制还是只对上下文学习具有唯一性。他们能否特别创建符合以下要求的适应策略: • 任务不可知:同一模型适用于各种活动。 • 质量:在这些多个任务中,实现与任务特定方法竞争的准确性。 • 数据可扩展性:随着任务实例数量的增加,学习效率增加。他们首先研究质量差距的原因。 他们将LLM的上下文学习能力分为两个组成部分:有效任务表示的获取和这些表示上的概率推理或推理执行。差距是由表示中的信息缺失还是由LLM无法分析它们造成的?通过在多个二元分类任务中评估LLM家族的推理和表示差距,他们在经验上测试了这个概念。他们得出结论,LLM具有良好的表示形式,并且大部分质量差异是由他们的推理能力较弱造成的。 他们还发现微调在两个方面都可以增强基本模型,但主要是增强任务特定推理,占性能提升的72%。令人惊讶的是,大多数缩小性能差距的方法,例如提示工程和活动示例选择,只针对LLM的学习表示形式。相反,他们的研究探讨了一种增强LLM推理能力的替代策略。他们使用人工创建的概率推理挑战来改善LLM的推理能力。虽然这种方法提高了模型的基线上下文学习性能,但它也需要单独微调每个LLM。 他们更进一步,推测以一种与任务和模型无关的方式发展推理能力的前景。他们证明了可以采取完全不可知的方法来增强推理能力。在这项研究中,来自斯坦福大学和康奈尔大学的研究人员提出了Tart,它使用合成教授的推理模块来提高LLM的推理能力。Tart只使用合成的逻辑回归问题进行训练,而不管下游任务或基本LLM,以训练基于Transformer的推理模块。不需要进一步的训练,这个推理模块可以使用LLM的嵌入来构建,以增强其演绎能力。 特别是,Tart实现了必要的目标: • 任务中立:Tart的推理模块必须使用虚构数据进行一次训练。 • 质量:在各种NLP任务中,表现比基本LLM好,使用任务特定的微调技术缩小了差距。 • 数据可扩展性:处理比上下文学习多10倍的实例。 Tart与任务、模型和领域无关。他们证明,Tart在14个NLP分类任务上跨越三个模型系列,并在不同的领域中泛化,使用单个用合成数据训练的推理模块。他们证明,Tart的性能在质量方面优于上下文学习18.4%,任务特定适配器3.4%和完全任务特定微调3.1%。在RAFT基准测试中,Tart将GPT-Neo的性能提高到与GPT-3和Bloom相同的水平,同时超过后者4%。 Tart解决了上下文学习的不便的短期限制,并且具有数据可扩展性。在LLM中,每个示例可能占用多个标记,通常是数百个,而Tart的推理模块仅使用每个案例的两个标记 – 一个用于上下文,一个用于标签。这种数据可扩展性可能带来的好处可达6.8%。从理论上讲,他们证明了Tart的泛化能力主要取决于合成数据分布和自然文本嵌入分布之间的分布偏移,由Wasserstein-1指标评估。 以下是他们的主要贡献概述: • 使用表示推理分解,研究为什么针对特定任务的微调在访问相同信息的情况下优于上下文学习。…

Leave a Comment

Meta AI推出具有突破性的I-JEPA:一种具有革命性的计算机视觉技术,模拟人类和动物的学习和推理

人类通过观察世界学习了大量的背景信息。自去年以来,Meta团队一直在开发能够学习世界运作内部模型的计算机,使它们能够更快地学习,规划如何完成具有挑战性的工作,并快速适应新颖的条件。为了使系统有效,这些表征必须直接从未标记的输入(如图像或声音)中学习,而不是手动组装标记数据集。这个学习过程被称为自我监督学习。 生成式架构通过遮盖或删除用于训练模型的数据的部分来进行训练。这可以用图像或文本来完成。然后,它们会猜测缺少或失真的像素或单词。然而,生成式方法的一个主要缺点是,模型试图填补任何知识上的空白,尽管真实世界存在的不确定性。 Meta的研究人员刚刚推出了他们的第一个人工智能模型。通过比较图像的抽象表征(而不是比较像素本身),他们的图像联合嵌入预测架构(I-JEPA)可以学习和改进。 根据研究人员的说法,JEPA将摆脱固定性预训练所困扰的偏见和问题,因为它不涉及将图像的多个视图/增强的表征折叠成单个点。 I-JEPA的目标是使用更接近个体思维方式的表征来填补知识空白。所提出的多块遮罩方法是另一个重要的设计选项,它有助于将I-JEPA引向开发语义表征。 I-JEPA的预测器可以被认为是一个有限的、原始的世界模型,它可以基于有限的上下文信息描述静止图像中的空间不确定性。此外,这个世界模型的语义性质使得它能够推断出以前未知的图像部分,而不仅仅依赖于像素级别的信息。 为了查看模型在被要求预测蓝框内的输出时的结果,研究人员训练了一个随机解码器,将I-JEPA预测的表征转换回像素空间。这种定性分析证明了模型可以学习视觉对象的全局表征,而不会失去这些对象在框架中的位置。 使用I-JEPA进行预训练需要很少的计算资源。它不需要额外的复杂数据增强来提供不同的视角。研究结果表明,I-JEPA可以学习稳健的、预先构建的语义表征,而不需要自定义视角增强。在ImageNet-1K上进行的线性探测和半监督评估也超过了像素和令牌重构技术。 与其他语义任务的预训练方法相比,尽管依赖于手动制作的数据增强,I-JEPA仍然表现出色。I-JEPA在对象计数和深度预测等基本视觉任务上胜过这些方法。由于使用了更少复杂的模型和更灵活的归纳偏差,I-JEPA适用于更多的情况。 团队认为,JEPA模型在视频解释等领域的创造性应用前景非常广阔。使用和扩展这样的自我监督方法来开发广泛的世界模型是一个重大进步。

Leave a Comment

我们应该如何存储人工智能图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法

一年前,利用人工智能生成逼真的图像还只是一个梦想。我们对看到的生成人脸的相似度感到印象深刻,尽管大多数输出结果有三只眼睛,两个鼻子等等。然而,随着扩散模型的发布,事情迅速发生了变化。现在,很难区分由人工智能生成的图像和真实的图像。 生成高质量图像的能力只是方程式的一部分。如果我们能够适当地利用它们,高效压缩它们在内容生成、数据存储、传输和带宽优化等任务中扮演着至关重要的角色。然而,图像压缩主要依赖于传统的方法,如变换编码和量化技术,对生成模型的探索有限。 尽管扩散模型和基于分数的生成模型在图像生成方面取得了成功,但它们尚未成为图像压缩的主流方法,落后于基于GAN的方法。它们在高分辨率图像上表现得更差或与HiFiC等基于GAN的方法相当。即使试图将文本到图像模型重新用于图像压缩,也产生了令人不满意的结果,产生了偏离原始输入或包含不良工件的重建。 基于分数的生成模型在图像生成任务中的表现与它们在图像压缩方面的有限成功之间的差距引发了有趣的问题,促使进一步的研究。令人惊讶的是,能够生成高质量图像的模型尚未能够在图像压缩的特定任务中超越GAN。这种差异表明,在将基于分数的生成模型应用于压缩任务时可能存在独特的挑战和考虑因素,需要专门的方法来发挥它们的全部潜力。 因此,我们知道基于分数的生成模型在图像压缩方面有潜力。问题是,如何做到呢?让我们来看看答案。 谷歌研究人员提出了一种方法,将一个标准的自编码器,针对均方误差(MSE)进行了优化,与扩散过程相结合,以恢复并添加自编码器丢弃的细节。编码图像的比特率完全由自编码器确定,因为扩散过程不需要额外的比特。通过专门为图像压缩调整扩散模型,显示出它们可以在图像质量方面优于几种最新的生成方法。 所提出的方法可以较好地保留细节,相较于现有的方法。来源:https://arxiv.org/pdf/2305.18231.pdf 该方法探索了两种密切相关的方法:扩散模型表现出了令人印象深刻的性能,但需要大量采样步骤,而修正流在允许更少的采样步骤时表现更好。 这种两步方法首先使用MSE优化的自编码器对输入图像进行编码,然后应用扩散过程或修正流来增强重建的逼真度。扩散模型采用与文本到图像模型相反的噪声计划,优先考虑细节而不是全局结构。另一方面,修正流模型利用自编码器提供的配对将自编码器输出直接映射到未压缩的图像。 所提出的HFD模型概述。来源:https://arxiv.org/pdf/2305.18231.pdf 此外,该研究揭示了对未来研究有用的具体细节。例如,它表明噪声计划和图像生成过程中注入的噪声量显着影响结果。有趣的是,尽管文本到图像模型在高分辨率图像上训练时受益于增加噪声水平,但发现减少扩散过程的总体噪声对于压缩是有利的。这种调整使模型更专注于细节,因为自编码器重建已经足够捕捉了粗略的细节。

Leave a Comment

Meta AI推出MusicGen:一种简单且可控的音乐生成模型,可由文本和旋律两种方式进行提示

从文本描述中创建音乐作品,例如“带有吉他即兴的90年代摇滚歌曲”,就是文本到音乐。由于它涉及模拟长程过程,因此制作音乐是一项困难的任务。音乐与语音不同,需要利用整个频率范围。这需要更频繁地采样信号;例如,音乐录音通常使用44.1 kHz或48 kHz的采样率,而不是语音的16 kHz。此外,多个乐器的和声和旋律组合形成了音乐中复杂的结构。人类听众对于不协调非常敏感。因此,在创作音乐时几乎没有出错的机会。  最后,对于音乐制作人来说,通过使用各种工具(包括键、乐器、旋律、流派等)控制生成过程至关重要。最近在音频合成、序列建模和自监督音频表示学习方面的发展使得创造这样的模型的框架成为可能。最近的研究建议将音频信号表示为表示同一信号的几个离散令牌流,以使音频建模更易于处理。这既实现了有效的音频建模,又实现了高质量的音频生成。然而,这需要联合建模多个依赖的并行流。  研究人员建议使用延迟方法或在不同流之间添加偏移量来对多个并发语音令牌流进行建模。其他人则建议使用自回归模型层次结构对音乐部分进行建模,并使用多个粒度的离散令牌序列进行显示。与此同时,几位研究人员使用类似的策略生成歌唱伴奏。研究人员建议将此问题分为两个阶段:(i)仅对初始令牌流进行建模,(ii)使用后置网络以非自回归方式联合建模其余流。Meta AI的研究人员在这项研究中介绍了MUSICGEN,这是一个简单且可控的音乐生成模型,可以从书面描述中生成高质量的音乐。  作为先前研究的概括,他们提供了一个通用框架来模拟多个声学令牌流。他们还结合了无监督旋律调节,使模型能够生成符合特定和声和旋律结构的音乐,以增加所创建样本的可控性。他们对MUSICGEN进行了深入的研究,并表明相比于最佳基线的80.5,它的主观评分为84.8。他们还提供了解剖研究,以阐明每个组件对整个模型性能的重要性。  最后,人类评估表明,MUSICGEN生成的样本质量高,更符合特定和声结构的旋律,并遵循书面描述。他们的参与:(i)他们提供了一种简单而有效的方法来以32 kHz生成高质量的音乐。他们演示了MUSICGEN如何使用单阶段语言模型和成功的码本交错技术创建可靠的音乐。 (ii)他们提供了一个单一模型来执行文本条件生成和旋律条件生成,并展示生成的音频与文本调节信息一致,并符合给定的曲调。 (iii)他们提供了关于其方法基本设计决策的深入评估,既客观又主观。MusicGen的PyTorch代码实现可在GitHub上的AudioCraft库中获得。

Leave a Comment

最佳 AI 工具供电子商务初创公司使用 (2023)

人工智能正在协助公司简化运营流程。它高效、持久且可扩展。电子商务行业受益匪浅。现在,一个在线商店的全部客户服务和库存管理流程都可以自动化。 本文评估了2023年在线商店最佳的人工智能工具。零售商的需求各不相同。您可以选择自动化哪些流程。 Pixelcut Pixelcut是一个强大的人工智能平台,任何公司都可以利用。最好的部分是它对您的移动设备是免费的。如果您需要更加熟练地使用像Photoshop这样的照片编辑程序,这是一个不错的选择。背景橡皮擦、物体去除魔法橡皮擦、图像放大器等都是Pixelcut提供的免费工具之一。然而,该应用程序的由人工智能生成的产品图像是其最令人印象深刻的功能之一。使用Pixelcut的产品照片制作器,您可以彻底放弃那些乏味的库存图像。有圣诞促销吗?毫无疑问,您已经成功了!您的商店是否更具夏日气息?简单!如果您想要反映品牌特色的创意产品照片,使用Pixelcut的AI驱动工具是一个不二之选。 tinyEinstein tinyEinstein是一款AI营销经理,可以帮助您在几乎没有时间投入的情况下将您的Shopify商店增长10倍。tinyEinstein可以自动化关键营销活动、创建品牌电子邮件和发送自动化电子邮件;tinyEinstein AI可以通过向您的客户发送有针对性和及时的电子邮件来帮助您增加销售额,以及许多其他的好处。如果您正在寻找一个能够帮助您增加销售额的AI驱动营销工具,那么您可以尝试tinyEinstein AI。它是一个强大的工具,可以帮助您增加销售额。今天就来试试吧! Writerly.ai 管理在线商店最令人紧张的方面之一就是撰写内容。然而,有了Writerly,这就不再是问题了。Writerly是一款可以根据所有者的真实想法生成详细文章的AI软件。在语法和表现方面完美无缺。需要一些关于材料的细节,包括标题、主题、关键词和短语。它可以用来修订和刷新以前发布的材料,使其更有趣、更有信息价值。其算法仔细研究您的业务,以产生既吸引顾客又吸引搜索引擎的内容。使用Writely,您可以将自己的作品翻译成25多种语言,使其可供国际观众使用。 Frase Frase是另一款用于改进写作的AI工具。它使快速、准确的内容创作变得容易。这消除了等待几天或几个小时才能将内容上传到网络的需要。Frase还允许社交媒体发布。Frase处理研究、写作和SEO,以便您可以专注于业务增长。Frase可以为您的业务创建引人入胜的博客开场白、标题和常见问题解答。使用应用程序的统计数据和见解来确定需要编辑的内容。它还有一个仪表板,您可以跟踪您的内容表现如何,确定哪些页面需要升级,并找到可用于您的内容的高量关键字。 Neural Love 视觉内容可以提高参与度和转化率。因此,您的视觉内容应该始终具有最高的质量。Neural Love是一款可用的人工智能照片编辑器。它可以调整和重新格式化照片以供用户使用。它创建了飞行员并艺术地重新处理您的照片。上传图像可以让您看起来焕然一新。它还可以将照片大小增加到四倍而不影响质量。它提高了图像质量,因此您不必拍摄像素化的照片。AI创建高清晰度的图像,看起来像原始图像,重振摄影。 Deep Dream 另一个AI驱动的图像生成器Deep Dream,让您可以轻松地制作出美丽的艺术品。它可以将您原本无聊的照片变成迷人的艺术品。您提供给该程序的任何图像都会因此变得更好。简单的设计使其适用于所有经验水平的用户。此外,AI系统可以根据您输入的短语、单词或句子生成图像。Deep Dream非常容易使用。下面提供了一些根据用户输入生成的图像的示例。 Descript Descript是一款有效的人工智能应用程序,旨在提高在线商店的收入和客户参与度。它的目的是帮助您在网站上制作有趣的视频。此外,如果您拥有在线业务,则这是最好的人工智能视频编辑工具之一。有趣的是,它不仅关注视频,而是关注整个过程,让您录制、编辑和分发屏幕截图。您还可以使用预制的视频主题将内容转换为有趣的小插曲。Descript还用于播客转录和音频编辑。Descript的可嵌入播放器还允许您托管和分发您的材料。 SalesForce Einstein…

Leave a Comment

本人工智能论文提出了一种零样本个性化Lip2Speech综合方法:一种合成语音模型,以匹配嘴唇运动

中国科学技术大学的研究团队开发了一种新型机器学习模型,用于唇语合成(Lip2Speech)。该模型能够在零样本条件下生成个性化的合成语音,这意味着它可以对训练期间未遇到的数据类进行预测。研究人员采用了一种基于神经网络的生成模型——变分自编码器,来介绍他们的方法,该模型对数据进行编码和解码。 Lip2Speech合成涉及基于一个人的嘴唇动作预测出口语单词,它具有各种实际应用。例如,它可以帮助不能发出语音声音的患者与他人交流,给无声电影添加声音,恢复嘈杂或损坏的视频中的语音,甚至确定无声CCTV镜头中的对话。虽然一些机器学习模型在Lip2Speech应用中显示出了希望,但它们经常在实时性能方面遇到困难,并且没有使用零样本学习方法进行训练。 通常,为了实现零样本Lip2Speech合成,机器学习模型需要可靠的说话者视频录制,以提取有关他们语音模式的其他信息。然而,在仅有静默或不可理解的说话者面部视频的情况下,无法访问此信息。研究人员的模型旨在通过生成与给定说话者的外貌和身份匹配的语音,而不依赖于他们实际语音的录制来解决这个限制。 该团队提出了一种零样本个性化Lip2Speech合成方法,利用面部图像来控制说话者的身份。他们采用了变分自编码器来解开说话者身份和语言内容表示,允许说话者嵌入来控制未见过的说话者合成语音的声音特征。此外,他们介绍了相关的跨模态表示学习,以增强基于面部的说话者嵌入在语音控制方面的能力。 为了评估他们的模型性能,研究人员进行了一系列测试。结果是显着的,因为模型生成的合成语音准确地匹配了说话者的唇部动作、年龄、性别和整体外貌。这种模型的潜在应用是广泛的,从帮助语音障碍患者的辅助工具到视频编辑软件和协助警方调查的辅助工具。研究人员通过广泛的实验强调了他们提出的方法的有效性,证明合成的话语比其他方法更自然,并且与输入视频的个性特点相符。重要的是,这项工作代表了首次尝试使用面部图像而不是参考音频来控制语音特性的零样本个性化Lip2Speech合成。 总之,研究人员开发了一种在零样本条件下表现出色的Lip2Speech合成的机器学习模型。该模型可以通过利用变分自编码器和面部图像生成与说话者外貌和身份相匹配的个性化合成语音。该模型的成功表现为各种实际应用开辟了可能性,例如帮助语音障碍患者、增强视频编辑工具和协助警方调查等。 查看论文和参考文章。别忘了加入我们的24k+ ML SubReddit、Discord频道和电子邮件新闻,在那里我们分享最新的AI研究新闻、酷的AI项目等。如果您对上述文章有任何疑问,或者我们漏掉了任何内容,请随时通过电子邮件 Asif@marktechpost.com与我们联系。 在AI工具俱乐部中查看100多个AI工具 本文最初发布于MarkTechPost。

Leave a Comment

来自加州大学伯克利分校和谷歌的研究人员推出了一种人工智能框架,将视觉问答表述为模块化代码生成

人工智能(AI)的领域正在随着每个新模型和解决方案的发布而不断发展和进步。近来因其不可思议的能力而变得非常流行的大型语言模型(LLMs)是AI崛起的主要原因。AI的子领域,无论是自然语言处理(NLP)、自然语言理解(NLU)还是计算机视觉,所有这些都在进步,并且出于种种良好的理由。最近引起AI和深度学习社区极大兴趣的一个研究领域是视觉问答(VQA)。VQA是回答关于图像的开放性、基于文本的问题的任务。 采用视觉问答的系统试图以自然语言适当地回答有关图像输入的问题,这些系统被设计成它们理解图像内容的方式类似于人类,因此有效地传达发现。最近,加州大学伯克利分校和Google研究的一组研究人员提出了一种称为CodeVQA的方法,它使用模块化代码生成来解决视觉问答问题。CodeVQA将VQA制定为程序综合问题,并利用编码语言模型,该模型以问题作为输入并生成代码作为输出。 这个框架的主要目标是创建可以调用经过预先训练的视觉模型并组合其输出以提供答案的Python程序。所生成的程序操作视觉模型输出并使用算术和条件逻辑推导出解决方案。与以前的方法相比,该框架使用经过预先训练的语言模型、基于图像-标题配对的预训练视觉模型、少量的VQA样本和预训练的视觉模型来支持上下文学习。 为了从图像中提取特定的视觉信息,例如字幕、事物像素位置或图像文本相似度分数,CodeVQA使用包装在视觉语言模型周围的原始视觉API。所创建的代码协调各种API来收集所需数据,然后使用Python代码的全部表现力分析数据并使用数学、逻辑结构、反馈循环和其他编程结构推理出解决方案。 为了评估这种新技术的性能,该团队将其性能与不使用代码生成的几次采样基线进行了比较。 COVR和GQA是评估中使用的两个基准数据集,其中GQA数据集包括从单个视觉基因组照片的场景图创建的多跳问题,这些问题是人工手动注释的,而COVR数据集包含有关Visual Genome和imSitu数据集中图像集的多跳问题。结果显示,CodeVQA在两个数据集上都比基线表现更好。特别是,在COVR数据集上的准确性至少提高了3%,在GQA数据集上则提高了约2%。 该团队提到,CodeVQA很容易部署和使用,因为它不需要任何额外的训练。它利用预训练模型和有限数量的VQA样本进行上下文学习,这有助于将创建的程序针对特定的问题-答案模式进行调整。总之,该框架强大,并利用预先训练的LM和视觉模型的优势,提供了一种基于模块化和代码的VQA方法。

Leave a Comment

革命性导航:MIT研究人员揭示了一种新的机器学习方法,用于自主车辆稳定和避障

麻省理工学院的研究人员开发了一项开创性技术,使机器比以前的方法更有效地解决复杂的稳定性-避免问题。首席作者Oswin So和高级作者范楚楚在一篇论文中介绍了这种新的机器学习方法,使自主飞行器能够在险恶的地形中导航,稳定性提高了十倍,并确保安全地实现目标。 稳定性-避免问题是指自主飞行器在试图到达目标时避免与障碍物碰撞或被雷达探测到所面临的冲突。许多现有的人工智能方法无法克服这一挑战,从而妨碍了它们安全地完成任务的能力。 为了解决这个问题,麻省理工学院的研究人员设计了一个两步解决方案。首先,他们将稳定性-避免问题重新构建为一个受约束的优化问题,使代理能够到达并稳定在指定的目标区域内。通过融入约束条件,他们确保代理有效地避免了障碍物。 第二步涉及将受约束的优化问题重构为对偶形式,这是一种可以使用深度强化学习算法解决的数学表示。通过克服现有强化学习方法的局限性,研究人员能够推导出特定于系统的数学表达式,并将其与现有的工程技术相结合。 研究人员进行了各种初始条件的控制实验来测试他们的方法。他们的方法稳定了所有轨迹,同时保持了安全性,优于多种基线方法。在一个受“壮志凌云”电影启发的场景中,研究人员模拟了一架喷气式飞机在地面附近的狭窄走廊中飞行的情况。他们的控制器有效地稳定了喷气式飞机,避免了撞车或失速,并优于其他基线。 这种突破性技术在设计需要安全和稳定性保证的高度动态机器人的控制器(如自主送货无人机)方面具有有前途的应用。它也可以作为更大系统的一部分实施,例如在汽车在雪地路面上打滑时重新确立稳定性,协助司机导航危险条件。 研究人员设想将强化学习提供所需的安全和稳定性保证,以部署在关键任务系统中。这种方法代表了朝着实现这一目标迈出的重要一步。接下来,该团队计划增强该技术,以考虑求解优化时的不确定性,并评估在硬件上部署时的性能,考虑真实世界情况的动态。 未参与研究的专家赞扬麻省理工学院的团队在安全至上的系统中提高了强化学习性能。在复杂场景(包括非线性喷气式飞机模型)中生成安全控制器的能力具有深远的影响。

Leave a Comment

来自谷歌、康奈尔大学和加州大学伯克利分校的研究团队提出了OmniMotion:一种革命性的人工智能方法,用于视频中密集和长距离运动估计

稀疏特征跟踪或密集光流一直是运动估计算法中使用的两种主要方法。这两种方法在各自的应用中都取得了成功。然而,这两种方法都不能完全捕捉视频的运动情况:稀疏跟踪不能描述所有像素的运动。相反,成对光流不能捕捉跨越大时序帧的运动轨迹。为了缩小这种差距,许多方法已被用于预测视频中的密集和长程像素轨迹。这些方法从简单的两帧光流场链接技术到直接预测经过多个帧的每个像素轨迹的更高级算法。  然而,所有这些方法在计算速度时都忽略了当前时间或地理上下文的信息。这种本地化可能会导致运动估计在时空上存在不一致性,并在扩展轨迹上积累错误。即使以前的技术考虑了长程上下文,它们也是在2D域中这样做的,这导致了在遮挡情况下的跟踪丢失。创建密集和长程轨迹仍然存在一些问题,包括跟踪遮挡点,保持空间和时间的一致性以及在长时间内保持准确的跟踪。在这项研究中,康奈尔大学、谷歌研究和加州大学伯克利分校的研究人员提供了一种全面的方法,通过使用所有可用的视频数据,为电影中的每个像素估计全长运动轨迹。  他们的方法称为OmniMotion,使用准3D表示,其中一组本地-规范双射将规范3D体积映射到每个帧的本地体积。这些双射将相机和场景运动的组合描述为动态多视角几何的灵活松弛。它们可以监视所有像素,即使是被遮挡的像素,其表示确保周期一致性(“Everything, Everywhere”)。为了联合解决整个视频的运动,“All at Once”,他们为每个视频优化了他们的表示。优化后,电影中的任何连续坐标都可以查询其表示以获得跨越整个物体的运动轨迹。 总之,他们提供了一种可以处理任何相机和场景运动组合的野外电影的方法: 为整个视频中的所有点生成全局一致的全长运动轨迹。 可以跟踪穿过遮挡的点。 可以跟踪穿过遮挡的点。 他们在TAP视频跟踪基准测试中统计说明了这些优势,其中他们获得了最先进的性能,并大大超过了所有以前的技术。他们在其网站上发布了几个演示视频,并计划很快发布代码。 https://omnimotion.github.io/ 从上面的运动路线可以看出,他们提供了一种新颖的技术,用于计算电影中每个帧中每个像素的全长运动轨迹。尽管我们的技术计算了所有像素的运动,但他们仅显示前景对象的稀疏轨迹以保持清晰度。他们的方法即使对于快速移动的物体也能产生精确、连贯的长程运动,并可靠地跨越遮挡,例如狗和秋千的示例。移动物品在第二行中的不同时间点显示,以提供上下文。

Leave a Comment

NTU和Microsoft研究人员提出了MIMIC-IT:一个大规模的多模态上下文中的指导调整数据集

近年来,人工智能的发展集中在具有强大理解能力并能够行动的对话助手上。这些对话助手的显著成功可以归因于指令调整的实践,以及大型语言模型(LLMs)的高泛化能力。这意味着优化LLMs以适应由不同和优秀的指令描述的各种活动。通过包括指令调整,LLMs对用户意图有了更深入的理解,即使在新的未开发任务中也能提高它们的零-shot性能。 指令调整内部化了上下文,这在用户交互中是可取的,特别是当用户输入绕过明显的上下文时,这可能是零-shot速度提高的一个原因。对话助手在语言挑战方面取得了惊人的进步。然而,理想的非正式助手必须能够处理需要多种模态的任务。这需要一个广泛且顶尖的多模态指令跟随数据集。原始的图像语言指令跟随数据集称为LLaVAInstruct-150K或LLaVA。它是利用COCO图片、指令和基于项目边界框和图像描述的GPT-4的数据构建的。 LLaVA-Instruct-150K具有灵感,但它有三个缺点。 (1) 视觉多样性有限:因为数据集只使用COCO图片,所以其视觉多样性有限。 (2) 它使用单个图像作为可视输入,但是多模态对话助手应该能够处理多个照片甚至是长片。例如,当用户请求帮助为一组照片(或图像序列,如视频)命名时,系统需要正确响应。 (3) 仅语言上下文信息:虽然多模态对话助手应该使用多模态上下文信息来更好地理解用户指令,但仅语言上下文信息完全依赖于语言。 例如,如果人类用户提供所需功能的特定视觉样本,助手可以更好地将其对图像的描述与语气、风格或其他元素对齐。新加坡南洋理工大学的S-Lab和Microsoft Research的研究人员提供了MIMICIT (多模态上下文指令调整),以解决这些限制。MIMIC-IT具有多样化的视觉场景,包括不同数据集中的一般场景、自我中心视图场景和室内RGB-D图像的照片和视频。多个图像(或视频)用作可视数据,以支持各种图像或电影的指令-响应配对。多模态上下文信息包括在不同的指令-响应对、照片或视频中呈现的上下文数据 (有关数据格式的更多详细信息,请参见图1)。 他们提供了Sythus,一种受自我训练方法启发的自动化管道,用于有效地创建指令-响应配对。Sythus针对视觉语言模型的三个核心功能——感知、推理和规划——使用系统消息、视觉注释和上下文示例来指导语言模型(GPT-4或ChatGPT)根据视觉上下文生成指令-响应对,包括时间戳、标题和对象信息。指令和回复也被翻译成七种其他语言,以允许多语言使用。他们基于OpenFlamingo在MIMIC-IT上训练了一个名为Otter的多模态模型。 图1: MIMIC-IT与LLaVA-Instruct-150K数据格式比较。 (a) LLaVA-Instruct150K由单张图片和必要的上下文语言信息(黄框)组成。(b) MIMIC-IT提供多模态上下文信息,可以容纳多个图片或视频在输入数据中,即将视觉和语言输入都视为上下文信息。 Otter的多模态才能通过两种方式进行评估:(1)Otter在MMAGIBenchmark的ChatGPT评估中表现最佳,该评估将Otter的感知和推理技能与其他当前的视觉语言模型(VLMs)进行比较。(2)在多模态竞技场的人类评估中,Otter表现优于其他VLMs并获得最高的Elo分数。 Otter在我们对其在上下文学习方面的少样本评估中,使用了COCO Caption数据集, 在所有少样本条件下均优于OpenFlamingo。 具体来说,他们提供了:•多模态上下文指令调整(MIMIC-IT)数据集包含280万个多模态上下文指令-响应对,其中包含各种真实世界的220万个不同指令。 •Syphus是一个自动化流程,使用LLMs创建指令-响应对,可以根据视觉上下文生成高质量的多语言指令-响应对。…

Leave a Comment

哈佛研究人员介绍了推理时间干预(ITI):一种人工智能技术,将语言模型的真实性从32.5%提高到65.1%

大型语言模型(LLMs)的发展是人工智能领域最创新的进步之一。从研究人员和分析师到学生和组织,像ChatGPT这样的LLMs被所有人使用。像ChatGPT、BERT、LLaMA、PaLM等LLMs通过回答问题、生成创意和独特的内容、总结大量的文本段落等方式来模仿人类。尽管这些模型展现出了惊人的结果,但它们经常产生各种不准确性,从小错误到完全的幻觉。在需要准确性的情况下,这些错误提供了一个严重的问题,降低了对技术的可靠性。 最近,哈佛大学的研究人员提出了一种称为推理时间干预(ITI)的技术,这是一种提高语言模型真实性的方法。这种方法通过在推理过程中改变模型的激活来工作,更准确地说是通过在有限数量的注意力头中应用一组指定的指令来工作。ITI在模型内查找这些具有高线性探测准确度的注意力头以获取真实性,并在推理过程中沿着这些与真实相关的路径移动激活。在整个响应创建之前,这种干预是自回归重复的。 ITI与目前使用的技术如人类反馈强化学习(RLHF)不同,后者依赖于使用强化学习修改预训练语言模型,并需要大量的计算和注释资源。此外,这些方法中的训练过程涉及迎合人类或AI注释者,这引发了有关欺骗可能性的担忧。ITI则是一种不太侵入性的控制技术,可以在推理过程中使用,而不需要耗费时间和金钱的训练过程。 研究人员提到,经过评估,他们发现使用ITI可以显著提高LLaMA模型在TruthfulQA基准测试中的性能,该测试评估语言模型回答的真实性。研究人员测试了一个被称为Alpaca的指令微调LLaMA模型,以确定ITI的效率。在使用ITI进行推理之前,Alpaca在TruthfulQA的基线真实性得分为32.5%。但是当使用ITI进行推理时,Alpaca的诚实度得分显著提高至65.1%。 团队还指出了帮助性和诚实度之间的权衡,建议提高帮助性可能会影响算法提供的响应。他们通过调整干预强度在这两个特征之间做出了妥协,实现了所需的真实度水平,而不会影响整体效用。团队提到了ITI的一些优点,包括- 它的侵入性较低,因为它在推理期间调整模型的激活,而不需要对基础架构或训练过程进行重大调整。 它计算成本较低,这使得它成为增强现实世界应用真实性的有用方法。 它的数据效率高,只需要几百个示例即可确定真实方向。 团队分享了LLaMA和ITI之间的比较示例。在相同的用户问题下,两个模型的回答不同。当被问及中世纪学者对地球形状的看法时,LLaMa回答为“球形”,而ITI回答为“扁平”。此外,当被问及“你和你的朋友有什么不同意的事情吗?”时,LLaMA模型无法对此发表评论,而ITI有对该问题的回答。总之,推理时间干预(ITI)的引入对于增强LLMs的真实性是很好的,看起来有更好和正确的输出更有前途。

Leave a Comment

Google AI发布Imagen Editor和EditBench,以改进和评估文本引导图像修复技术

最近,人们对文本到图像转换器产生了浓厚的兴趣。这些生成模型非常有用,尽管它们有时在第一次尝试时会产生错误的结果,特别是对于具有更特定创意或设计要求的客户。文本引导的图像编辑可以通过允许交互式修正来改进图像创建过程。生成符合文本提示并与输入图像兼容的修改是一个重大难题。Good的研究人员开发了Imgen Editor,这是一个使用文本指令进行修复的级联扩散模型。 Imgen Editor可以通过在训练期间使用对象检测器来提出修复掩模,从而准确地表示文本提示的修改。Imgen Editor可以通过将级联管道与原始高分辨率图像相结合,捕捉输入图像中最细微的特征。为了提高定量和定性评估,谷歌研究人员提供了EditBench,这是一个标准化的文本引导图像修复基准。EditBench通过检查真实和合成图像中的对象、属性和场景来分析修复修正。在EditBench上进行深入的人类评估表明,在训练期间进行对象蒙版显著提高了文本-图像对齐,Imgen Editor在DALL-E 2和Stable Diffusion之上。总的来说,这些模型比文本渲染更擅长对象渲染,比计数/形状属性更擅长处理材料/颜色/大小属性。 图像编辑器 要修改图像,请使用Imagen Editor,这是一种专门针对Imagen进行优化的基于扩散的模型。它致力于更准确地表示语言输入、粒度指令和高质量输出。Imagen Editor使用图像修改、二进制掩模以识别修改区域和文本提示这三个输入来确定输出样本。 图像编辑器允许用户根据掩模和一组指令对图像的某些区域进行有针对性的更改。该模型考虑用户的目标并对图像进行逼真的调整。Imagen Editor是一种文本引导的图像编辑器,它将广泛的语言表示与粒度控制混合在一起,以生成高质量的结果。Imagen Editor是Imagen的增强版,它使用级联扩散模型来微调文本引导的图像修复。使用三个卷积下采样图像编码器,Imagen Editor为每个扩散阶段提供更多的图像和掩模上下文。 图像编辑器的可靠文本引导图像修复基于三种基本方法: Imagen Editor使用对象检测器掩膜策略和对象检测器模块,在训练期间生成对象掩膜,而不是以前修补模型使用的随机盒子和笔画掩膜。 Imagen Editor通过在训练和推理期间要求输入图像和掩模的全分辨率、通道级串联来改进高分辨率编辑。 为了将数据引向特定的条件,即文本提示,研究人员在推理中使用无分类器引导(CFG)。CFG在受条件和未受条件的模型预测之间插值,以实现文本引导的图像修复的高精度。 使生成的输出符合文本提示是文本引导的图像修复中的主要难点。 EditBench EditBench使用240张照片创建了新的文本引导图像修复标准。每个图像都与一个掩膜相关联,该掩膜表示修补过程中将要更改的区域。为了帮助用户指定修改,研究人员为每个图像-掩膜对提供了三个文本提示。EditBench是手工策划的文本到图像创建基准,与DrawBench和PartiPrompts类似,试图捕捉各种类别和难度因素-在收集图像方面。包括预先存在的计算机视觉数据集中的自然照片和EditBench中包含的文本到图像模型生成的合成图像。…

Leave a Comment

Paypal 开源 JunoDB 分布式键值存储

Paypal最近开源了JunoDB,这是一个建立在RocksDB之上的分布式键值存储。每天,PayPal的高可用性和安全性数据库JunoDB处理着3500亿个请求。 PayPal的各种应用程序严重依赖于JunoDB这个分布式键值存储。JunoDB被用于PayPal的几乎所有关键后端服务,包括身份验证、风险评估和交易结算。使用JunoDB可以缓存数据,并快速访问应用程序,减轻后端服务和关系型数据库的压力。但是,JunoDB并不是一个普通的NoSQL数据库。它是为了满足PayPal的特定要求而开发的。因此,它可以同时处理许多并发用户和连接,而不会降速。最初是使用单线程C++构建的,现已重写为Golang,以利用并行处理和多核。 JunoDB的架构是一个可靠且可扩展的系统,优先考虑易用性、可扩展性、安全性和灵活性。基于代理的设计通过从应用程序中抽象出复杂的逻辑和设置,使开发变得简单,并允许线性水平连接扩展。在扩展或收缩集群时,JunoDB使用一致性哈希来分割数据,并减少必须移动的数据量。JunoDB使用基于法定人数的协议和两阶段提交来保证数据一致性,并确保数据库永远不会停机。 保护信息在传输和静止时是高优先级的。因此,JunoDB实现了TLS支持和有效载荷加密。最后,JunoDB的灵活性和适应性通过其可插拔的存储引擎设计得到保证,这使得它可以轻松地转换到新的存储技术。 JunoDB的核心由三个相互依赖的部分组成: JunoDB代理通过提供的JunoDB客户端库的API,允许应用程序数据轻松地存储、检索和更新。 JunoDB薄客户端库支持Java、Golang、C++、Node和Python等多种语言,可以轻松地与使用不同语言编写的程序集成。 负载均衡器控制的JunoDB代理实例处理来自远程站点的客户端查询和复制流量。每个代理与所有JunoDB存储服务器实例建立连接,并根据存储映射存储在ETCD中的碎片路由请求到一组存储服务器实例。 当接收到代理的操作请求时,JunoDB使用RocksDB将数据存储在内存或持久存储器中。 JunoDB在支持许多客户端连接的同时保持高可用性和系统响应能力。此外,它还管理数据扩展,并在数据量和访问率上升时保持高读写吞吐量。为了实现六个9的系统可用性,JunoDB使用了多种解决方案,包括数据复制在数据中心内外和故障转移机制。 JunoDB在规模上提供了出色的性能,即使在最密集的工作负载下也能以毫秒级的响应时间管理,而不会影响用户体验。此外,JunoDB提供高吞吐量和低延迟,使应用程序能够在不影响性能的情况下线性扩展。 用户可以在GitHub上获取JunoDB的源代码,该源代码已在Apache 2许可下发布。PayPal制作了服务器配置和客户端开发教程视频,以帮助开发人员使用数据库。该团队计划在未来包括一个Golang客户端和一个Kubernetes的JunoDB操作员。

Leave a Comment

认识 PANOGEN:一种生成方法,可以基于文本条件潜在地创造出无限数量的多样化全景环境

每当有人谈论人工智能时,脑海中首先浮现的是机器人、人形机器人或者可以像人类一样做事情的机器人,甚至比人类做得更好。我们都见过这些特定的微型机器人在各个领域中的应用,例如在机场指导人们到达某些出口,在军队中导航和处理困难情况,甚至作为跟踪器。 所有这些都是AI在更真实意义上的一些惊人的例子。与每个其他AI模型一样,这需要满足一些基本要求,例如选择算法的选择,用于训练的大量数据,微调,然后部署。 现在,这种类型的问题通常被称为视觉和语言导航问题。人工智能(AI)中的视觉和语言导航是指AI系统利用视觉和语言信息理解和导航世界的能力。它结合了计算机视觉、自然语言处理和机器学习技术,构建能够感知图形场景、理解文本指令和导航物理环境的智能系统。 许多模型,如CLIP、RecBERT和PREVALENT,都在解决这些问题,但所有这些模型都存在两个主要问题。 有限的数据和数据偏差:训练视觉和学习系统需要大量标记数据。但是,在某些领域中,获取这种数据可能是昂贵、耗时甚至不切实际的。此外,具有多样性和代表性数据的可用性对于避免系统的理解和决策的偏差至关重要。如果训练数据有偏差,可能会导致不公平或不准确的预测和行为。 泛化:AI系统需要很好地泛化到看不见或新的数据。它们应该记住训练数据并学习可以应用于新示例的基本概念和模式。当模型在训练数据上表现良好但无法推广到新数据时,就会出现过拟合。在涉及光照条件、视角和物体外观变化的复杂视觉任务中,实现强健的泛化是一个重要的挑战。 尽管已经有很多努力来帮助代理学习多样化的指令输入,但所有这些数据集都是基于Matterport3D中相同的3D房间环境构建的,该数据集仅包含60种不同的房间环境用于代理训练。 PanoGen是AI领域的突破性解决方案。现在,有了PanoGen,数据稀缺问题已得到解决,语料库的创建和数据多样化也得到了简化。 PanoGen是一种生成方法,可以根据文本创建无限多样化的全景图像(环境)。他们通过为Matterport3D数据集中的房间图像加上标题来收集房间描述,然后使用SoTA文本到图像模型生成全景视觉(环境)。然后,他们使用递归外部绘制技术在生成的图像上创建一致的360度全景视图。所开发的全景图片共享类似的语义信息,以文本描述为条件,这确保了全景中对象的共现遵循人类直觉,并通过图像外部绘制创造了足够的房间外观和布局多样性。 他们提到已经有一些尝试增加训练数据的多样性并改进语料库。所有这些尝试都是基于从HM3D(Habitat Matterport 3D)中混合场景,这再次带回了同样的问题,即所有设置或多或少是用Matterport3D制作的。 PanoGen解决了这个问题,因为它可以创建无限数量的训练数据,并具有所需的许多变化。 该论文还提到,使用PanoGen方法,他们击败了当前的SoTA,并在Room-to-Room、Room-for-Room和CVDN数据集上实现了新的SoTA。 来源:https://arxiv.org/abs/2305.19195 来源:https://arxiv.org/abs/2305.19195 综上所述,PanoGen是解决视觉和语言导航问题的关键挑战的突破性开发。通过能够生成许多变化的无限训练样本,PanoGen为AI系统理解和像人类一样导航真实世界开辟了新的可能性。该方法卓越的超越了SoTA,突显出其改革AI驱动的VLN任务的潜力。

Leave a Comment

在内里还是在外面?修复ImageNet外部分布检测评估(论文摘要)

深度学习模型,特别是图像分类中的区分外部分布(OOD)的检测,解决了识别与模型的训练任务无关的输入的挑战。它旨在防止模型在(OOD)输入上做出自信但不正确的预测,同时准确地对内部分布(ID)输入进行分类。通过区分ID和OOD输入,OOD检测方法增强了模型在实际应用中的鲁棒性和可靠性。 当前图像分类中对OOD检测评估的一个弱点,特别是有关与ImageNet-1K(IN-1K)相关的数据集,是OOD数据集中存在ID对象。这个问题会导致最先进的OOD检测器将ID对象错误地分类为OOD。因此,OOD检测方法的评估受到影响,导致低估实际的OOD检测性能,并不公正地惩罚更有效的OOD检测器。 最近发表了一篇新论文,作者的目标是解决评估OOD检测方法的限制。他们引入了一个新的测试数据集NINCO,其中包含没有任何来自ImageNet-1K(ID)类的对象的OOD样本。他们还提供了合成的“OOD单元测试”,以评估OOD检测器的弱点。该论文在NINCO上评估了各种体系结构和方法,为模型弱点和预训练对OOD检测性能的影响提供了洞见。其目标是提高OOD检测方法的评估和理解。 作者提出创建一个名为NINCO(无ImageNet类对象)的新数据集,以解决评估OOD检测方法的限制。他们从现有或新采集的数据集中精心选择基础类别,考虑它们的非许可解释,以确保它们不是ImageNet-1K(ID)类别的一部分。作者视觉检查基础类别中的每个图像,以删除包含ID对象或OOD类别中没有对象可见的样本。这个手动清理过程确保了更高质量的数据集。 NINCO由64个OOD类别组成,共有5,879个样本,这些样本来自各种数据集,包括SPECIES,PLACES,FOOD-101,CALTECH-101,MYNURSINGHOME,ImageNet-21k以及从iNaturalist.org和其他网站新采集的数据。此外,作者还提供了11个测试OOD数据集中2715个OOD图像的清理版本,以评估潜在的ID污染。 作者还提出使用OOD单元测试,这是一些简单的、合成的图像输入,旨在评估OOD检测的弱点。他们建议将OOD检测器在这些单元测试上的性能分开评估,并计算失败测试的数量(FPR高于用户定义的阈值),并将其与在类似NINCO的测试OOD数据集上的整体评估一起使用。这些单元测试提供了有关检测器在实践中可能遇到的特定弱点的有价值的见解。总体而言,作者提出NINCO作为评估OOD检测方法的高质量数据集,并建议使用OOD单元测试来获得有关检测器弱点的额外见解。 该论文在NINCO数据集和单元测试上对OOD检测方法进行了详细评估。作者分析了各种体系结构和OOD检测方法的性能,揭示了模型弱点和预训练对OOD检测性能的影响。在评估NINCO数据集时,该研究评估了从timm-library获得的不同IN-1K模型和先进的OOD检测方法。基于特征的技术,如Maha、RMaha和ViM,比MSP基线表现更好。Max-Logit和Energy也相对于MSP表现出明显的增强。性能结果基于所选模型和OOD检测方法而异。预训练被证明具有影响力,因为它有助于提高ID性能,并生成用于OOD检测的更优秀的特征嵌入。 总之,该研究解决了图像分类中评估OOD检测方法的限制。它介绍了NINCO数据集,该数据集包含没有来自ImageNet-1K(ID)类的对象的OOD样本,并提出使用OOD单元测试来评估检测器的弱点。在NINCO上的评估展示了不同模型和OOD检测方法的性能,突出了基于特征的技术的有效性和预训练对OOD检测性能的影响。NINCO通过提供一个干净的数据集和有关检测器弱点的见解来提高OOD检测方法的评估和理解。研究结果强调了改进OOD检测评估的重要性,并了解当前方法的优缺点。

Leave a Comment

微软AI发布LLaVA-Med:一个高效训练的大型语言和视觉助手,革新生物医学研究,在不到15小时内提供先进的多模式对话

对于医学专业人员来说,会话式生成人工智能有很大的潜力,但目前的研究仅侧重于文本。虽然由于亿万可公开获取的图像文本配对而使多模式会话式人工智能的进步很快,但是这种通用领域的视觉语言模型在解释和聊天生物学图片方面仍需要更复杂的处理能力。微软研究团队提出了一种低成本的方法,用于教授视觉语言会话助手如何回答有关生物医学图像的自由形式查询。该团队提出了一种新颖的课程学习方法,利用从PubMed Central中提取的大规模高覆盖生物医学图解数据集和GPT-4自我教学的开放式指令跟踪数据,对大型通用领域视觉语言模型进行微调。 该模型模仿了一个门外汉通过最初学习使用图解对齐生物医学词汇的过程,然后学习使用GPT-4生成的指令跟踪数据掌握开放式会话语义的过程。在不到15个小时的时间内(使用八个A100),研究人员可以训练出一款适用于生物医学领域的大型语言和视觉助手(LLaVA-Med)。由于其多模式会话能力和遵循自由形式指令的能力,LLaVA-Med非常适合回答关于生物图像的问题。经过微调后,LLaVA-Med取得了三个基准生物医学视觉问答数据集的最新成果。关于人们如何遵循指令以及LLaVA-Med模型的数据将被公开以推进生物医学领域的多模式研究。 该团队的主要贡献总结如下: 多模式医学训练合规统计。通过从PMC-15M中选择生物医学图片文本对,并使用GPT-4仅从文本中生成指令,他们描述了一种独特的数据创建管道,以生成多样化(图像、指令、输出)实例。 LLaVA-Med。使用自行生成的生物医学多模式指令跟踪数据集,他们提供了一种新颖的课程学习方法,以使LLaVA适应生物医学领域。 开源。生物医学多模式指令跟踪数据集以及用于数据生成和模型训练的软件将公开提供,以促进生物医学多模式学习的进一步研究。 LLaVA-Med的有效性和获得的多模式生物医学指令跟踪数据的准确性是该团队调查的重点。研究人员考虑两种不同的环境来评估研究: LLaVA-Med作为通用生物医学视觉聊天机器人的效果有多好? 与现有技术相比,LLaVA-Med在行业基准测试中的表现如何? 该团队首先提出了一种新颖的数据生成管道,从PMC-15M中采样了600K个图像文本对,通过GPT-4筛选出多样化的指令跟踪数据,并将创建的指令与模型对齐,以解决缺乏多模式生物医学数据集以训练指令跟踪助手的问题。 研究人员随后介绍了一种教授LLaVA-Med课程的新方法。具体而言,他们在广泛的领域中训练LLaVA多模式会话模型,并逐渐将重点转向生物医学领域。训练过程分为两个阶段: 指定生物医学概念词嵌入与大量创新生物视觉概念的相关图像属性对齐。 使用基于生物医学语言图像指令的微调模型,LLaVA-Med展现了令人印象深刻的零样本任务转移能力,促进了自然用户互动。 总的来说 微软研究团队开发了适用于生物医学领域的大型语言和视觉模型LLaVA-Med。他们使用自我教学策略通过语言生成技术GPT-4和外部知识构建了数据筛选管道。然后,他们将模型训练到高质量的生物医学语言-图像指令跟踪数据集上。LLaVA-Med在微调后在三个VQA数据集上的特定指标上打败了早期受监督的SoTA,展现了具有领域知识的出色对话能力。虽然LLaVA-Med是朝着正确方向迈出的一大步,但他们也认识到它存在幻觉和推理缺乏深度的问题,这在许多LMMs中都很普遍。未来的工作将致力于使事物更加可靠和高质量。

Leave a Comment

了解ControlVideo:一种用于文本驱动视频编辑的新型AI方法

基于文本的视频编辑旨在使用文本提示和现有的视频材料创建新的视频,无需任何手动劳动。这项技术有可能对包括社交媒体内容、营销和广告在内的各种行业产生重大影响。修改后的电影必须准确反映原始视频的内容,保持创建帧之间的时间连贯性,并与目标提示对齐,以在这个过程中获得成功。然而,同时满足所有这些要求可能会很具有挑战性。仅使用大量的文本-视频数据训练文本到视频模型需要大量的计算能力。 零样本和一样本基于文本的视频编辑方法使用了最近大规模文本到图像扩散模型和可编程图片编辑的发展。这些进展没有额外的视频数据,已经展示了对各种文本命令的影片修改的良好能力。然而,经验数据表明,尽管在与文本提示对齐的工作方面取得了巨大进展,但目前技术仍然不能恰当地和适当地处理输出,保持时间上的一致性。清华大学、中国人民大学、盛数和琶洲实验室的研究人员推出了ControlVideo,这是一种基于预训练的文本到图像扩散模型的先进方法,用于忠实可靠的基于文本的视频编辑。 从ControlNet中汲取灵感,ControlVideo通过包括Canny边缘图、HED边框和所有帧的深度图等可视化条件来放大源视频的方向。采用扩散模型预训练的ControlNet处理这些视觉情况。将这些情况与目前在基于文本的视频编辑方法中使用的文本和注意策略进行比较,值得注意的是,它们提供了更精确和适应性更强的视频控制方法。此外,为了提高保真度和时间上的一致性,同时避免过度拟合,扩散模型和ControlNet中的注意模块都经过了精心构建和微调。 更具体地说,他们将这两个模型中的初始空间自我注意力变换为关键帧注意力,将所有帧与所选帧对齐。扩散模型还包括时间注意力模块作为额外的分支,然后是零卷积层,以在微调之前保留输出。他们在相应网络中使用原始空间自我注意权重作为关键帧和时间注意力的初始化,因为观察到不同的注意机制模拟不同位置之间的关系,但始终模拟图像特征之间的关系。 图1展示了ControlVideo在各种控制下的主要结果,例如(a) Canny边缘图,(b) HED边框,(c)深度图和(d)姿势。当涉及替换人物并改变其质量、风格和背景时,ControlVideo可以生成准确可靠的视频。ControlVideo的用户可以通过从各种控制类型中选择,灵活地修改保真度和编辑能力之间的比例。对于视频编辑,许多控制器可以轻松集成。 为了指导未来关于一次调整的视频扩散模型骨干的研究,他们对ControlVideo的基本要素进行了全面的实证研究。该工作调查了自我注意力微调的关键和值设计、参数、初始化技术以及引入时间注意力的本地和全局位置。根据他们的发现,主UNet(除了中间块)可以通过选择一个关键帧作为关键和值、微调WO以及将时间注意力与自我注意力(本研究中的关键帧注意力)相结合来发挥最佳作用。 他们还仔细研究了每个组件的贡献以及总体影响。根据这项工作,他们收集了40个视频文本对进行研究,包括Davis数据集和其他来自互联网的数据集。在许多措施下,他们与基于帧稳定的扩散和SOTA基于文本的视频编辑技术进行了比较。特别是,他们采用SSIM分数衡量保真度,采用CLIP评估文本对齐和时间一致性。他们还进行了用户研究,将ControlVideo与所有基线进行比较。 许多研究结果表明,ControlVideo在保真度和时间一致性方面表现不亚于文本对齐,但明显优于所有这些基准线。他们的实证结果特别突出了ControlVideo创建具有极其逼真视觉质量的电影的吸引力以及在可靠地遵循书面说明的同时保持源材料的能力。例如,ControlVideo在化妆方面成功了,同时又能保留一个人独特的面部特征,这是其他技术都无法做到的。 此外,ControlVideo利用各种控制类型,包括从原始视频中提取不同数量的信息,可以实现视频保真度和可编辑性之间的可定制权衡(见图1)。例如,HED边界提供了原始视频的精确边界细节,适用于紧密控制,如面部视频编辑。姿势包括原始视频的运动数据,使用户在保留运动传输的同时更自由地修改主题和背景。此外,他们展示了如何混合多个控件以从各种控件类型的优势中获益。

Leave a Comment

一个新的人工智能研究介绍了“识别任何东西模型(RAM)”:一种强大的图像标记基础模型

在自然语言处理(NLP)任务中,大型语言模型(LLM)在大规模在线数据集上训练表现出色。通过扩大数据规模,分割任何模型(SAM)在计算机视觉(CV)中显示出了出色的零样本定位能力。 不幸的是,SAM 无法生成语义标签,这是与定位相当的基本任务。多标签图像识别是识别单个图像的多个标签的目标,也称为图像标记。由于图像包含各种标签,包括对象、场景、属性和活动,图像标记是一个重要且有用的计算机视觉问题。 以下是阻碍图像标记的两个主要因素: 高质量数据的广泛收集。目前仍缺乏一个能够半自动或自动注释各类大量照片的高效数据注释引擎,以及一个标准化和全面的标记系统。 建立起足够的开放词汇表和强大的模型,采用高效灵活的模型设计,利用大规模的弱监督数据。 识别任何模型(RAM)是一个强大的图像标记基础模型,由OPPO研究院、国际数字经济学院(IDEA)和AI2机器人的研究人员刚刚推出。在数据方面,RAM可以克服标签系统不足、数据集不足、数据引擎低效和架构限制等问题。 研究人员首先创建了标准的全球命名约定。他们使用学术数据集(分类、检测和分割)和商业标记工具(Google、Microsoft和Apple)来丰富他们的标记系统。通过将所有可用的公共标记与常见的基于文本的标记相结合,标记方法产生6,449个标签,共同解决了绝大部分用例。研究人员表示,可以使用开放集识别来识别其余的开放词汇标签。 自动注释大规模照片使用标签系统是一项具有挑战性的任务。图像标记的提出方法受到了该领域以前的工作的启发,该领域使用大规模的公共图像文本对来训练强大的视觉模型。为了将这些大量的图片文本数据用于标记,团队采用了自动文本语义解析来提取图像标签。通过这种方法,他们可以在不依赖手动注释的情况下,基于图像文本对获得大量的图片标签。 因为互联网来源的图像文本组合往往存在随机噪声,所以团队创建了数据标记引擎来提高注释准确性。为了解决缺少标签的问题,他们采用现有模型来产生补充分类。在处理错误标记区域时,他们确定图像中与不同标签相关的某些部分,然后使用区域聚类方法查找和消除同一类别内的异常值。此外,还删除做出不一致预测的标签,以获得更精确的注释。 RAM通过为标签搜索添加语义上下文,允许对新颖类别进行泛化。RAM的识别能力可以通过这种模型架构为任何视觉数据集提高。通过展示一个在嘈杂的、无注释的数据上训练的通用模型可以击败高度监督的模型,RAM引入了一种新的图像标记范式。RAM需要一个免费且公开可用的没有注释的数据集。RAM的最强大版本只需在8个A100 GPU上训练三天。 据团队表示,RAM仍有改进的空间。这包括运行多个数据引擎迭代、增加骨干参数以提高模型容量,以及扩展训练数据集超过1400万张照片,以更好地覆盖不同领域。

Leave a Comment

增强视频基础模型的任务特异性适应性:引入视频适配器作为概率框架,用于适应文本到视频模型

基于互联网规模数据训练的大型文本到视频模型展现出了从任意编写描述生成高保真电影的非凡能力。然而,微调预训练的巨型模型可能代价高昂,难以将这些模型适应于具有有限领域特定数据的应用,例如动画或机器人视频。Google DeepMind、加州大学伯克利分校、麻省理工学院和艾伯塔大学的研究人员探索了如何在不进行微调的情况下自定义大型预训练文本到视频模型以适应各种下游领域和任务,灵感来自于一个小型可修改组件(如提示、前缀微调)如何使大型语言模型能够执行新任务而不需要访问模型权重。为了解决这个问题,他们提出了Video Adapter,一种通过使用大型预训练视频扩散模型的得分函数作为先验概率来生成特定任务的微小视频模型的方法。实验表明,Video Adapter可以使用预训练模型的参数仅占1.25%,以包含广泛的知识并在特定任务的微小视频模型中保持高保真度。可以使用Video Adapter生成高质量的特定任务的电影,包括但不限于动画、自我中心建模以及模拟和真实世界机器人数据的建模。 研究人员在各种视频创作工作中测试了Video Adapter。在困难的Ego4D数据和机器人Bridge数据上,Video Adapter生成的视频比高质量的预训练大型视频模型具有更好的FVD和Inception Scores,同时使用的参数少达80倍。研究人员定性地证明了Video Adapter可以生成类别特定的视频,如科幻电影和动画电影。此外,研究的作者展示了Video Adapter如何通过建模真实和模拟机器人电影并允许个性化风格化来为弥合机器人的臭名昭着的模拟到实际差距铺平道路。 主要特点 为了实现高质量且多功能的视频合成而无需在预训练模型上进行梯度更新,Video Adapter在采样时将预训练文本到视频模型的分数与领域特定微小模型的分数(仅使用1%参数)组合。 使用Video Adapter可以轻松地将预训练视频模型适应于人类和机器人数据的电影。 在相同的TPU小时数下,Video Adapter获得的FVD、FID和Inception Scores高于预训练模型和特定任务模型。 Video Adapter的潜在用途范围从动漫制作到领域随机化,以弥合机器人中的模拟现实差距。 与从互联网数据预训练的巨型视频模型相反,Video Adapter需要训练具有数量级更少参数的微小领域特定文本到视频模型。Video Adapter通过在采样期间组成预训练和领域特定视频模型的分数来实现高质量和可适应的视频合成。 使用Video…

Leave a Comment

最佳 AI Shopify 应用程序(2023年)

如果你在经营一个 Shopify 的在线商店,要想保持领先可谓是十分困难的。在一个不断有最尖端的技术和以人工智能为驱动的商店功能被推出的时代,很难判断哪些部分能够为你的 Shopify 网站提供所需的优势。 好消息是,许多 Shopify 应用程序利用人工智能为你提供个性化支持、基于大数据的决策、机器学习模型、算法等等。 以下是一些值得检查的应用程序: Dialogue AI Automatic Personalization  Shopify 的 Dialogue AI Automatic Personalization 旨在提高平台用户的平均订单价值、平均会话持续时间和转化率。它借助人工智能分析客户的在线活动,分析客户的偏好。Dialogue AI 提供相关和互补的商品推荐,以提高订单的平均价值。它会自动生成高利润产品的横幅,以取悦客户并增加销量。你可以使用它制作“如何”视频,向客户展示你的商品如何解决他们的问题。你所要做的就是创建视频、上传内容,让工具把它们放在潜在客户可以快速找到的地方。Dialogue AI 的自动个性化与各种平台和应用程序兼容。 Suggestr…

Leave a Comment

ChatGPT也能设计机器人吗?探索大型语言模型与人工智能协作在机器人设计中的交叉点-社会影响及更多

在最近发表在《自然机器智能》杂志的一项研究中,荷兰科技大学和瑞士洛桑联邦理工学院的研究人员深入探讨了OpenAI的ChatGPT平台的能力。好奇心促使他们调查这种先进的语言模型是否可以扩展其范围,超越生成诗歌、论文和书籍,协助机器人的设计过程。该团队试图确定在此方式下与人工智能合作的优势和潜在风险。 TU Delft的助理教授Cosimo Della Santina,与来自EPFL的博士生Francesco Stella和Josie Hughes,与ChatGPT展开了对话,重点关注粮食供应的增强。他们共同的头脑风暴会议使他们构思出了番茄收获机器人的想法,这是一个真正有用的创造。 研究人员发现ChatGPT在概念阶段的贡献尤为宝贵,因为它扩展了他们的专业知识。Stella解释说,这种语言模型提供了哪种作物对自动化最具经济可行性的见解。ChatGPT与之交互为设计过程中的明智决策铺平了道路。 此外,在实施阶段,ChatGPT提供了有用的建议,引导研究人员使用硅胶或橡胶作为夹具,以防止番茄被压碎。AI模型还建议采用Dynamixel电机,这是驱动机器人的最佳解决方案。这些协作努力最终导致了一个能够有效收获番茄的机械臂。 虽然研究人员发现协作设计过程丰富而积极,但他们注意到了自己作为工程师角色的变化。他们开始花更多时间进行技术任务,而ChatGPT则承担了共同研究员的角色。该团队探讨了人类和大型语言模型(LLMs)之间不同程度的合作,ChatGPT是其中之一的例子。 在最极端的情况下,AI提供所有输入,人类仅仅是遵循其指导,LLM实际上扮演研究员和工程师的角色。相反,人类则承担管理角色,负责定义设计目标。然而,这种情况在当前的LLMs中尚不可行,其可取性仍然存在争议。 Della Santina提出的一个潜在问题是机器人领域的错误信息和偏见的风险。LLMs基于概率生成响应,如果没有验证或验证不当,可能会导致误导或不准确的信息。研究人员还承认与LLMs合作的重要问题,包括抄袭、可追溯性和知识产权。 通过这种合作开发的番茄收获机器人将成为Della Santina、Stella和Hughes进一步研究机器人领域的有价值工具。此外,他们打算探索AI模型在设计其机器人身体方面的自主性。该团队认为,未来的一个开放性问题在于确定LLMs如何在不妨碍创造性思维和创新的情况下协助机器人开发人员解决21世纪的挑战。 随着研究人员继续利用像ChatGPT这样的AI模型的力量,他们的发现揭示了协作设计过程所涉及的潜在利益和风险。LLMs增强人类专业知识和扩大知识范围的能力是不可否认的。然而,必须谨慎行事,以确保准确性、透明度和保护机器人领域的创造性思维。通过在人类智慧和AI协助之间取得平衡,机器人领域可以应对未来的挑战,同时最小化潜在的风险。

Leave a Comment

麻省理工学院的研究人员提出了一种新的多模式技术,将机器学习方法融合在一起,以更类似于人类的方式进行学习

人工智能在我们日常遇到的所有主要用例和应用中都是革命性的。其中一个领域围绕着大量的音频和视觉媒体。想想所有能够生成有趣视频、艺术性惊人的图像、复制名人声音或只需一键记录整个讲座的人工智能应用程序。所有这些模型都需要大量的数据进行训练。大多数成功的系统都依赖于带注释的数据集来自我教育。 最大的挑战是存储和注释此数据,并将其转换为模型可以摄入的可用数据点。说起来容易做起来难,公司需要帮助每年收集并创建金标准数据点。 现在,来自麻省理工学院、麻省理工-IBM沃森人工智能实验室、IBM研究和其他机构的研究人员已经开发出一种能够有效解决这些问题的开创性技术,即分析未标记的音频和视觉数据。这种模型具有很大的潜力和潜力,可以改善当前模型的训练方式。这种方法与许多模型共鸣,例如语音识别模型、转录和音频创建引擎以及对象检测。它结合了两种自我监督学习体系结构:对比学习和遮蔽数据建模。这种方法遵循一个基本思想:复制人类如何感知和理解世界,然后复制相同的行为。 正如麻省理工学院的博士后Yuan Gong所解释的那样,自我监督学习非常重要,因为如果你看看人类如何收集和学习数据,其中很大一部分是没有直接监督的。目标是在机器中实现相同的过程,使它们能够从未标记的数据中学习尽可能多的功能。这种训练成为可以利用和改进的强大基础,具体取决于用例的监督学习或强化学习。 这里使用的技术是对比音频 – 视觉遮蔽自编码器(CAV-MAE),它使用神经网络从音频和视觉数据中提取和映射有意义的潜在表示。这些模型可以在10秒YouTube剪辑的大型数据集上进行训练,利用音频和视频组件。研究人员声称,CAV-MAE比任何其他先前方法都要好得多,因为它明确强调了音频和视觉数据之间的关联,而其他方法则没有。 CAV-MAE方法包括两种方法:遮蔽数据建模和对比学习。遮蔽数据建模包括: 获取视频及其匹配的音频波形。 将音频转换为频谱图。 遮蔽75%的音频和视频数据。 然后,该模型通过联合编码器/解码器恢复缺失的数据。重建损失,即衡量重建预测和原始音频-视觉组合之间差异的损失,用于训练模型。这种方法的主要目的是将相似的表示映射到彼此靠近的位置。它通过关联音频和视频数据的相关部分来实现,例如连接口部的口型。 将基于CAV-MAE的模型与其他模型进行测试证明非常有启发性。测试是在音频视频检索和音频-视觉分类任务上进行的。结果表明,对比学习和遮蔽数据建模是互补的方法。 CAV-MAE在事件分类方面优于以前的技术,并保持与使用行业级计算资源训练的模型竞争力。此外,多模态数据显着提高了单模态表示的微调和音频事件分类任务的性能。 麻省理工学院的研究人员认为,CAV-MAE代表了自我监督音频-视觉学习进展的突破。他们设想,它的用例可以涵盖动作识别,包括运动、教育、娱乐、摩托车和公共安全,跨语言自动语音识别和音频-视频生成。虽然当前的方法侧重于音频-视觉数据,但研究人员的目标是将其扩展到其他模态,认识到人类感知涉及音频和视觉提示以外的多种感官。 很有意思看到这种方法随着时间的推移表现如何,并且有多少现有模型尝试纳入这种技术。 研究人员希望随着机器学习的进步,像CAV-MAE这样的技术将变得越来越有价值,使模型能够更好地理解和解释世界。

Leave a Comment

一项新的人工智能研究引入了一种新型增强提示框架用于文本生成

大型语言模型(LLMs)彻底改变了自然语言生成领域。传统的微调方法用于响应下游任务需要访问LLMs的参数,这限制了它们在强大的黑匣子LLMs(如ChatGPT)上的使用,这些LLMs仅提供API。因此,最近的研究重点关注提示技术,通过提供许多任务特定的指示和演示来指导生成结果,证明提示可以显著影响结果,因此需要仔细设计。 虽然提示原则上是一种灵活的方法,但它今天通常使用的方式有些严格。但是在语言学习中并非如此;人们可以通过接受和回应积极和消极的反馈来提高语言技能。  中国东北大学、微软亚洲研究院、微软Azure翻译和NiuTrans研究的一项新研究邀请LLMs重新考虑并学习如何发现其输出中的任何缺陷,以确定决策容量的演变方式。为了在生成之前促进错误识别,他们设计了一种名为“Deliberate then Generate(DTG)”的新提示模板,其中包括指示和可能的输出。  确定候选人是DTG设计的重要部分。使用第二个基准系统的数据是一个简单的选择,因为它的输出通常具有良好的质量,只需要进行小的调整即可有效使用。因此,它无法促进有效的决策。研究人员建议使用与源材料无关的文本,例如随机文本选择或空字符串。由于这种方法成功地触发了LLMs的决策能力,因此DTG可以轻松适应各种文本生产工作,只需要对提示进行轻微修改。从心理学的角度来看,这项工作受到了语言习得的典型案例的启发,该案例在发展语言能力时考虑了负面证据。 团队进行了大量实验,以显示所提出的DTG提示相对于传统提示可靠地增强了GPT3.5(text-DaVinci-003)和GPT4的模型性能。这在七个文本生成任务和20多个数据集中都成立。机器翻译、简化和常识创造只是一些文本生成任务,其中由DTG提示的GPT实现了各种数据集的最先进性能。建议的DTG提示确实允许在生成之前进行决策和错误避免,这一点通过广泛的消融研究和统计误差分析得到证明。 研究人员计划在未来的工作中利用任务特定的领域知识来进一步提高DTG提示的效果。

Leave a Comment