过去2-3年,使用人工智能(AI)从文本生成图像的研究质量和数量出现了惊人的增长。在这个领域里最具突破性和革命性的工作之一是指最先进的生成模型——扩散模型。这些模型通过利用深度学习算法的能力,完全改变了如何使用文本描述生成高质量图像的方法。此外,除了扩散模型,还存在一系列功能强大的其他技术,提供了一条生成接近照片般逼真的视觉内容的令人兴奋的路径。然而,这些最先进技术取得的杰出成果也有一定的局限性。许多新兴的生成AI技术依赖于扩散模型,这需要复杂的架构和大量的计算资源进行训练和图像生成。这些先进的方法还降低了推理速度,使它们在实时实现方面不切实际。此外,这些技术的复杂性直接与它们所实现的进步相关,这对公众掌握这些模型的内部工作方式构成了挑战,从而导致它们被视为黑匣子模型。 为了解决前面提到的问题,德国Technische Hochschule Ingolstadt和Wand Technologies的研究人员提出了一种新颖的文本条件图像生成技术。这种创新技术与扩散类似,但生成高质量图像的速度更快。这个基于卷积的模型的图像采样阶段可以仅使用12个步骤完成,同时仍能产生出色的图像质量。这种方法因其显著的简单性和降低的图像生成速度而脱颖而出,从而允许用户对模型进行条件设置,并享受现有最先进技术中缺乏的优势。所提出的技术的固有简单性已经显著提高了其可访问性,使来自不同背景的个人能够轻松掌握和实施这种文本到图像技术。为了通过实验评估验证他们的方法,研究人员还训练了一个名为“Paella”的文本条件模型,该模型具有惊人的10亿个参数。该团队还在MIT许可证下开源了其代码和模型权重,以鼓励围绕他们的工作进行研究。 扩散模型经历了一个学习过程,逐步从每个训练实例中消除不同程度的噪声。在推理过程中,当呈现出纯噪声时,模型通过逐步减少几百个步骤的噪声来生成图像。德国研究人员设计的技术在很大程度上借鉴了这些扩散模型的原理。像扩散模型一样,Paella从代表图像的标记中去除不同程度的噪声,并利用它们生成新图像。该模型在LAION-5B美学数据集的900 million个图像-文本对上进行了训练。Paella使用基于卷积神经网络的预训练编码器-解码器体系结构,能够使用来自预训练期间学习的8192个标记集的256个标记来表示256 x 256的图像。为了在训练阶段为其示例添加噪声,研究人员还在此列表中包括了一些随机选择的标记。 为了基于图像的文本描述生成文本嵌入,研究人员利用了CLIP(对比语言-图像预训练)模型,该模型建立了图像和文本描述之间的联系。然后,采用U-Net CNN体系结构来训练模型生成完整的原始标记,利用先前迭代中生成的文本嵌入和标记。这个迭代过程重复了12次,每次逐渐替换以前生成的标记的一小部分。在剩余生成的标记的指导下,U-Net逐步减少每个步骤的噪声。在推理过程中,CLIP基于给定的文本提示产生一个嵌入,U-Net为随机选择的256个标记的完整集合重构了所有标记12次。最后,解码器利用生成的标记生成图像。 为了评估他们的方法的有效性,研究人员采用了Fréchet inception距离(FID)指标来比较Paella模型和稳定扩散模型得到的结果。虽然结果略微偏向稳定扩散,但Paella在速度方面具有显著优势。这项研究突出了先前的努力,因为它专注于完全重新配置架构,这在以前并未考虑过。总之,与现有的模型相比,Paella可以使用更小的模型大小和更少的采样步骤生成高质量的图像,仍然可以实现可观的结果。研究团队强调了他们方法的易用性,该方法提供了一个简单的设置,可以被从不同背景中的个人轻松采用,包括非技术领域,因为随着时间的推移,生成AI领域越来越受到关注。
Leave a CommentCategory: 计算科学
加州大学伯克利分校的研究人员开发出了一种机器园丁,可以像人类一样种植植物,同时节约更多的水资源
Leave a Comment领先的军事技术公司Red Cat Holdings, Inc.在与Athena AI的合作中实现了一个里程碑。合作带来了人工智能(AI)和计算机视觉技术在Teal 2军用无人机上的显著进展。利用最先进的技术,Red Cat和Athena AI赋予指挥官在战场上前所未有的决策支持,特别是在夜间。这一突破性发展承诺彻底改革军用无人机操作,确保增强态势感知并为战士提供不公平的优势。 另请参阅:Palantir推出军事决策人工智能平台 第二阶段成功:夜间目标识别和战斗跟踪 Red Cat最初于三月宣布与Athena AI的合作,专门针对Teal 2军用无人机。在最近完成的第二阶段中,Athena AI的先进技术已成功处理了Teal 2热成像传感器记录的夜间测试飞行视频。结果是一个出色的目标识别和战斗跟踪能力。在人工智能的帮助下,指挥官们现在可以在战斗的白热化阶段迅速做出明智决策,从而在战场上获得显著的优势。 另请参阅:战场革命:英美澳通过AI无人机试验推动界限 Teal 2的夜间计算机视觉能力:划时代的改变 Red Cat子公司Teal Drones的创始人兼首席执行官George Matus对支持夜间计算机视觉能力的新Teal 2附加组件表示热情洋溢。此功能专为需要在夜间任务期间获取关键数据的用户设计。Matus赞扬Athena AI的技术为提供出色的图像和洞察力。…
Leave a Comment由Google量子AI团队的Trond Andersen和Yuri Lensky研究科学家发表 想象一下,你被展示了两个完全相同的物体,然后被要求闭上眼睛。当你睁开眼睛时,你看到了相同的两个物体在同一位置。如何确定它们是否被交换了?直觉和量子力学的法则认为:如果这些物体真的相同,那么就无法分辨。 虽然这听起来像是常识,但它只适用于我们熟悉的三维世界。研究人员预测,对于一种特殊类型的粒子,称为任意子,它只能在二维平面内移动,量子力学允许出现完全不同的现象。任意子彼此之间无法区分,其中一些非阿贝尔任意子具有一种特殊属性,使得在交换下共享量子状态出现可观测的差异,尽管它们在彼此之间是完全无法区分的。虽然研究人员已经成功地检测到了它们的亲戚——阿贝尔任意子,但由于控制和检测方面的挑战,实现“非阿贝尔交换行为”更加困难。 在发表于《自然》杂志上的“超导处理器中的非阿贝尔编织图顶点”一文中,我们首次报告了这种非阿贝尔交换行为的观测结果。非阿贝尔任意子可能为量子计算开辟一条新的道路,其中通过彼此交换粒子来实现量子操作,就像交换字符串来创建编织物一样。在我们的超导量子处理器上实现这种新的交换行为可能是一种替代路线,被称为拓扑量子计算,它具有抗环境噪声的优势。 交换统计和非阿贝尔任意子 为了理解这种奇怪的非阿贝尔行为是如何发生的,将两个字符串编织在一起的类比是有帮助的。取两根完全相同的字符串并将它们平行放置在一起。交换它们的末尾以形成双螺旋形状。这些字符串是相同的,但因为它们在末端交换时缠绕在一起,因此很清楚当两个末端被交换时。 非阿贝尔任意子的交换可以以类似的方式进行可视化,其中字符串是通过将粒子的位置延伸到时间维度中形成“世界线”。想象一下绘制两个粒子的位置与时间的图表。如果粒子保持不动,绘图只是表示它们不变的两条平行线。但是,如果我们交换粒子的位置,世界线就会缠绕在一起。第二次交换它们,你就做成了一个结。 虽然有点难以想象,但在四维空间中(三个空间加一维时间),结总是很容易被解开的。它们是平凡的,就像鞋带一样,只需拉一端就可以解开。但是,当粒子被限制在二维空间中时,结在总共三个维度上(如我们日常的三维生活所知)并不总是容易解开。非阿贝尔任意子世界线的编织可以用作量子计算操作,以转换粒子的状态。 非阿贝尔任意子的一个关键方面是“简并性”:几个分离的任意子的完整状态没有被局部信息完全指定,允许相同的任意子配置表示多个量子态的叠加。将非阿贝尔任意子缠绕在一起可以改变编码状态。 如何制造非阿贝尔任意子 那么,我们如何在Google的量子处理器上实现非阿贝尔编织?我们从熟悉的表面码开始,我们最近利用它实现了量子纠错的里程碑,在棋盘图案的顶点上排列了量子比特。棋盘的每个彩色正方形代表可以对正方形四个角上的量子比特进行的两种可能的联合测量值之一。这些所谓的“稳定器测量值”可以返回+1或-1的值。后者被称为平面违规,可以通过应用单量子比特X和Z门对角线移动——就像在国际象棋中的象一样——来创建和移动。最近,我们表明这些类似象的平面违规是阿贝尔任意子。与非阿贝尔任意子相比,阿贝尔任意子的状态在交换时只发生微小变化——如此微小,以至于不可能直接检测到。虽然阿贝尔任意子很有趣,但它们不具有非阿贝尔任意子的拓扑量子计算的承诺。 要产生非阿贝尔任意子,我们需要控制简并度(即,导致所有稳定子测量结果都为+1的波函数数)。由于稳定子测量返回两个可能的值,每个稳定子将系统的简并度减半,有足够多的稳定子后,只有一个波函数满足标准。因此,增加简并度的简单方法是将两个稳定子合并在一起。在此过程中,我们会移除稳定子网格中的一条边,从而产生两个仅有三条边相交的点。这些点被称为“三度顶点”(D3Vs),预测它们是非阿贝尔任意子。 为了编织D3Vs,我们必须移动它们,这意味着我们必须拉伸和挤压稳定子成新的形状。我们通过在任意子和它们的邻居之间实现双量子比特门来实现这一点(如下图中的中间和右侧面板所示)。 稳定子代码中的非阿贝尔任意子。a:编织两个任意子世界线的结。 b:单量子比特门可用于创建和移动稳定子(值为-1的红色正方形)。像国际象棋中的主教一样,它们只能对角线移动,在正则表面码的一个子晶格中受到限制。引入D3Vs(黄色三角形)时,这种限制被打破。 c:形成和移动D3Vs(预测为非阿贝尔任意子)的过程。我们从表面码开始,每个正方形对应于其角落上的四个量子比特的联合测量(左面板)。我们移除一个分隔相邻正方形的边,因此现在有所有六个量子比特的单个联合测量(中面板)。这样就创建了两个D3Vs,它们是非阿贝尔任意子。我们通过在相邻站点之间应用双量子比特门来移动D3Vs(右面板)。 现在,我们有了一种创建和移动非阿贝尔任意子的方法,我们需要验证它们的任意子行为。为此,我们检查了三个非阿贝尔任意子应具有的特征: “融合规则”——非阿贝尔任意子相互碰撞时会发生什么? 交换统计——它们相互编织时会发生什么? 拓扑量子计算基元——我们能否在非阿贝尔任意子中编码量子比特并使用编织来执行双量子比特纠缠操作? 非阿贝尔任意子的融合规则 我们通过研究一对D3Vs与上述引入的类似主教的棋盘格缺陷的相互作用来研究融合规则。特别地,我们创建一对任意子并将其中一个绕过D3V,方法是应用单量子比特门。 虽然国际象棋中的主教规则规定棋盘格缺陷永远不会相遇,但棋盘格的失调使它们可以打破这个规则,与它的合作伙伴相遇并与其相消。现在,棋盘格缺陷已经消失了!但将非阿贝尔任意子再次接触,任意子突然变形成缺少的棋盘格缺陷。尽管这种行为看起来很奇怪,但它确实是我们预期这些实体服从的融合规则的表现。这建立了D3Vs是非阿贝尔任意子的信心。…
Leave a Comment计算机视觉是人工智能领域中最受欢迎的领域之一。使用计算机视觉开发的模型能够从不同类型的媒体中提取有意义的信息,无论是数字图像、视频还是其他视觉输入。它教会了机器如何感知和理解视觉信息,然后根据细节采取行动。随着一种名为追踪任何点(TAPIR)的新模型的推出,计算机视觉取得了重大进步。TAPIR的目标是有效地跟踪视频序列中的特定兴趣点。 TAPIR模型由Google DeepMind、VGG、工程科学系和牛津大学的研究人员团队开发,其算法包括两个阶段——匹配阶段和精炼阶段。在匹配阶段,TAPIR模型单独分析每个视频序列帧,以寻找适合查询点的候选点匹配。这一步旨在确定查询点在每个帧中的最可能相关点,为了确保TAPIR模型能够跟踪查询点在视频中的运动,这个过程是逐帧进行的。 在确定候选点匹配的匹配阶段之后,TAPIR模型使用精炼阶段。在这个阶段中,TAPIR模型基于局部相关性更新轨迹(查询点所在路径)和查询特征,因此考虑到每个帧中的周围信息,以提高跟踪查询点的准确性和精度。通过集成局部相关性,精炼阶段提高了模型精确跟踪查询点的能力,并调整视频序列中的变化。 为了评估TAPIR模型,该团队使用了TAP-Vid基准测试数据集,它是用于视频跟踪任务的标准化评估数据集。结果显示,TAPIR模型的表现明显优于基线技术。使用称为平均Jaccard(AJ)的度量衡量的性能改进显示,TAPIR模型在DAVIS(密集注释视频分割)基准测试中的AJ相对于其他方法实现了约20%的绝对改进。 该模型旨在便于快速并行推理长视频序列,即它可以同时处理多个帧,提高跟踪任务的效率。该团队提到,该模型可以实时应用,使其能够处理和跟踪添加新视频帧的点。它可以在256×256视频上跟踪256个点,速度约为每秒40帧(fps),还可以扩展以处理更高分辨率的电影,使其具有处理各种大小和质量的视频的灵活性。 该团队为用户提供了两个在线Google Colab演示,以尝试TAPIR而无需安装。第一个Colab演示允许用户在自己的视频上运行模型,提供交互式体验以测试和观察模型的性能。第二个演示重点介绍如何在线运行TAPIR。此外,用户可以通过克隆提供的代码库,在现代GPU上跟踪自己的网络摄像头上的点并实时运行TAPIR。
Leave a Comment大型语言模型(LLMs)已经成为了人工智能领域的热门话题。它们近期的影响和惊人的表现已经帮助医疗保健、金融、娱乐等各个行业做出了很大的贡献。像 GPT-3.5、GPT 4、DALLE 2 和 BERT 这样的知名 LLMs,也被称为基础模型,可以执行非凡的任务,通过提供一个简短的自然语言提示,为我们生活带来了独一无二的内容。 最近的视觉基础模型(VFMs)如 SAM、X-Decoder 和 SEEM 在计算机视觉方面取得了许多进展。虽然 VFMs 在 2D 感知任务方面取得了巨大的进步,但 3D VFM 研究仍需要改进。研究人员建议扩展当前的 2D VFMs 用于 3D 感知任务。一个关键的…
Leave a Comment随着越来越多的混合工作者和新的办公需求,像扎哈·哈迪德建筑事务所这样的公司正在寻求人工智能解决方案
Leave a Comment来自Google DeepMind的科学家们使用了一项名为Barkour的犬式敏捷度测试课程来评估四足机器人的敏捷性
Leave a Comment在本文中,我们将学习有关FLOPs和MACs的定义、区别以及如何使用Python包计算它们
Leave a Comment人类通过观察世界学习了大量的背景信息。自去年以来,Meta团队一直在开发能够学习世界运作内部模型的计算机,使它们能够更快地学习,规划如何完成具有挑战性的工作,并快速适应新颖的条件。为了使系统有效,这些表征必须直接从未标记的输入(如图像或声音)中学习,而不是手动组装标记数据集。这个学习过程被称为自我监督学习。 生成式架构通过遮盖或删除用于训练模型的数据的部分来进行训练。这可以用图像或文本来完成。然后,它们会猜测缺少或失真的像素或单词。然而,生成式方法的一个主要缺点是,模型试图填补任何知识上的空白,尽管真实世界存在的不确定性。 Meta的研究人员刚刚推出了他们的第一个人工智能模型。通过比较图像的抽象表征(而不是比较像素本身),他们的图像联合嵌入预测架构(I-JEPA)可以学习和改进。 根据研究人员的说法,JEPA将摆脱固定性预训练所困扰的偏见和问题,因为它不涉及将图像的多个视图/增强的表征折叠成单个点。 I-JEPA的目标是使用更接近个体思维方式的表征来填补知识空白。所提出的多块遮罩方法是另一个重要的设计选项,它有助于将I-JEPA引向开发语义表征。 I-JEPA的预测器可以被认为是一个有限的、原始的世界模型,它可以基于有限的上下文信息描述静止图像中的空间不确定性。此外,这个世界模型的语义性质使得它能够推断出以前未知的图像部分,而不仅仅依赖于像素级别的信息。 为了查看模型在被要求预测蓝框内的输出时的结果,研究人员训练了一个随机解码器,将I-JEPA预测的表征转换回像素空间。这种定性分析证明了模型可以学习视觉对象的全局表征,而不会失去这些对象在框架中的位置。 使用I-JEPA进行预训练需要很少的计算资源。它不需要额外的复杂数据增强来提供不同的视角。研究结果表明,I-JEPA可以学习稳健的、预先构建的语义表征,而不需要自定义视角增强。在ImageNet-1K上进行的线性探测和半监督评估也超过了像素和令牌重构技术。 与其他语义任务的预训练方法相比,尽管依赖于手动制作的数据增强,I-JEPA仍然表现出色。I-JEPA在对象计数和深度预测等基本视觉任务上胜过这些方法。由于使用了更少复杂的模型和更灵活的归纳偏差,I-JEPA适用于更多的情况。 团队认为,JEPA模型在视频解释等领域的创造性应用前景非常广阔。使用和扩展这样的自我监督方法来开发广泛的世界模型是一个重大进步。
Leave a Comment一年前,利用人工智能生成逼真的图像还只是一个梦想。我们对看到的生成人脸的相似度感到印象深刻,尽管大多数输出结果有三只眼睛,两个鼻子等等。然而,随着扩散模型的发布,事情迅速发生了变化。现在,很难区分由人工智能生成的图像和真实的图像。 生成高质量图像的能力只是方程式的一部分。如果我们能够适当地利用它们,高效压缩它们在内容生成、数据存储、传输和带宽优化等任务中扮演着至关重要的角色。然而,图像压缩主要依赖于传统的方法,如变换编码和量化技术,对生成模型的探索有限。 尽管扩散模型和基于分数的生成模型在图像生成方面取得了成功,但它们尚未成为图像压缩的主流方法,落后于基于GAN的方法。它们在高分辨率图像上表现得更差或与HiFiC等基于GAN的方法相当。即使试图将文本到图像模型重新用于图像压缩,也产生了令人不满意的结果,产生了偏离原始输入或包含不良工件的重建。 基于分数的生成模型在图像生成任务中的表现与它们在图像压缩方面的有限成功之间的差距引发了有趣的问题,促使进一步的研究。令人惊讶的是,能够生成高质量图像的模型尚未能够在图像压缩的特定任务中超越GAN。这种差异表明,在将基于分数的生成模型应用于压缩任务时可能存在独特的挑战和考虑因素,需要专门的方法来发挥它们的全部潜力。 因此,我们知道基于分数的生成模型在图像压缩方面有潜力。问题是,如何做到呢?让我们来看看答案。 谷歌研究人员提出了一种方法,将一个标准的自编码器,针对均方误差(MSE)进行了优化,与扩散过程相结合,以恢复并添加自编码器丢弃的细节。编码图像的比特率完全由自编码器确定,因为扩散过程不需要额外的比特。通过专门为图像压缩调整扩散模型,显示出它们可以在图像质量方面优于几种最新的生成方法。 所提出的方法可以较好地保留细节,相较于现有的方法。来源:https://arxiv.org/pdf/2305.18231.pdf 该方法探索了两种密切相关的方法:扩散模型表现出了令人印象深刻的性能,但需要大量采样步骤,而修正流在允许更少的采样步骤时表现更好。 这种两步方法首先使用MSE优化的自编码器对输入图像进行编码,然后应用扩散过程或修正流来增强重建的逼真度。扩散模型采用与文本到图像模型相反的噪声计划,优先考虑细节而不是全局结构。另一方面,修正流模型利用自编码器提供的配对将自编码器输出直接映射到未压缩的图像。 所提出的HFD模型概述。来源:https://arxiv.org/pdf/2305.18231.pdf 此外,该研究揭示了对未来研究有用的具体细节。例如,它表明噪声计划和图像生成过程中注入的噪声量显着影响结果。有趣的是,尽管文本到图像模型在高分辨率图像上训练时受益于增加噪声水平,但发现减少扩散过程的总体噪声对于压缩是有利的。这种调整使模型更专注于细节,因为自编码器重建已经足够捕捉了粗略的细节。
Leave a Comment现在,您可能正在加快步伐迎接飞行汽车成为现实的日子,但您也会想象成为自动驾驶汽车的乘客。人工智能(以及特斯拉和Waymo)将这个快速而迷人的概念转化为现实。然而,AI在汽车行业中的潜力并不仅局限于自动驾驶汽车。它涉及许多功能,解锁所有人的舒适度:汽车制造商、驾驶员和乘客。我们将深入探讨这是如何发挥作用的。 汽车行业中的AI是什么? 汽车工业中的AI意味着在汽车世界的多个领域中实施人工智能技术。各种AI技术,如机器学习(ML)、自然语言处理(NLP)和计算机视觉,有助于将人工智能集成到汽车工业中,旨在实现更好的驾驶体验。在AI汽车世界中,这些技术自动化许多任务,如路线规划、导航、停车等,同时提高效率和安全性。 为什么我们需要汽车行业中的AI? 从设计和制造到生产和售后,将AI集成到汽车工业中已经开始了,而且有许多原因可以成为某些异常舒适、安全和快速的开端。请继续阅读以下人工智能在汽车工业中的一些关键优势: 提高安全性 在汽车中使用AI启用先进的驾驶员辅助系统(ADAS),改善道路安全性前景光明。AI算法可以分析传感器数据以实时识别潜在危险,从而降低事故风险。自动紧急制动和车道保持辅助是AI汽车环境中的功能,可实现即时监测和更安全的驾驶体验。 自动驾驶 自动驾驶汽车是AI的产物,自动驾驶汽车已经引起足够的关注。这些汽车使用AI技术的集成来帮助理解周围环境,实现快速决策,并在没有人类干预的情况下驾驶。称之为现象或革命,AI在自动驾驶汽车中表明了更少的人为错误、更有条理的交通流和无法驾驶的人士的可访问性。特斯拉Model 3、沃尔沃XC40、宝马iX和雷克萨斯LS是最近和高科技的自动驾驶汽车。 提高效率 汽车行业中的AI可以最小化交通拥堵并优化燃油效率。无人驾驶车辆可以帮助燃料经济性下降10%。人工智能算法分析道路条件和交通模式以建议最佳车辆路线,降低燃油消耗和排放。此外,AI驱动的智能交通管理系统可以控制流量以管理拥堵。 另请阅读:zPod,印度的第一辆AI驱动的自动驾驶汽车 自动驾驶汽车中的AI应用 在汽车工业中使用各种人工智能技术为汽车带来了巨大的可能性。以下是AI汽车技术的应用,为汽车行业的未来驾驶带来了轻松: 高级驾驶员辅助系统(ADAS) AI是各种ADAS功能的动力源,包括车道保持辅助、自动紧急制动、自适应巡航控制和泊车辅助。这些系统利用AI算法和传感器来监视车辆周围环境,识别潜在危险,并协助驾驶员轻松实现无碰撞驾驶、泊车等。 自动驾驶和自动驾驶汽车 AI已经因为为世界引入自动驾驶汽车而受到欢迎。该技术引入了机器学习算法、计算机视觉和传感器融合技术,以了解车辆周围环境、实时决策并管理整个驾驶范围内的汽车。自动驾驶车辆正在加速重新定义交通运输、增强道路安全、减少事故并改善交通流。 传感器融合和感知系统 传感器融合收集来自摄像头、雷达、激光雷达和超声波传感器等传感器的数据,以创建对车辆周围环境的集体理解。AI算法处理传感器数据并将其集成以检测对象并预测行为,从而帮助实时做出明智决策。这些系统激活高级驾驶员辅助功能,包括自适应巡航控制和行人检测,从而实现高效的驾驶体验。 路径规划与导航 路径规划和导航是汽车工业中人工智能的重要方面。它包括了感知、定位和避碰等组件,以指导优化路线。 车辆安全与预测性维护的人工智能 风险评估和决策是预测性分析在每个行业中的强大成果,而在增强驾驶员安全方面,汽车行业也不遗余力地利用这种人工智能技术。…
Leave a Comment来自世界两个超级大国的科学家们对人工智能的风险感到担忧——这可能为制定全球规范提供了一个桥梁
Leave a Comment当野火肆虐加利福尼亚州,把天空变成橙色,并留下毁灭性的后果时,一家开创性的初创公司挺身而出,与野火抗争。总部位于硅谷的计算机视觉领导者Chooch,结合了人工智能(AI)和计算机视觉的力量,彻底改变了野火检测方式。通过利用其创新技术,Chooch成功地向消防员提供了实时警报,使消防员能够更快地做出反应,防止进一步的损失。在本文中,我们将探讨Chooch的AI驱动解决方案如何改变野火检测并拯救生命。 个人使命:对抗野火 当加利福尼亚遭受灾难性的2020年野火时,Chooch的CEO Emrah Gultekin感到了个人的呼唤去帮助。与消防官员合作,他们发现现有的野火检测系统存在许多错误的阳性,这些阳性是由雾、雨和镜头污迹等因素引起的。Chooch决心要做出改变,便开始了一个试点项目,将其火灾检测软件与摄像头网络集成,利用AI和计算机视觉的力量。 生成式AI的力量:减少假阳性 Chooch的CTO Hakan Gultekin及其团队设计了一种解决方案来对抗假阳性。他们开发了一种生成式AI工具,可以自动为每个图像创建描述,帮助审查员准确识别烟雾的存在。结果,假阳性数量大大减少,从每周惊人的2000个减少到只有8个。这项突破性技术引起了消防队长的兴趣,他们迫不及待地希望将其集成到他们的监测中心中。 实时警报:赋予加利福尼亚州Kern县的消防员权力 Chooch的生成式AI工具为加利福尼亚州Kern县的消防队员提供了一个实时仪表板,可以通过智能手机和PC访问。这个仪表板提供即时警报,使消防员能够迅速检测出野火。考虑到加利福尼亚在2020年发生了9900起野火,烧毁了430万英亩,并造成了190亿美元的损失,即使及时检测出一场火灾,这个野火检测系统的成本也可以为未来的50年所证明。 充满希望的未来:扩展AI应用 Emrah Gultekin展望AI和计算机视觉的更加强大和准确的未来。通过将大型语言模型与计算机视觉相结合,Chooch旨在开发有效且易于部署的产品。例如,公用事业公司可以利用软件与无人机和固定摄像头连接,实现对电容器腐蚀或植被侵占电线的检测。Chooch的技术将通过参加1100万美元的Xprize挑战赛来获得进一步的验证,该挑战赛专注于野火检测和响应,有PG&E和洛克希德·马丁等知名赞助商。 成功之路:合作与尖端技术 Chooch开创野火检测革命的旅程始于他们加入了NVIDIA Inception,这是一个旨在培育尖端初创企业的计划。与NVIDIA合作,Chooch成功将其代码移植到NVIDIA GPU上,使其产品能够在NVIDIA Jetson模块上运行。该技术经过了广泛的测试,包括全运动视频和多光谱数据,展示了其在实际场景中的强大性和有效性。 我们的看法 Chooch将AI和计算机视觉技术融合,成为野火检测领域的变革者。这种创新解决方案显著减少了假阳性,提供了实时警报,并赋予了消防员权力。因此,它有潜力拯救生命,保护宝贵的资源并减轻野火的破坏性影响。随着Chooch不断完善其技术并扩展其应用,未来充满希望。我们尚未看到AI在对抗野火和其他我们作为社会所面临的重要挑战中的全部潜力。
Leave a Comment稀疏特征跟踪或密集光流一直是运动估计算法中使用的两种主要方法。这两种方法在各自的应用中都取得了成功。然而,这两种方法都不能完全捕捉视频的运动情况:稀疏跟踪不能描述所有像素的运动。相反,成对光流不能捕捉跨越大时序帧的运动轨迹。为了缩小这种差距,许多方法已被用于预测视频中的密集和长程像素轨迹。这些方法从简单的两帧光流场链接技术到直接预测经过多个帧的每个像素轨迹的更高级算法。 然而,所有这些方法在计算速度时都忽略了当前时间或地理上下文的信息。这种本地化可能会导致运动估计在时空上存在不一致性,并在扩展轨迹上积累错误。即使以前的技术考虑了长程上下文,它们也是在2D域中这样做的,这导致了在遮挡情况下的跟踪丢失。创建密集和长程轨迹仍然存在一些问题,包括跟踪遮挡点,保持空间和时间的一致性以及在长时间内保持准确的跟踪。在这项研究中,康奈尔大学、谷歌研究和加州大学伯克利分校的研究人员提供了一种全面的方法,通过使用所有可用的视频数据,为电影中的每个像素估计全长运动轨迹。 他们的方法称为OmniMotion,使用准3D表示,其中一组本地-规范双射将规范3D体积映射到每个帧的本地体积。这些双射将相机和场景运动的组合描述为动态多视角几何的灵活松弛。它们可以监视所有像素,即使是被遮挡的像素,其表示确保周期一致性(“Everything, Everywhere”)。为了联合解决整个视频的运动,“All at Once”,他们为每个视频优化了他们的表示。优化后,电影中的任何连续坐标都可以查询其表示以获得跨越整个物体的运动轨迹。 总之,他们提供了一种可以处理任何相机和场景运动组合的野外电影的方法: 为整个视频中的所有点生成全局一致的全长运动轨迹。 可以跟踪穿过遮挡的点。 可以跟踪穿过遮挡的点。 他们在TAP视频跟踪基准测试中统计说明了这些优势,其中他们获得了最先进的性能,并大大超过了所有以前的技术。他们在其网站上发布了几个演示视频,并计划很快发布代码。 https://omnimotion.github.io/ 从上面的运动路线可以看出,他们提供了一种新颖的技术,用于计算电影中每个帧中每个像素的全长运动轨迹。尽管我们的技术计算了所有像素的运动,但他们仅显示前景对象的稀疏轨迹以保持清晰度。他们的方法即使对于快速移动的物体也能产生精确、连贯的长程运动,并可靠地跨越遮挡,例如狗和秋千的示例。移动物品在第二行中的不同时间点显示,以提供上下文。
Leave a CommentMarcos Seefelder,软件工程师,以及 Daniel Duckworth,Google Research 的研究软件工程师 在选择场所时,我们经常遇到以下问题:这家餐厅是否适合约会的氛围?是否有好的户外座位?是否有足够的屏幕观看比赛?尽管照片和视频可能部分回答这些问题,但在无法亲自访问的情况下,它们无法取代感觉好像你在那里的体验。 交互式、照片逼真、多维度的沉浸式体验有望弥合这种差距,并重新创造空间的感觉和氛围,使用户能够自然和直观地找到他们需要的信息。为了帮助实现这一目标,Google 地图推出了 Immersive View,它使用机器学习(ML)和计算机视觉的先进技术,将数十亿个街景和航拍图像融合在一起,创建了一个丰富的数字模型。除此之外,它还在上面添加了有用的信息,例如天气、交通和场所的繁忙程度。Immersive View 提供了餐厅、咖啡馆和其他场所的室内视图,让用户可以虚拟地近距离观看,从而帮助他们自信地决定去哪里。 今天我们将描述 Immersive View 中提供这些室内视图的工作。我们基于神经放射场(NeRF),这是一种最先进的方法,用于融合照片以在神经网络中产生逼真的多维重建。我们描述了我们的 NeRF 创作流程,其中包括使用 DSLR 相机对空间进行自定义照片拍摄、图像处理和场景再现。我们利用 Alphabet 在这一领域最近的进展,设计了一种方法,其视觉保真度与之前的最新技术相匹配甚至超越。然后,这些模型被嵌入交互式的 360° 视频中,沿着策划的飞行路径,使它们可以在智能手机上使用。…
Leave a Comment科学家们创建了一种无线嗅觉反馈系统,通过微型气味生成器(OGs)将气味融入虚拟和增强现实中
Leave a Comment