Facebook和Instagram的母公司Meta Platforms宣布了最新的人工智能模型I-JEPA,该模型承诺改变图像分析和完成。新开发的模型具有类似人类的推理能力,可以准确地填补图像中的缺失元素。凭借这种尖端技术,Meta旨在革新计算机视觉并在各种应用程序中解锁各种可能性。 了解更多:在我们即将举行的研讨会上,使用扩散模型解锁无限的生成式AI世界。加入我们,体验如未曾有过的非凡学习体验! 介绍I-JEPA:类人的AI模型 Meta Platforms激动人心地推出了其最先进的图像联合嵌入预测架构(I-JEPA)。与依赖附近像素来完成未完成图像的传统生成式AI模型不同,I-JEPA利用了对世界的全面背景知识。它创建了一个外部世界的内部模型,并比较图像的抽象表示。这使得它在计算机视觉任务中表现非常出色。 还阅读:使用生成式AI和Image Alpha解锁您的想象力 无与伦比的性能和效率 I-JEPA的一个显着特点是其惊人的性能和计算效率的结合。该模型的表示可以在不需要大量微调的情况下用于各种应用程序。例如,Meta使用仅16个A100 GPU,在不到72小时的时间内训练了一个632M参数的视觉变换器模型。令人惊讶的是,即使每类仅有12个标记的示例,该模型也在ImageNet上实现了低样本分类的最新性能。这样的效率使I-JEPA与现有的计算机视觉模型区别开来,后者消耗了更多的GPU时间,并产生了类似数据的劣质结果。 类人的推理提高准确性 Meta的AI模型采用了著名的AI科学家Yann LeCun提倡的类人推理方式,有助于提高AI生成的图像的准确性。通过融合背景知识和利用抽象表示,I-JEPA帮助消除AI生成图像中常见的错误。这一重大进展降低了与不准确性相关的风险,并确保了AI生成视觉内容的更高保真度。 还阅读:DragGAN:谷歌研究人员揭示了用于神奇图像编辑的AI技术 Meta对开源研究的承诺 Meta通过积极发布其内部研究实验室的开源项目,始终展示了其推进AI研究的承诺。该公司的CEO Mark Zuckerberg相信分享研究模型的力量,强调标准化推动创新,增强安全措施并降低成本。通过促进行业内的合作,Meta旨在引领AI发展,并利用其他组织取得的进展。 还阅读:使用Meta的MusicGen AI生成自己的音乐 解决安全问题和未来影响 虽然一些行业领袖对AI技术的潜在风险提出了担忧,但Meta的高管们选择了不同的方式。Meta致力于在AI系统中构建安全检查,而不是签署一份将AI风险与流行病和战争等同的声明。AI社区中的杰出人物、Meta的首席AI科学家Yann LeCun强调了消除“AI厌世主义”的重要性,并倡导在AI技术中集成安全措施。 还阅读:欧盟呼吁采取措施识别深度伪造和AI内容…
Leave a CommentCategory: 计算科学
当学校在辩论应该教授学生哪些有关强大的新人工智能工具的知识时,科技巨头、大学和非营利组织正在提供免费课程
Leave a Comment由于涉及的变量数量众多,一些源自组合问题的线性规划问题变得难以处理(Gilmore&Gomory,1961)在这种问题中,延迟…
Leave a Comment尽管在医学领域应用人工智能存在缺陷,但一些医生发现ChatGPT可以提高他们与患者建立共情沟通的能力
Leave a Comment宾夕法尼亚州立大学和北卡罗来纳大学的科学家们创建了一种手腕佩戴的传感器,以更不显眼的方式收集饮酒数据
Leave a Comment每当有人谈论人工智能时,脑海中首先浮现的是机器人、人形机器人或者可以像人类一样做事情的机器人,甚至比人类做得更好。我们都见过这些特定的微型机器人在各个领域中的应用,例如在机场指导人们到达某些出口,在军队中导航和处理困难情况,甚至作为跟踪器。 所有这些都是AI在更真实意义上的一些惊人的例子。与每个其他AI模型一样,这需要满足一些基本要求,例如选择算法的选择,用于训练的大量数据,微调,然后部署。 现在,这种类型的问题通常被称为视觉和语言导航问题。人工智能(AI)中的视觉和语言导航是指AI系统利用视觉和语言信息理解和导航世界的能力。它结合了计算机视觉、自然语言处理和机器学习技术,构建能够感知图形场景、理解文本指令和导航物理环境的智能系统。 许多模型,如CLIP、RecBERT和PREVALENT,都在解决这些问题,但所有这些模型都存在两个主要问题。 有限的数据和数据偏差:训练视觉和学习系统需要大量标记数据。但是,在某些领域中,获取这种数据可能是昂贵、耗时甚至不切实际的。此外,具有多样性和代表性数据的可用性对于避免系统的理解和决策的偏差至关重要。如果训练数据有偏差,可能会导致不公平或不准确的预测和行为。 泛化:AI系统需要很好地泛化到看不见或新的数据。它们应该记住训练数据并学习可以应用于新示例的基本概念和模式。当模型在训练数据上表现良好但无法推广到新数据时,就会出现过拟合。在涉及光照条件、视角和物体外观变化的复杂视觉任务中,实现强健的泛化是一个重要的挑战。 尽管已经有很多努力来帮助代理学习多样化的指令输入,但所有这些数据集都是基于Matterport3D中相同的3D房间环境构建的,该数据集仅包含60种不同的房间环境用于代理训练。 PanoGen是AI领域的突破性解决方案。现在,有了PanoGen,数据稀缺问题已得到解决,语料库的创建和数据多样化也得到了简化。 PanoGen是一种生成方法,可以根据文本创建无限多样化的全景图像(环境)。他们通过为Matterport3D数据集中的房间图像加上标题来收集房间描述,然后使用SoTA文本到图像模型生成全景视觉(环境)。然后,他们使用递归外部绘制技术在生成的图像上创建一致的360度全景视图。所开发的全景图片共享类似的语义信息,以文本描述为条件,这确保了全景中对象的共现遵循人类直觉,并通过图像外部绘制创造了足够的房间外观和布局多样性。 他们提到已经有一些尝试增加训练数据的多样性并改进语料库。所有这些尝试都是基于从HM3D(Habitat Matterport 3D)中混合场景,这再次带回了同样的问题,即所有设置或多或少是用Matterport3D制作的。 PanoGen解决了这个问题,因为它可以创建无限数量的训练数据,并具有所需的许多变化。 该论文还提到,使用PanoGen方法,他们击败了当前的SoTA,并在Room-to-Room、Room-for-Room和CVDN数据集上实现了新的SoTA。 来源:https://arxiv.org/abs/2305.19195 来源:https://arxiv.org/abs/2305.19195 综上所述,PanoGen是解决视觉和语言导航问题的关键挑战的突破性开发。通过能够生成许多变化的无限训练样本,PanoGen为AI系统理解和像人类一样导航真实世界开辟了新的可能性。该方法卓越的超越了SoTA,突显出其改革AI驱动的VLN任务的潜力。
Leave a Comment基于文本的视频编辑旨在使用文本提示和现有的视频材料创建新的视频,无需任何手动劳动。这项技术有可能对包括社交媒体内容、营销和广告在内的各种行业产生重大影响。修改后的电影必须准确反映原始视频的内容,保持创建帧之间的时间连贯性,并与目标提示对齐,以在这个过程中获得成功。然而,同时满足所有这些要求可能会很具有挑战性。仅使用大量的文本-视频数据训练文本到视频模型需要大量的计算能力。 零样本和一样本基于文本的视频编辑方法使用了最近大规模文本到图像扩散模型和可编程图片编辑的发展。这些进展没有额外的视频数据,已经展示了对各种文本命令的影片修改的良好能力。然而,经验数据表明,尽管在与文本提示对齐的工作方面取得了巨大进展,但目前技术仍然不能恰当地和适当地处理输出,保持时间上的一致性。清华大学、中国人民大学、盛数和琶洲实验室的研究人员推出了ControlVideo,这是一种基于预训练的文本到图像扩散模型的先进方法,用于忠实可靠的基于文本的视频编辑。 从ControlNet中汲取灵感,ControlVideo通过包括Canny边缘图、HED边框和所有帧的深度图等可视化条件来放大源视频的方向。采用扩散模型预训练的ControlNet处理这些视觉情况。将这些情况与目前在基于文本的视频编辑方法中使用的文本和注意策略进行比较,值得注意的是,它们提供了更精确和适应性更强的视频控制方法。此外,为了提高保真度和时间上的一致性,同时避免过度拟合,扩散模型和ControlNet中的注意模块都经过了精心构建和微调。 更具体地说,他们将这两个模型中的初始空间自我注意力变换为关键帧注意力,将所有帧与所选帧对齐。扩散模型还包括时间注意力模块作为额外的分支,然后是零卷积层,以在微调之前保留输出。他们在相应网络中使用原始空间自我注意权重作为关键帧和时间注意力的初始化,因为观察到不同的注意机制模拟不同位置之间的关系,但始终模拟图像特征之间的关系。 图1展示了ControlVideo在各种控制下的主要结果,例如(a) Canny边缘图,(b) HED边框,(c)深度图和(d)姿势。当涉及替换人物并改变其质量、风格和背景时,ControlVideo可以生成准确可靠的视频。ControlVideo的用户可以通过从各种控制类型中选择,灵活地修改保真度和编辑能力之间的比例。对于视频编辑,许多控制器可以轻松集成。 为了指导未来关于一次调整的视频扩散模型骨干的研究,他们对ControlVideo的基本要素进行了全面的实证研究。该工作调查了自我注意力微调的关键和值设计、参数、初始化技术以及引入时间注意力的本地和全局位置。根据他们的发现,主UNet(除了中间块)可以通过选择一个关键帧作为关键和值、微调WO以及将时间注意力与自我注意力(本研究中的关键帧注意力)相结合来发挥最佳作用。 他们还仔细研究了每个组件的贡献以及总体影响。根据这项工作,他们收集了40个视频文本对进行研究,包括Davis数据集和其他来自互联网的数据集。在许多措施下,他们与基于帧稳定的扩散和SOTA基于文本的视频编辑技术进行了比较。特别是,他们采用SSIM分数衡量保真度,采用CLIP评估文本对齐和时间一致性。他们还进行了用户研究,将ControlVideo与所有基线进行比较。 许多研究结果表明,ControlVideo在保真度和时间一致性方面表现不亚于文本对齐,但明显优于所有这些基准线。他们的实证结果特别突出了ControlVideo创建具有极其逼真视觉质量的电影的吸引力以及在可靠地遵循书面说明的同时保持源材料的能力。例如,ControlVideo在化妆方面成功了,同时又能保留一个人独特的面部特征,这是其他技术都无法做到的。 此外,ControlVideo利用各种控制类型,包括从原始视频中提取不同数量的信息,可以实现视频保真度和可编辑性之间的可定制权衡(见图1)。例如,HED边界提供了原始视频的精确边界细节,适用于紧密控制,如面部视频编辑。姿势包括原始视频的运动数据,使用户在保留运动传输的同时更自由地修改主题和背景。此外,他们展示了如何混合多个控件以从各种控件类型的优势中获益。
Leave a Comment在自然语言处理(NLP)任务中,大型语言模型(LLM)在大规模在线数据集上训练表现出色。通过扩大数据规模,分割任何模型(SAM)在计算机视觉(CV)中显示出了出色的零样本定位能力。 不幸的是,SAM 无法生成语义标签,这是与定位相当的基本任务。多标签图像识别是识别单个图像的多个标签的目标,也称为图像标记。由于图像包含各种标签,包括对象、场景、属性和活动,图像标记是一个重要且有用的计算机视觉问题。 以下是阻碍图像标记的两个主要因素: 高质量数据的广泛收集。目前仍缺乏一个能够半自动或自动注释各类大量照片的高效数据注释引擎,以及一个标准化和全面的标记系统。 建立起足够的开放词汇表和强大的模型,采用高效灵活的模型设计,利用大规模的弱监督数据。 识别任何模型(RAM)是一个强大的图像标记基础模型,由OPPO研究院、国际数字经济学院(IDEA)和AI2机器人的研究人员刚刚推出。在数据方面,RAM可以克服标签系统不足、数据集不足、数据引擎低效和架构限制等问题。 研究人员首先创建了标准的全球命名约定。他们使用学术数据集(分类、检测和分割)和商业标记工具(Google、Microsoft和Apple)来丰富他们的标记系统。通过将所有可用的公共标记与常见的基于文本的标记相结合,标记方法产生6,449个标签,共同解决了绝大部分用例。研究人员表示,可以使用开放集识别来识别其余的开放词汇标签。 自动注释大规模照片使用标签系统是一项具有挑战性的任务。图像标记的提出方法受到了该领域以前的工作的启发,该领域使用大规模的公共图像文本对来训练强大的视觉模型。为了将这些大量的图片文本数据用于标记,团队采用了自动文本语义解析来提取图像标签。通过这种方法,他们可以在不依赖手动注释的情况下,基于图像文本对获得大量的图片标签。 因为互联网来源的图像文本组合往往存在随机噪声,所以团队创建了数据标记引擎来提高注释准确性。为了解决缺少标签的问题,他们采用现有模型来产生补充分类。在处理错误标记区域时,他们确定图像中与不同标签相关的某些部分,然后使用区域聚类方法查找和消除同一类别内的异常值。此外,还删除做出不一致预测的标签,以获得更精确的注释。 RAM通过为标签搜索添加语义上下文,允许对新颖类别进行泛化。RAM的识别能力可以通过这种模型架构为任何视觉数据集提高。通过展示一个在嘈杂的、无注释的数据上训练的通用模型可以击败高度监督的模型,RAM引入了一种新的图像标记范式。RAM需要一个免费且公开可用的没有注释的数据集。RAM的最强大版本只需在8个A100 GPU上训练三天。 据团队表示,RAM仍有改进的空间。这包括运行多个数据引擎迭代、增加骨干参数以提高模型容量,以及扩展训练数据集超过1400万张照片,以更好地覆盖不同领域。
Leave a Comment在旧金山,Cruise和Waymo的无人驾驶车辆正在当地道路上接受“严格”的培训,引发了居民的安全担忧
Leave a Comment在疫情以来的首次现场主题演讲中,NVIDIA的创始人兼CEO黄仁勋今天在台北举行的COMPUTEX大会上宣布了一些平台,这些平台可以帮助公司乘风破浪,参与到一波历史性的生成式人工智能浪潮中,这个浪潮正在改变从广告到制造业再到电信等行业。 “我们回来了,”黄仁勋在他的家中厨房进行了几年的虚拟主题演讲之后在舞台上大声喊道。“我已经有将近四年没有公开演讲了–祝我好运!” 他向约3500名观众演讲了近两个小时,介绍了加速计算服务、软件和系统,这些都使新的商业模式成为可能,也让现有的商业模式更加高效。 “加速计算和人工智能标志着计算机的重新发明,”黄仁勋说道,他在过去一周在家乡的旅行每天都被当地媒体追踪报道。 为了展示它的强大,他使用了他所在的巨大的8K墙,展示了一个文本提示,生成了一首主题歌,可以随意地唱,就像任何卡拉OK歌曲一样。黄仁勋偶尔用他的家乡语言和观众开玩笑,并短暂地带领观众唱了这首新歌。 “现在我们处于一个新的计算时代的临界点,加速计算和人工智能已经被全球几乎所有的计算和云计算公司所接受,”他说道,指出现在有40,000家大型公司和15,000家初创公司使用NVIDIA技术,去年CUDA软件下载量达到2500万次。 主题演讲的重要新闻公告 Grace Hopper提供大内存超级计算机,用于生成式人工智能。 模块化参考架构可以创建100多个加速服务器变体。 WPP和NVIDIA在Omniverse中创建数字广告内容引擎。 SoftBank和NVIDIA在日本建立5G和生成式人工智能数据中心。 网络技术加速基于以太网的人工智能云。 NVIDIA ACE for Games利用生成式人工智能为角色赋予生命。 全球的电子制造商都在使用NVIDIA人工智能。 企业人工智能的新引擎 对于需要最佳人工智能性能的企业,他推出了DGX GH200,一个大内存人工智能超级计算机。它使用NVIDIA NVLink将多达256个NVIDIA GH200 Grace Hopper超级芯片组合成一个单一的数据中心大小的GPU。…
Leave a Comment准确地分割多个对象对于各种场景理解应用非常重要,例如图像/视频处理、机器人感知和AR/VR。最近发布了Segment Anything Model (SAM),这是一个广泛的图像分割基本视觉模型。它使用十亿级别的掩码标签进行训练。SAM可以使用一系列点、边界框或粗略掩码作为输入,在多个上下文中分割各种对象、组件和可视结构。它的零-shot分割能力引发了快速的范式变化,因为它们可以在许多应用程序中仅使用一些基本提示。 尽管其表现出色,但SAM的分割结果仍然需要改进。SAM存在两个重要问题:1)粗糙的掩码边缘,经常遗漏细小物体结构的分割,如图1所示。2)在困难情况下,错误的预测、损坏的掩码或显著的不准确性。这通常与SAM的误读细小结构有关,例如图中右上角的风筝线。基本分割方法(如SAM)的应用和效果受到这些错误的严重限制,特别是对于自动注释和图像/视频编辑作业,其中极其精确的图像掩码至关重要。 图1:比较了SAM和我们的HQ-SAM的预测掩码,使用了单个红色框或对象上的多个点的输入提示。具有极其精确边界的HQ-SAM生成明显更详细的结果。在最右边的一列中,SAM误读了风筝线的细小结构,并为输入框提示生成了大量的错误和破损孔。 来自苏黎世联邦理工学院和香港科技大学的研究人员建议HQ-SAM,它保持了原始SAM的强大零-shot能力和灵活性,同时能够预测非常准确的分割掩码,即使在极其困难的情况下(参见图1)。他们建议对SAM进行小的调整,添加少于0.5%的参数,以增加其高质量分割的能力,同时保持效率和零-shot性能。直接调整SAM解码器或添加新的解码器模块会对零-shot分割的一般布局造成严重的影响。因此,他们建议HQ-SAM设计完全保留零-shot效率,与并重用当前学习的SAM结构相集成。 除了原始提示和输出令牌外,他们还创建了一个可学习的HQ-Output Token,馈送到SAM的掩码解码器中。与原始输出令牌相比,他们的HQ-Output Token及其相关的MLP层被教授预测高质量的分割掩码。其次,他们的HQ-Output Token在改进的特征集上运行,以生成精确的掩码信息,而不仅仅是使用SAM的掩码解码器功能。他们将SAM的掩码解码器特征与其ViT编码器的早期和晚期特征图结合使用,以使用全局语义上下文和细粒度的本地特征。 在训练期间,完整的预训练SAM参数被冻结,只更新HQ-Output Token、相关的三层MLP和一个小型特征融合块。学习准确分割所需的是一个具有复杂几何形状的各种对象的精确掩码注释的数据集。使用11M张照片和类似于SAM的模型自动创建的1.1亿个掩码的SA-1B数据集来训练SAM。然而,图1中SAM的性能表明,使用这个大型数据集具有重大的经济后果。它无法产生研究所需的高质量掩码生成。 因此,他们创建了HQSeg-44K,一个新的数据集,包括44K个高精度细粒度图像掩码注释。他们将六个现有的图像数据集与非常精确的掩码注释结合起来,以创建HQSeg-44K,涵盖了1000多个不同的语义类别。由于数据集较小,以及他们简单的集成设计,HQ-SAM可以在8个RTX 3090 GPU上进行训练,时间不到4小时。他们进行了严格的定量和定性实验研究,以验证HQ-SAM的有效性。 他们在来自各种下游任务的九个不同分割数据集上将HQ-SAM与SAM进行了比较,其中有七个在零-shot转移协议下,包括COCO、UVO、LVIS、HQ-YTVIS、BIG、COIFT和HR-SOD。这一彻底的分析表明,与SAM相比,所提出的HQ-SAM可以制造出更高质量的掩模,同时仍具有零-shot能力。他们的GitHub页面上有一个虚拟演示。 通过引入对原始SAM的可忽略开销,他们提出了第一个高质量的零-shot分割模型。 查看论文和GitHub。不要忘记加入我们的23k+ ML SubReddit、Discord频道和电子邮件通讯,在这里我们分享最新的AI研究新闻、酷炫的AI项目等等。如果您对上述文章有任何问题或我们漏掉了任何东西,请随时发送电子邮件至Asif@marktechpost.com 查看AI工具俱乐部中的100个AI工具 这篇文章最初发表在MarkTechPost上。
Leave a Comment我很高兴地分享最近计算机视觉领域的进展,例如突破性的零样本目标检测器(如Grounding DINO)的出现,已经彻底改变了图像标注的过程
Leave a CommentRobotSweater 机器编织纺织品“皮肤”可以感应接触和压力,在机器与人类互动时使机器“更加智能化”
Leave a Comment