Press "Enter" to skip to content

分割任何东西,但更快!这种人工智能方法加速了SAM模型

分割任何东西,但更快!这种人工智能方法加速了SAM模型 四海 第1张分割任何东西,但更快!这种人工智能方法加速了SAM模型 四海 第2张

在计算机视觉中,寻找图像中的对象一直是一个长期存在的任务。目标检测算法尝试通过在对象周围绘制一个框来定位对象,而分割算法则试图以像素级精确确定对象的边界。图像分割旨在根据语义含义或视觉特征将图像分割成不同的区域或对象。它在各种应用中至关重要,包括对象识别、场景理解、自动驾驶、医学成像等。

多年来,已经开发了许多方法和算法来解决这个具有挑战性的问题。传统方法使用手工设计的特征,而最近的进展则带来了以深度学习模型驱动的模型。这些现代方法已经取得了显著的进展,实现了最先进的性能,并在图像理解和分析方面开启了新的可能性。

然而,这些模型存在根本的局限性。它们受限于训练集中看到的对象,并且无法分割剩余的对象。

然后出现了完全改变图像分割游戏的Segment Anything Model (SAM)。它是一个开创性的视觉模型,能够根据用户交互提示在图像中分割任何对象。它基于在广泛的SA-1B数据集上训练的Transformer架构构建,表现出了显著的性能,并开启了一个被称为Segment Anything的新颖有趣的任务。凭借其普适性和潜力,它有望成为未来视觉应用的基石。

然而,SAM并非完美无缺。这种力量是有代价的,对于SAM来说,代价就是复杂性。它计算上过于耗费资源,这使得在实际场景中应用它变得具有挑战性。与SAM架构的核心部分——Vision Transformers (ViTs)有关的计算资源要求是与Transformer模型相关的计算资源要求。

有没有办法让SAM更快?答案是肯定的,它被称为FastSAM。

FastSAM是为了满足SAM模型在工业应用中的高需求而提出的。它成功地提高了SAM的执行速度,并使其能够应用于实际场景。

分割任何东西,但更快!这种人工智能方法加速了SAM模型 四海 第3张
FastSAM大大加速了SAM的速度。来源:https://arxiv.org/pdf/2306.12156.pdf

FastSAM将segment anything任务分解为两个顺序阶段:全实例分割和提示引导选择。第一阶段使用基于卷积神经网络(CNN)的检测器为图像中的所有实例生成分割掩模。在第二阶段,它输出与用户提示相对应的感兴趣区域。利用CNN的计算效率,FastSAM展示了实时segment anything模型的可实现性,而不会牺牲性能质量。

分割任何东西,但更快!这种人工智能方法加速了SAM模型 四海 第4张
FastSAM概览。来源:https://arxiv.org/pdf/2306.12156.pdf

FastSAM基于YOLOv8-seg,这是一个配备了受YOLACT方法启发的实例分割分支的目标检测器。通过将这个CNN检测器训练在仅占SA-1B数据集2%的数据上,FastSAM在大大降低计算需求的同时,实现了与SAM相当的性能。该方法在多个下游分割任务中证明了其有效性,包括在MS COCO上的对象提议,其中FastSAM在提议数量为1000个时的平均召回上超过了SAM,并在单个NVIDIA RTX 3090上运行速度快了50倍。

Leave a Reply

Your email address will not be published. Required fields are marked *