

包括绘画、产品设计和动画在内的行业正在受到3D图像合成及相关技术的显著影响。虽然诸如神经辐射场(NeRF)之类的新型3D图像合成方法使得能够大规模生成3D内容成为可能,但由于这些方法使得对物体的形态和颜色进行精确和局部修改变得困难,因此这些方法难以被广泛采用。尽管最近进行了几次3D物体编辑的尝试,但对3D物体进行更局部和精细的操作仍然需要改进和降低成本。这在特定风格的特定物品的添加或删除方面尤为如此。虽然Text2Mesh和TANGO只允许对整个3D物体进行基本纹理和浅层形状的改变,但早期的尝试,如EditNeRF和NeRFEditing,只提供了受限制的、不灵活的编辑可能性。
虽然CLIP-NeRF提出了一种具有解耦条件NeRF的生成技术来进行对象编辑,但只在本地编辑对象的所需部分是具有挑战性的。它需要大量的训练数据来进行预期的编辑类别。它们还提供了一种不同的方法来修改物品的外观,但不是形态:对每个场景进行单个NeRF的微调,以实现以CLIP为驱动的目标。为了通过任何文本提示在规模上实现对3D物体的有效和实际的局部编辑,需要对物体的特定区域进行风格修改,例如选择性地改变颜色,局部添加和删除密度,如图1所示。
在这篇论文中,LG电子和首尔国立大学的作者提出了一种先进的局部对象编辑技术,它可以使用文本提示来修改3D物体,提供完整的风格化和基于密度的局部编辑。他们认为,为了完全风格化形状和颜色,仅依赖于一个单一NeRF的简单微调来生成接近低初始密度附近的新密度或通过CLIP驱动目标来修改现有密度是不够的。相反,他们采用了一种方法,将原始的3D物体表示与参数化的隐式3D体积表示子集相结合,然后使用经过训练的可编辑的NeRF架构来自然地生成混合图像。他们使用类似CLIPSeg的预训练视觉语言方法来检测文本输入过程中需要修改的区域。所提出的方法基于一种称为Blending-NeRF的新颖分层NeRF架构,它包括预训练的NeRF和可编辑的NeRF。
在某些情况下,可以使用多个NeRF同时训练来重建一个动态场景的静态和动态元素。然而,他们的方法添加了一个额外的NeRF,以便在预训练的静态场景的特定区域进行基于文本的更改。这些更改包括多个编辑过程,包括颜色调整、密度增加和密度减少。它们可以通过结合两个NeRF的密度和颜色,对3D物体进行精细的局部化修改。
他们提供了创新的Blending-NeRF架构,通过使用多种目标和训练方法将预训练的NeRF与可编辑的NeRF混合起来。
这是他们的贡献概述:
• 使用这种方法,可以直观地修改一些3D物体,同时保持其原始外观。
• 他们添加了新的混合技术,用于衡量密度增加、密度减少和颜色修改的程度。他们的方法使得可以精确地定位特定区域进行局部编辑,并由于这些混合过程限制了对象修改的范围。
• 他们进行了多个测试,涉及文本引导的3D物体编辑,例如修改形状和颜色。他们将自己的方法与早期方法及其直接扩展进行了比较,证明了混合-NeRF在质量和数量上都更优秀。