

商业混合现实平台的发展和3D图形技术的快速进步使得高质量的3D场景的创建成为计算机视觉中的主要挑战之一。这需要将任何输入的文本、RGB和RGBD图片转换为各种逼真且多样的3D场景的能力。尽管已经尝试使用体素、点云和隐性神经表示等扩散模型直接构建3D对象和场景,但由于基于3D扫描的训练数据的限制,结果显示出有限的多样性和质量。使用预先训练的图像生成扩散模型(例如稳定扩散)生成各种优秀的3D场景是解决问题的一种方法。这样一个庞大的模型通过从大规模训练集中获得的数据驱动知识生成可信的图像,但无法确保生成的图像之间的多视点一致性。
首尔大学的研究团队在本文中提出了一种名为LucidDreamer的流水线,它使用3D高斯喷洒和稳定扩散从多种输入(包括文本、RGB和RGBD)生成各种高质量的3D场景。通过交替重复进行Dreaming和Alignment两个步骤,使用LucidDreamer流水线创建一个单一的大点云。在开始这两个过程之前,原始图像和匹配的深度图创建了一个初始点云。创建几何一致的图像并将其投影到三维空间中是梦境体验的两个方面。在将可见点云区域在新的相机坐标系上投影到新的相机平面之前,研究团队沿着预定义的相机轨迹移动相机。随后,投影的图像被送入基于稳定扩散的修补网络,该网络利用图像创建整个概念。通过将修补的图像和预测的深度图提升到3D空间中,创建了一组新的3D点。然后,通过轻微移动新点在3D空间中的位置,建议的对齐技术将其平滑地与当前点云连接起来。研究团队使用通过重复执行上述过程得到的大型点云作为初始SfM点来优化高斯喷洒。
与先前的表示相比,3D高斯喷洒的连续表示消除了点云中深度差异导致的间隙,使我们能够显示出更逼真的3D场景。图1展示了使用简单的LucidDreamer技术生成的3D生成结果。与当前模型相比,LucidDreamer显示出显著更逼真和令人震撼的结果。在研究团队比较基于ScanNet、NYUDepth和稳定扩散的图片条件下创建的3D场景时,所有数据集都显示出更好的视觉效果。
他们的模型可以创建各种风格的3D场景,包括逼真、动漫、乐高和室内/室外。他们的概念支持多个领域,并允许同时使用多个输入条件。例如,它根据文本创建一个3D场景并添加图片,将文本和图像条件在一起。这消除了完全从文本中创建预期场景的困难,并消除了大量生成样本的需求。此外,他们的方法允许在创建3D空间时修改输入条件。这些特点通过提供构建各种3D设置的机会来激发创造力。
他们总结了以下贡献。
• 研究团队推出了LucidDreamer,这是一个领域无关的高质量3D场景生成工具,它使用显式3D表示、深度估计和稳定扩散来改进3D场景合成中的领域泛化。
• 他们的Dreaming方法通过生成点云作为每个图片生成的几何指引,利用稳定扩散生成多视角图像。使用他们的对齐技术巧妙地将生成的照片整合在一起,创建一个连贯的3D场景。
• 他们的方法允许用户通过支持多种输入类型(文本、RGB和RGBD)以多种方式生成3D场景,同时允许在生成过程中更换输入。