

高保真度 对于许多增强现实和虚拟现实应用,包括游戏、社交网络、教育、电子商务和沉浸式远程会议,3D数字人是必不可少的。许多方法专注于从一张照片中重建一个3D着装人物,以便更容易从现成的野外照片中创建数字人。然而,由于缺乏非可见位置的观测,这个问题似乎并不明确,尽管早期技术已经取得了一些进展。它未能使用明显的视觉线索(如颜色和法线估计)来预测不可见部分(如背面),这导致了模糊的纹理和平滑的几何形状。因此,从不同角度观察这些重建时,会出现差异。多视图监督是这个问题的一个可行解决方案。但是只用一张图像作为输入,这可能吗?在这里,他们提出了TeCH作为一种潜在的解决方案。Tech将从输入图片中获取的文本信息与定制的文本到图片扩散模型(即DreamBooth)相结合,以指导重建过程,与以往主要研究明显的前端信号与非可视区域之间的关系的研究不同。
他们特别将单个输入图像中的语义信息分离为主题的独特和精细的外观,这对于文字来准确描述是困难的:
1)使用服装解析模型(即SegFormer)和预训练的视觉语言VQA模型(即BLIP),对输入图像中的描述性语义提示进行明确的解析。这些提示包括对颜色、服装风格、发型和面部特征的具体描述。
2)定制的文本到图像(T2I)扩散模型将难以描述的外观信息隐式地确定为主题的独特外观和细粒度特征,并嵌入到特殊的标记”[V]”中。他们使用基于原始观测的多视图分数蒸馏采样(SDS)重建损失以及从现成的法线估计器获得的正则化来优化基于这些信息源的3D人体,以提高重建的3D人体模型的保真度,同时保持其原始身份。
来自浙江大学、马克斯智能系统研究所、穆罕默德·本·扎耶德人工智能大学和北京大学的研究人员提出了一种基于DMTet的混合3D表示,以以合理的价格表达高分辨率的几何形状。为了准确地描绘身体的一般形状,我们的混合3D表示将显式四面体网格与隐式的RGB和有符号距离函数(SDF)场结合起来。他们首先优化这个四面体网格,提取以网格表示的几何形状,然后在两阶段优化过程中优化纹理。Tech使得可以使用统一的颜色方案和图案重新创建着装人物的准确3D模型,具有精确的全身几何形状和丰富的纹理。
因此,它使得包括角色动画、新视角渲染和形状和纹理操作在内的许多下游应用更容易实现。在涵盖各种姿势(CAPE)和服装(THuman2.0)的3D着装人类数据集上进行定量测试时,Tech在渲染质量方面表现出色,根据对真实世界照片和感知研究的定性评估,Tech优于SOTA方法。代码将公开供研究目的使用。