

最近,基于扩散的大规模文本到图像(T2I)模型改变了创建可视材料的学科。这些T2I模型使得生成引人注目、表达丰富且以人为中心的图形变得简单。这些模型的一个有趣的用途是能够使用自然语言描述生成与身份相关的各种情境,给定一个特定人的日常生活中的面部(我们的家人,朋友等)。与图1中所示的典型T2I任务不同,身份重情境挑战要求模型在遵循文本提示的同时保持输入面部识别(即ID保留)。
为每个面部身份个性化预训练的T2I模型是一种可行的方法。它涉及通过增强其词嵌入或微调模型参数来学习将特定词与实质相关联。由于每个身份的优化,这些基于优化的方法可能更有效。为了避免耗时的每个身份的优化,各种无优化的方法建议将从预训练图像编码器(通常为CLIP)获得的图像特征直接映射到词嵌入中。然而,这会损害ID保留。因此,这些技术面临着损害原始T2I模型的编辑能力的风险,因为它们要么需要微调预训练的T2I模型的参数,要么改变原始结构以注入额外的网格图像特征。
简而言之,所有并行的无优化努力都在维持身份和模型的可编辑性方面遇到困难。它们认为,错误的身份特征表示和训练与测试之间的目标不一致是现有无优化研究中上述困难的根本原因。一方面,目前最佳的CLIP模型在面部识别准确性方面仍然比面部识别模型差得多(80.95%对87.61%),这表明并行努力中使用的常见编码器(即CLIP)对于身份重情境化任务来说是不足够的。此外,CLIP的最后一层特征主要关注高级语义而不是精确的面部描述,无法保持识别信息。
所有并行任务使用原始重建目标来学习词嵌入都会对输入面部的可编辑性产生负面影响。为了解决上述身份保留和可编辑性困难,他们提供了一种独特的无优化框架(称为DreamIdentity),具有准确的身份表示和一致的训练/推理目标。更准确地说,在Vision Transformer的架构中创建了一个独特的多词多尺度ID编码器(M2 ID编码器),用于正确的身份表示。该编码器在大规模的面部数据集上进行预训练,并将多尺度特征投影到多词嵌入中。
中国科学技术大学和字节跳动的研究人员提出了一种新颖的自我增强可编辑性学习方法,将编辑任务移入训练阶段。该方法使用T2I模型通过生成名人面孔和各种目标编辑的名人图像来构建自我增强数据集。使用这个数据集来训练M2 ID编码器以提高模型的可编辑性。他们在这项工作中做出了以下贡献:他们认为,由于错误的表示和不一致的训练/推理目标,现有的无优化方法对于身份保留和高可编辑性是无效的。
从技术上讲,(1)他们提出了M2 ID编码器,这是一个具有多嵌入投影的ID感知多尺度特征,用于适当的表示。(2)他们结合自我增强的可编辑性学习,使底层T2I模型能够为编辑提供高质量的数据集,以实现一致的训练/推理目标。通过全面的研究证明了他们的方法的有效性,这些方法能够在保持身份的同时允许灵活的文本引导修改,即身份重情境化。