

视觉综合模型由于大规模模型训练的进展而能够产生越来越逼真的视觉效果。鉴于使用合成图片的潜在风险增加,负责任的人工智能变得更加重要,特别是在合成过程中消除特定的视觉元素,如种族主义、性别歧视和裸露。但是,负责任的视觉综合是一个非常困难的任务,原因有两个。首先,合成的图片必须符合管理员的标准,例如不应出现“比尔·盖茨”和“微软创始人”等词语。其次,用户查询的非禁止部分应准确合成,以满足用户的要求。
现有的负责任的视觉综合技术可以分为三个主要类别来解决上述问题:改进输入、改进输出和改进模型。第一种策略是改进输入,集中在对用户查询进行预处理,以符合管理员的要求,例如构建黑名单来过滤不良内容。在开放词汇表的环境中,黑名单很难确保完全消除所有不良内容。第二种方法是改进输出,包括对生成的影片进行后处理,以符合管理员的规则,例如通过识别和删除不适宜的内容来保证输出的适用性。
这种技术很难识别开放词汇的视觉概念,它依赖于在特定概念上进行预训练的过滤模型。第三种策略是改进模型,尝试对整个模型或特定组件进行微调,以理解和满足管理员的要求,提高模型遵循预期准则并提供与指定规则和法规一致的材料的能力。然而,微调数据中的偏见常常对这些技术施加限制,使其难以达到开放词汇表的能力。这就引出了以下问题:管理员如何通过实现开放词汇负责任的视觉综合来有效地禁止创建任意的视觉概念?例如,用户可能要求在图1中生成“微软创始人在酒吧喝酒”的图片。
根据地理、上下文和使用情况的不同,必须避免使用不适合的视觉概念进行适当的视觉综合。
当管理员将“比尔·盖茨”或“酒精”等概念禁止时,负责任的输出应以类似日常语言表达的方式澄清概念。微软的研究人员基于上述观察提出了一项名为开放词汇负责任的视觉综合(ORES)的新任务,其中视觉综合模型可以避免不明确表示的任意视觉元素,并允许用户输入所需的信息。然后引入了两阶段干预(TIN)结构。它可以通过使用大规模语言模型(LLM)进行可学习的指令重写和通过扩散综合模型进行快速干预来成功合成图片。
在可学习查询的指导下,TIN将特定应用于使用CHATGPT将用户的问题重写为降低风险的查询。在中间综合阶段,TIN通过用降低风险的查询替换用户的查询来干预合成。他们开发了一个基准测试,相关的基线模型,黑名单和负面提示,并提供了一个可公开访问的数据集。他们结合了大规模语言模型和视觉综合模型。据他们所知,他们是首次在开放词汇场景下研究负责任的视觉综合。
在附录中,他们的代码和数据集对所有人都是可访问的。他们作出了以下贡献:
• 他们提出了开放词汇负责任的视觉综合(ORES)的可行性,并开发了一个带有适当基线模型的基准测试,建立了一个可公开访问的数据集。
• 作为ORES的成功解决方案,他们提供了两阶段干预(TIN)框架,其中包括
1)通过大规模语言模型(LLM)进行可学习教学的重写
2)通过扩散合成模型进行快速干预的合成
• 研究表明,他们的方法显著降低了不适当模型开发的机会。他们展示了LLM在负责任的视觉合成方面的能力。