Press "Enter" to skip to content

“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法”

“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法” 四海 第1张“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法” 四海 第2张

一年前,用人工智能生成逼真的图像还只是一个梦想。尽管大部分生成的输出仍然有三只眼睛、两个鼻子等等,但我们对于看到与真实相似的生成的脸庆幸不已。然而,随着扩散模型的发布,情况发生了很大变化。如今,很难区分出人工智能生成的图像和真实的图像。

生成高质量图像的能力是方程式的一部分。如果我们要充分利用它们,高效地压缩它们在内容生成、数据存储、传输和带宽优化等任务中发挥着至关重要的作用。然而,图像压缩在很大程度上仍然依赖于传统的变换编码和量化技术,对生成模型的探索有限。

尽管扩散模型和基于评分的生成模型在图像生成方面取得了成功,但在图像压缩方面,它们尚未成为主导方法,落后于基于GAN的方法。它们在高分辨率图像上的表现往往比不上HiFiC等基于GAN的方法。即使尝试将文本到图像模型重新用于图像压缩,也会产生不令人满意的结果,生成的重建图像与原始输入有所偏差,或者包含不良伪影。

在图像生成任务中,基于评分的生成模型的性能与它们在图像压缩中的有限成功之间的差距引发了有趣的问题,并激发了进一步的研究。令人惊讶的是,能够生成高质量图像的模型在图像压缩这个特定任务中无法超越GAN。这种差异表明,在将基于评分的生成模型应用于压缩任务时,可能存在独特的挑战和考虑因素,需要专门的方法来充分发挥其潜力。

“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法” 四海 第3张

因此,我们知道在图像压缩中使用基于评分的生成模型存在潜力。问题是,如何实现呢?让我们来看答案。

谷歌研究人员提出了一种方法,将经过均方误差(MSE)优化的标准自编码器与扩散过程结合起来,以恢复并添加自编码器丢弃的细节。对于编码图像的比特率仅由自编码器确定,因为扩散过程不需要额外的比特。通过专门为图像压缩微调扩散模型,结果显示它们在图像质量方面可以胜过几种最近的生成方法。

“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法” 四海 第4张
所提出的方法能够更好地保留细节,与最先进的方法相比。来源:https://arxiv.org/pdf/2305.18231.pdf

该方法探索了两种紧密相关的方法:扩散模型表现出令人印象深刻的性能,但需要大量的采样步骤;而修正流模型在允许较少的采样步骤时表现更好。

这种两步方法首先使用MSE优化的自编码器对输入图像进行编码,然后应用扩散过程或修正流方法来增强重建图像的逼真度。扩散模型采用与文本到图像模型相反方向的噪声调度,优先考虑细节而不是全局结构。另一方面,修正流模型利用自编码器提供的配对关系,直接将自编码器输出映射到未压缩图像。

“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法” 四海 第5张
所提出的HFD模型概述。来源:https://arxiv.org/pdf/2305.18231.pdf

此外,该研究揭示了一些具体细节,这些细节对未来在该领域的研究具有实用价值。例如,研究表明,噪声计划和在图像生成过程中注入的噪声量显著影响结果。有趣的是,尽管文本到图像模型在高分辨率图像上训练时受益于增加的噪声水平,但发现在压缩方面减少扩散过程的整体噪声是有利的。这种调整使模型能够更多地关注细节,因为粗略的细节已经被自动编码器重建充分捕捉到了。

Leave a Reply

Your email address will not be published. Required fields are marked *