Imagen论文简要解析

sp_fyf_2024

已于 2024-10-31 21:23:10 修改

阅读量766

点赞数 22

分类专栏：人工智能前沿技术大语言模型深度学习文章标签： Imagen 深度学习人工智能

于 2024-09-15 23:07:15 首次发布

本文链接：https://blog.csdn.net/fyf2007/article/details/142290533

版权

大语言模型同时被 3 个专栏收录

117 篇文章

订阅专栏

人工智能前沿技术

91 篇文章

订阅专栏

深度学习

37 篇文章

订阅专栏

Imagen论文简要解析

文章

Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
具有深度语言理解能力的逼真文本到图像扩散模型
在这里插入图片描述

在这里插入图片描述
https://arxiv.org/pdf/2205.11487

摘要

文章介绍了一种名为Imagen的文本到图像扩散模型，该模型在理解文本和生成高保真度图像方面达到了前所未有的水平。Imagen基于大型变换器语言模型的强大文本理解能力，并依赖于扩散模型在图像生成方面的高保真度。研究发现，即使是在仅针对文本语料库预训练的通用大型语言模型（例如T5），在图像合成编码文本方面也出奇地有效。在Imagen中增加语言模型的大小，可以显著提高样本保真度和图像-文本对齐度，这比增加图像扩散模型的大小要有效得多。在COCO数据集上，Imagen实现了新的最先进的FID得分7.27，且从未在COCO上训练过，人类评估员发现Imagen样本在图像-文本对齐方面与COCO数据本身相当。为了更深入地评估文本到图像模型，研究者引入了DrawBench，这是一个全面且具有挑战性的文本到图像模型的基准测试。通过DrawBench，研究者比较了Imagen与其他最新方法（包括VQ-GAN+CLIP、Latent Diffusion Models、GLIDE和DALL-E 2）并发现，在一对一比较中，人类评估员更偏好Imagen，无论是在样本质量还是图像-文本对齐方面。