DiT：Transformers 与扩散模型强强联手

Zilliz Planet

于 2023-01-10 18:20:43 发布

阅读量5.4k

点赞数

分类专栏： Towhee 文章标签：深度学习计算机视觉人工智能

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_44839084/article/details/128634432

版权

Towhee 专栏收录该内容

48 篇文章

订阅专栏

出品人：Towhee 技术团队王翔宇、顾梦佳

扩散模型在图像生成领域有着难以撼动的地位，而其通常都选择了卷积 U-Net作为主干模型。那么在其他领域大杀四方的 Transformers 在扩散模型中是否还有用武之地呢？基于这一想法，DiT（Diffusion Transformer）利用transformer结构探索了一种新的扩散模型。它不仅继承了Transformer模型类的优秀扩展特性，性能还优于先前使用U-Net的模型。研究表明，扩散模型可以成功地用 transformer 替换 U-Net 主干。另外，它还证明了网络复杂性与样本质量之间存在很强的相关性。通过简单地扩展 DiT 并训练具有高容量主干的潜在扩散模型，DiT 模型可以在类条件 256 × 256 ImageNet 生成基准上实现 FID 2.27 的最新结果。

The Diffusion Transformer (DiT) architecture.

DiT 首先将空间表示输入通过第一层网络，将每个 patch 线性嵌入到输入中，以此将空间输入转换为一个数个 token 序列。然后，模型会将标准的基于 ViT 频率的位置嵌入应用于所有输入 token。接着，输入 token 由一系列 transformer 块处理。除了噪声图像输入之外，扩散模型有时还会处理额外的条件信息，例如噪声时间步长、类标签、自然语言等。DiT 探索了四种transformer 块变体，分别以不同方式处理条件输入。

相关资料：

代码地址：https://github.com/facebookresearch/DiT
论文链接：Scalable Diffusion Models with Transformers
更多资料：统治扩散模型的U-Net要被取代了，谢赛宁等引入Transformer提出DiT

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。