生成对抗网络gan原理_GAN系列 - 自注意力生成对抗网络SAGAN

GAN系列 - 自注意力生成对抗网络SAGAN(Self-Attention Generative Adversarial Networks )


GAN如何利用注意力来提高图像质量呢,例如注意力如何提高语言翻译和图像字幕的准确性?例如,图像字幕深度网络聚焦在图像的不同区域以生成字幕中的单词(Image Caption)。

d8746e17f436e8ada0039ba6dec27eb2.png

下面突出显示的区域是网络聚焦的关注区域,用于生成特定单词。

3459b9171733ecd8605a4b4b4538e39d.png

Motivation

对于使用ImageNet系列结构训练的GAN模型,它们擅长处理有大量纹理(风景,天空)的类型,但在结构类型上表现更差。例如,GAN可以很好地渲染狗的皮毛,但对于狗的腿来说会很糟糕。虽然卷积filters擅长分析空间局部性信息,但是感知区域可能不足以覆盖较大的结构。我们可以增加filter的大小或深度网络的深度,但这将使GAN更难训练。

或许,我们可以应用注意力attention的概念。例如,为了细化眼睛区域的图像质量(左图中的红点),SAGAN仅使用中间图形中的高亮区域上的 feature map区域。如下所示,该区域具有更大的感受视野,并且上下文context更聚焦且更有相关性。右图显示了另一个例子,嘴部区域(绿点)。

8b92c78bcd98a1d79698c2f1f300235d.png
https://arxiv.org/pdf/1805.08318.pdf

Design

对于每个卷积层,

02db548ddfa2b9f93a1f7e1eb0700146.png

我们通过自注意力机制计算,用一个额外的term Ø 改进每一个空间位置输出。

9993838f841a9fac339032a8fb5a9e8b.png

其中x是原始图层输出,y是新输出。

fec347a843f8b235d4e6ae8bf815967a.png

(Note,将自注意力机制应用于每个卷积层。)

自注意力机制的组成部分

  • 计算attention map β,同时
  • 计算自注意力的输出。

Attention map

3530f52736e428f4fd3248836a5dfe48.png

我们用Wf和Wg(这些是要训练的模型参数)乘以x,并使用它们,用以下公式计算attention map β:

c0428a3ebe883f5785059d602ad9a5cf.png

对于每个空间位置,创建一个用作mask的attention map。βij被解释为在渲染位置j时位置i的影响。

91deef27a9e609e0c7972db237317b0f.png

Attention output

接下来,我们将Wh(也要训练的模型参数)乘以x,并将其与attention map β合并,以生成self-attention feature map 的输出o。

a3c693fbd9074b1feffae086a6e07691.png

54bad5db0af37987c99a53b67bffd225.png

该卷积层的最终输出是:

def1a9fbac69316912daa697b34d20b2.png

其中γ被初始化为0,因此模型将首先探索局部空间信息,然后用自注意力机制来改进。

Loss function

SAGAN使用hinge loss来训练网络:

f09534cd6139130c9c9af9c2bd0f74f7.png

Implementation

自注意力不仅适用于生成器generator。生成器generator和鉴别器discriminator都使用自注意力机制。为了提升训练,在鉴别器discriminator和生成器generator中分别使用不同的学习率(本文称为TTUR)。此外,谱归一化spectral normalization (SN)用于提高GAN训练的稳定性。这是FID中的性能指标(越低越好)。

94183bcdc278c68b958cc2a44c7a09fa.png

引用

自注意力生成对抗网络SAGAN

https://arxiv.org/pdf/1805.08318.pdf​arxiv.org

1ab7c857b22623b74454c13c6d0cbb8f.png
  • 0
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
提供的源码资源涵盖了小程序应用等多个领域,每个领域都包含了丰富的实例和项目。这些源码都是基于各自平台的最新技术和标准编写,确保了在对应环境下能够无缝运行。同时,源码配备了详细的注释和文档,帮助用户快速理解代码结构和实现逻辑。 适用人群: 适合毕业设计、课程设计作业。这些源码资源特别适合大学生群体。无论你是计算机相关专业的学生,还是对其他领域编程感兴趣的学生,这些资源都能为你提供宝贵的学习和实践机会。通过学习和运行这些源码,你可以掌握各平台开发的基础知识,提升编程能力和项目实战经验。 使用场景及目标: 在学习阶段,你可以利用这些源码资源进行课程实践、课外项目或毕业设计。通过分析和运行源码,你将深入了解各平台开发的技术细节和最佳实践,逐步培养起自己的项目开发和问题解决能力。此外,在求职或创业过程,具备跨平台开发能力的大学生将更具竞争力。 其他说明: 为了确保源码资源的可运行性和易用性,特别注意了以下几点:首先,每份源码都提供了详细的运行环境和依赖说明,确保用户能够轻松搭建起开发环境;其次,源码的注释和文档都非常完善,方便用户快速上手和理解代码;最后,我会定期更新这些源码资源,以适应各平台技术的最新发展和市场需求。 所有源码均经过严格测试,可以直接运行,可以放心下载使用。有任何使用问题欢迎随时与博主沟通,第一时间进行解答!

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值