TensorFlow2实现空间自适应归一化(Spatial Adaptive Normalization, SPADE)

空间自适应归一化(Spatial Adaptive Normalization, SPADE)


空间自适应归一化(Spatial Adaptive Normalization, SPADE)是GauGAN中的主要创新点,其用于语义分割图的层归一化,为了更好的解释SPADE,需要首先了解GauGAN网络输入——语义分割图

使用独热编码标记分割蒙版

考虑训练GauGAN所用的Facades数据集。其中,分割图在RGB图像中被编码为不同的颜色,如下图所示。例如,一堵墙以蓝色表示,柱子以红色表示。这种表示在视觉上让我们易于理解,但对神经网络的学习并没有帮助,这是因为对于GAN而言,颜色没有语义。

语义分割图

颜色在颜色空间中更接近并不意味着它们在语义上也接近。例如,我们可以用浅绿色表示草,用深绿色表示飞机,即使分割图的色相接近,它们的语义也不相关。

因此,我们应该使用类标签,而不是使用颜色来标记像素。但是,这仍然不能解决问题,因为类别标签是随机分配的数字,并且它们也没有语义。因此,一种更好的方法是在该像素中存在对象时使用标签为1的分割蒙版,否则使用标签为0的分割蒙版。换句话说,我们将分割图中的标签独热编码为形状(H, W, number of classes)的分割蒙版。

JPEG编码中,在压缩过程中会删除一些对视觉效果不太重要的视觉信息。即使结果像素应该属于同一类并且看起来是相同的颜色,它们也可能具有不同的值。因此,我们无法将JPEG图像中的颜色映射到类。为了解决这个问题,我们需要使用未压缩的图片格式BMP。在图像加载和预处理中,我们将加载文件,并将它们从BMP转换为独热编码的分割蒙版。

有时,TensorFlow的基本图像预处理API无法执行一些复杂的任务,因此我们需要使用其他Python库,tf.py_function允许我们在TensorFlow训练流程中运行通用Python函数:

def load(image_file):

def load_data(image_file):

jpg_file = image_file.numpy().decode(‘utf-8’)

bmp_file = jpg_file.replace(‘.jpg’, ‘.bmp’)

png_file = jpg_file.replace(‘.jpg’, ‘.png’)

image = np.array(Image.open(jpg_file))/127.5-1

map = np.array(Image.open(png_file))/127.5-1

labels = np.array(Image.open(bmp_file), dtype=np.uint8)

h,w,_ = image.shape

n_class = 12

mask = np.zeros((h,w,n_class),dtype=np.float32)

for i in range(n_class):

one_hot[labels==i,i] = 1

return map, image, mask

[mask, image, label] = tf.py_function(load_data, [image_file], [tf.float32, tf.float32, tf.float32])

了解了独热编码的语义分割掩码的格式后,我们将使用TensorFlow2实现SPADE

实现SPADE

实例归一化已在图像生成中非常流行,但是它往往会削弱分割蒙版的语义:假设输入图像仅包含一个分割标签;例如,假设整个图像都是天空,由于输入具有统一的值,因此输出在通过卷积层后也将具有统一的值。

实例归一化为每个通道计算跨维度(H, W)的平均值。因此,该通道的均值将是相同的统一值,并且用均值减去后的归一化激活将变为零。显然,语义已经丢失,这是一个十分极端的示例,但是逻辑是相似的,我们可以看到分割掩码随着其面积的增大而失去了其语义含义。

为了解决这个问题,SPADE规范化了由分割蒙版限定的局部区域,而不是整个蒙版。下图显示了SPADE的体系结构:

SPADE体系结构在批归一化中,计算跨维度(N, H, W)的通道的均值和标准差,对于SPADE来说是相同的。区别在于,每个通道的γβ不再是标量值,而是二维向量,形状为(H, W)。换句话说,对于每个从语义分割图中获悉的激活,都有一个γβ值。因此,归一化被不同地应用于不同的分割区域。这两个参数是通过使用两个卷积层来学习的,如下图所示:

SPADE

SPADE不仅应用于网络输入阶段,同样还应用于内部层。现在,我们可以为使用TensorFlow2的自定义层实现SPADE

将首先在__init__构造函数中定义卷积层,如下所示:

class SPADE(layers.Layer):

def init(self, filters, epsilon=1e-5):

super(SPADE, self).init()

self.epsilon = epsilon

self.conv = layers.Conv2D(128, 3, padding=‘same’, activation=‘relu’)

self.conv_gamma = layers.Conv2D(filters, 3, padding=‘same’)

self.conv_beta = layers.Conv2D(filters, 3, padding=‘same’)

接下来,获得激活图尺寸,以在以后调整大小时使用:

def build(self, input_shape):

self.resize_shape = input_shape[1:3]

自我介绍一下,小编13年上海交大毕业,曾经在小公司待过,也去过华为、OPPO等大厂,18年进入阿里一直到现在。

深知大多数Python工程师,想要提升技能,往往是自己摸索成长或者是报班学习,但对于培训机构动则几千的学费,着实压力不小。自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!

因此收集整理了一份《2024年Python开发全套学习资料》,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友,同时减轻大家的负担。
img
img



既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,基本涵盖了95%以上前端开发知识点,真正体系化!

由于文件比较大,这里只是将部分目录大纲截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频,并且后续会持续更新

如果你觉得这些内容对你有帮助,可以添加V:vip1024c 备注Python获取(资料价值较高,非无偿)
img

最后

不知道你们用的什么环境,我一般都是用的Python3.6环境和pycharm解释器,没有软件,或者没有资料,没人解答问题,都可以免费领取(包括今天的代码),过几天我还会做个视频教程出来,有需要也可以领取~

给大家准备的学习资料包括但不限于:

Python 环境、pycharm编辑器/永久激活/翻译插件

python 零基础视频教程

Python 界面开发实战教程

Python 爬虫实战教程

Python 数据分析实战教程

python 游戏开发实战教程

Python 电子书100本

Python 学习路线规划

1674929476f9c3b30f7ff58dff0.png?x-oss-process=image/watermark,type_ZmFuZ3poZW5naGVpdGk,shadow_10,text_aHR0cHM6Ly9ibG9nLmNzZG4ubmV0L2ZlaTM0Nzc5NTc5MA==,size_16,color_FFFFFF,t_70)

  • 22
    点赞
  • 28
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值