本文为52CV粉丝鬼道投稿,介绍了对抗学习领域最新的工作Adv-watermark。
论文标题:Adv-watermark: A Novel Watermark Perturbation for Adversarial Examples
论文链接:https://arxiv.org/pdf/2008.01919.pdf
引言
对抗样本生成的方法有很多,但它们都是在原图像上添加对抗扰动。本文提出的生成对抗样本的的方法很有趣,它是利用水印的不可察觉性,在水印上做文章从而生成对抗样本,即在干净图像中添加有意义的水印也可以攻击深度神经网络模型。如下图所示是分别是字母水印对抗样本和logo水印的对抗样本。
1.论文的贡献
本文的贡献可以归结如下三点:
作者提出了一种新的对抗样本算法Adv-watermark。水印同时具有水印特性(版权保护)和对抗样本的功能(导致训练好的模型误分类),需要注意的一点在于除了水印区域并没有其它的对抗扰动。
作者提出一种基于Adv-watermark的优化算法论文称为BHE。该优化方法采用基于种群的全局搜索策略方式生成对抗性样本。
实验结果显示,当水印大小为宿主图像大小的4/9(个人感觉扰动的像素过多,有点违背对抗样本的定义)时,它可以获得97%以上的攻击成功率。水印大小是宿主图像大小的1/16,也可以达到65%左右的攻击成功率。
2.算法介绍
2.1对抗水印
论文中使用除了R,G,B以外还有alpha共四个混合通道来生成对抗水印, 通道是指背景图像中前景区域的透明度。论文中用 表示alpha通道的值, 表示尺寸为 的宿主图像(称为宿主图片很准确即为无对抗扰动的图片), 表示尺寸为 的水印图像, 表示生成的图像,当 , 时,其生成对抗水印公式为:
当