深入浅出GAT–Graph Attention Networks（图注意力模型）

最新推荐文章于 2025-04-10 16:35:41 发布

努力AC的潇潇

最新推荐文章于 2025-04-10 16:35:41 发布

阅读量5.6w

点赞数 63

分类专栏：深度学习模型文章标签：机器学习人工智能

原文链接：https://zhuanlan.zhihu.com/p/81350196

版权

深度学习模型专栏收录该内容

4 篇文章

订阅专栏

本文详细介绍了GAT（Graph Attention Networks）的起源，针对GCN的局限性，特别是其在处理有向图和inductive任务上的优势。通过mask和global graph attention机制，GAT如何计算注意力系数并融合邻域信息。探讨了GAT与GCN的区别，以及在AI医药领域的应用实例。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

深入浅出GAT–Graph Attention Networks（图注意力模型）

文章目录

深入浅出GAT--Graph Attention Networks（图注意力模型）

1 GAT的诞生

由深度学习三巨头之一的Yoshua Bengio组提出了Graph Attention Networks（下述简称为GAT）去解决目前GCN存在的问题。

2 关于图

为了更好的引入，我们先来看看图的基础知识~~~
哒哒哒哒哒哒哒~~~~~~~~~~~~~~~~~~~~~~~~~

2.1 图的重要的“两特征”

提及graph，通常是包含着顶点和边的关系。
在这里插入图片描述

第一种特征：对于任意一个顶点 i，它在图上邻居 Ni,构成第一种特征，即图的结构关系。
第二种特征：除了图的结构之外，每个顶点还有自己的特征 hi（通常是一个高维向量）。它可以使社交网络中每个用户的个体属性；可以是生物网络中，每个蛋白质的性质；还可以使交通路网中，每个交叉口的车流量。

2.2 GCN的局限性

GCN是处理transductive任务的一把利器（transductive任务是指：训练阶段与测试阶段都基于同样的图结构），然而GCN有两大局限性是经常被诟病的：

（a）无法完成inductive任务，即处理动态图问题。inductive任务是指：训练阶段与测试阶段需要处理的graph不同。通常是训练阶段只是在子图（subgraph）上进行，测试阶段需要处理未知的顶点。（unseen node）

（b）处理有向图的瓶颈，不容易实现分配不同的学习权重给不同的neighbor。这一点在前面的文章中已经讲过了，不再赘述，如有需要可以参考下面的链接。
解读三种经典GCN中的Parameter Sharing

3 GAT

重点在获取其余节点对本节点的影响上。GAT本质上有两种运算方式，即Mask graph attention or global graph attention。

3.1 Global graph attention

**顾名思义，就是每一个顶点i都对于图上任意顶点都进行attention运算。**可以理解为图1的蓝色顶点对于其余全部顶点进行一遍运算。

优点：完全不依赖于图的结构，对于inductive任务无压力

缺点：（1）丢掉了图结构的这个特征，无异于自废武功，效果可能会很差（2）运算面临着高昂的成本

3.2 Mask graph attention

注意力机制的运算只在邻居顶点上进行，也就是说图1的蓝色顶点只计算和橙色顶点的注意力系数。目前常用方式。

4 输入浅出GAT

叮叮叮叮叮~~~~~~~~
重点来啦！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！！
和所有的attention mechanism一样，GAT的计算也分为两步走：

4.1 计算注意力系数（attention coefficient）

对于顶点i，逐个计算它的邻居们j和它自己之间的相似系数：

解读一下这个公式：首先一个共享参数 w 的线性映射对于顶点的特征进行了增维，当然这是一种常见的特征增强（feature augment）方法；|| 对于顶点i,j的变换后的特征进行了拼接（concatenate）；最后 a( )把拼接后的高维特征映射到一个实数上。
有了相关系数，离注意力系数就差归一化了！其实就是用个softmax：

4.2 加权求和（aggregate）

现在已经成功一大半了哦~~~~~~~~~
第二步很简单，根据计算好的注意力系数，把特征加权求和（aggregate）一下。

GAT输出的对于每个顶点 [公式] 的新特征（融合了邻域信息）
式（3）看着还有点单薄，俗话说一个篱笆三个桩，attention得靠multi-head帮！来进化增强一下

5 深入理解强化GAT

5.1 与GCN的联系与区别

本质上而言：GCN与GAT都是将邻居顶点的特征聚合到中心顶点上（一种aggregate运算），利用graph上的local stationary学习新的顶点特征表达。不同的是GCN利用了拉普拉斯矩阵，GAT利用attention系数。一定程度上而言，GAT会更强，因为顶点特征之间的相关性被更好地融入到模型中。

5.2 为什么GAT适用于有向图？

最根本的原因是GAT的运算方式是逐顶点的运算（node-wise），这一点可从公式（1）—公式（3）中很明显地看出。每一次运算都需要循环遍历图上的所有顶点来完成。逐顶点运算意味着，摆脱了拉普利矩阵的束缚，使得有向图问题迎刃而解。

5.3 为什么GAT适用于inductive任务？

GAT中重要的学习参数是 W 与 a( ) ，因为上述的逐顶点运算方式，这两个参数仅与1.1节阐述的顶点特征相关，与图的结构毫无关系。所以测试任务中改变图的结构，对于GAT影响并不大。
与此相反的是，GCN是一种全图的计算方式，一次计算就更新全图的节点特征。学习的参数很大程度与图结构相关，这使得GCN在inductive任务上遇到困境。