从微信社交网络到分子药物设计,图结构无处不在。本文深入浅出拆解图神经网络的三大基石:MPNN通用消息传递范式、GCN图卷积以及引入动态权重的GAT图注意力机制。
传统深度学习擅长处理两类规则数据:类似网格的图像(CNN 的领地)和线性的序列文本(RNN 与 Transformer 的主场)。
现实世界的大多数复杂关系往往不按规矩排布。微信的好友社交网、淘宝的用户商品交互图、金融风控里的转账链路,乃至生物医药中的分子化学键,都是典型的非欧几里得结构(Non-Euclidean Data)。
处理这些复杂的拓扑关联,主角正是图神经网络(Graph Neural Network, GNN)。要彻底理清 GNN 的演进路径,只需吃透三个核心概念:通用框架 MPNN、基准模型 GCN,以及引入注意力权重的 GAT。
大多数现代 GNN 模型,本质上都可以统一在 MPNN(Message Passing Neural Network,消息传递神经网络) 的框架之下。
理解 MPNN 只需要记住一句话:一个节点的特征,由它自身和所有邻居的状态共同决定。
整个过程分为三个步骤:
堆叠多层 MPNN 之后,信息就会在图上扩散开来:一层网络能感知一阶直接邻居,两层网络就能看到二阶邻居(朋友的朋友)。
如果说 MPNN 是一套设计蓝图,那 GCN(Graph Convolutional Network) 就是这套蓝图最经典、最轻量的工程实现。
GCN 的直观思路很直接:既然图像卷积是用固定尺寸的卷积核对邻近像素做加权求和,那图上的卷积,就是把邻居节点的信息做加权平均。
但图结构有一个棘手问题:节点的度数(Degree)差异极大。
在微博上,明星大 V 可能有上千万粉丝,而普通用户只有几十个关注。如果简单对邻居特征做相加,高度数节点的值会迅速爆炸;如果只做普通平均,又会抹平关键连接的结构信息。
Kipf 和 Welling 提出的经典 GCN 给出了一个优雅的归一化方案:对称度归一化。
在聚合特征时,节点 $j$ 传递给节点 $i$ 的权重不是固定的 1,而是除以 $\sqrt{d_i \cdot d_j}$(其中 $d$ 为节点度数)。这意味着:
加上自环(Self-loop,把节点自身也当做邻居聚合),GCN 实现了极简而高效的拓扑特征提取。
GCN 表现优秀,但在现实业务中有一个明显短板:邻居的权重完全由图的拓扑度数决定,与节点具体的内容毫无关系。
举个例子:在风控欺诈检测中,一个正常用户可能同时关联了数百个正常账户和一个黑产洗钱账户。在 GCN 眼中,这几百个邻居在度数相近时权重完全等同,致命的欺诈信号极容易被汪洋大海般的正常交易淹没。
GAT(Graph Attention Network) 的出现打破了这种静态局限。它把 Transformer 里的自注意力机制(Self-Attention)移植到了图结构上。
GAT 的核心变化在于权重计算:
同时,GAT 引入了多头注意力机制(Multi-Head Attention),让多个独立的注意力通道分别关注不同的关联维度,大幅提升了模型在复杂拓扑下的鲁棒性。
总结三者的技术演进脉络:
| 维度 | MPNN | GCN | GAT |
|---|---|---|---|
| 本质定位 | 抽象的理论框架 | 静态归一化的轻量实现 | 动态权重的注意力实现 |
| 计算复杂度 | 取决于具体实现 | 低,推理速度极快 | 较高,需要计算节点对间注意力 |
| 邻居权重 | 自定义 | 仅依赖节点度数(拓扑结构) | 依赖节点特征相似度(数据驱动) |
| 典型落地 | 分子性质预测、药物发现 | 大规模社交推荐、冷启动预测 | 复杂反欺诈风控、异构图建模 |
在当下的工业实践中,海量节点图谱通常先采用采样技术(如 GraphSAGE)控制邻居数量,骨干网络则根据算力预算在 GCN 与 GAT 之间权衡。吃透消息传递与特征聚合的本质,是运用好图深度学习的第一道门槛。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断