Paper Reading:Beyond Message Passing: Neural Graph Pattern Machine


Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。

论文概况 详细
标题 《Beyond Message Passing: Neural Graph Pattern Machine》
作者 Zehong Wang, Zheyuan Zhang, Tianyi Ma, Nitesh V Chawla, Chuxu Zhang, Yanfang Ye
发表会议/期刊 ICML (International Conference on Machine Learning)
发表年份 2025
会议/期刊等级 CCF-A
论文代码 https://github.com/Zehong-Wang/GPM

作者单位:

  1. University of Notre Dame, USA(圣母大学)
  2. University of Connecticut, USA(康涅狄格大学)

研究动机

图学习任务的关键在于识别重要的子结构模式,如社交网络中的三元闭包、分子图中的苯环等。这些反复出现的子结构构成了图语义的基础构件,对下游预测性能有重要影响。然而,大多数图神经网络基于消息传递范式,通过迭代聚合局部邻域信息来学习表示,无法显式捕获三角形、k-团和环等基本模式,既影响了表达能力,也制约了长距离依赖的建模。现有超越消息传递的研究方向如下表所示,这些方法大多作为消息传递的扩展或补充出现,未能直接且有效地建模图模式。

方法类别 核心机制 优势 局限性
子图 GNN 显式子图提取 改进表达能力 计算开销高;归纳偏置存在偏向性
高阶 GNN / 基于环或路径的方法 环/路径建模 改善长距离建模 往往牺牲局部模式的理解
图 Transformer 全局注意力 捕获任意节点依赖;表达能力超越 WL 测试 二次复杂度限制了在大规模图上的可扩展性

近年来,将图模式作为离散 token 来表示节点、边或整个图的研究方向开始兴起,但仍处于早期阶段,面临三个关键挑战。

  1. 通用图分词器的缺失:句子和图像天然具有序列结构,而图实例的非欧几里得性质使得 token 化十分困难。现有的分词器往往针对特定任务,如 Hop2token 用于节点级任务,METIS 分词器用于图级任务;
  2. 有效的模式编码:当前方法常使用消息传递作为模式编码器或辅助模块来提供图归纳偏置,但消息传递在识别基本子结构方面的有限表达能力导致模式编码中的信息损失;
  3. 重要模式识别:采样得到的模式可能存在重复或噪声,需要识别与下游任务最相关的模式。现有方法大多在具有长距离依赖的基准上评估,在偏向局部或混合依赖的图上的效果尚不明确。

综上所述,现有方法在图模式的通用提取、有效编码和重要性识别三个方面存在不足。本文针对这些挑战,提出了神经图模式机(GPM),通过随机游走分词、双路径编码和自注意力模式选择,实现了超越消息传递的图表示学习框架。

文章贡献

针对消息传递 GNN 无法显式建模图子结构模式的问题,本文提出了一种直接从图子结构学习的新型框架神经图模式机 GPM。GPM 绕过了消息传递机制,通过基于随机游走的分词器高效采样图模式,计算效率高且可适配节点级、链路级和图级等多种任务。其核心思想在于随机游走的语义路径与匿名路径的组合对应于特定的图模式,基于此 GPM 分别编码语义路径和匿名路径,全面捕获图归纳偏置。编码后的图模式输入 Transformer 编码器,通过自注意力识别对下游任务起主导作用的重要模式。理论分析表明,GPM 的表达能力超越消息传递框架,可以区分 GNN 无法识别的非同构图,并能建模消息传递难以捕捉的长距离依赖。在节点分类、链路预测、图分类和图回归四类标准任务上的广泛实验表明,GPM 全面超越 SOTA 基线。进一步分析显示,GPM 具有强大的分布外泛化能力、良好的可扩展性和增强的可解释性。
image

预备知识

理解本文方法需要熟悉两个概念。

匿名游走(Anonymous Walk)。 给定随机游走 \(w = (v_0, v_1, \ldots, v_L)\),其对应的匿名游走定义为整数序列 \(\phi = (\gamma_0, \gamma_1, \ldots, \gamma_L)\),其中 \(\gamma_i = \min\ \text{pos}(w, v_i)\),即节点在游走中首次出现的位置索引。匿名游走将随机游走编码为相对位置序列,通过不记录具体节点身份来保持匿名性。每个匿名游走对应一种独特的图拓扑模式。例如,游走 "A-B-C-A-D" 和 "C-D-E-C-A" 都对应匿名路径 "0-1-2-0-3",表示一个带额外连接的三角形子结构。游走 "A-C-E-D-A" 对应匿名路径 "0-1-2-3-0",表示一个矩形子结构。
image

图模式。 本文将图模式定义为代表小型、反复出现的子结构的子图,如三角形、星形、环形等。这些模式是图语义的基本构件,在不同领域有明确的语义含义,如社交网络中的三元闭包表示稳定关系,分子图中的苯环影响化学活性。

本文方法

GPM 的整体框架如图所示,包含三个核心组件:

组件 核心机制
模式分词器 基于随机游走采样图模式
模式编码器 分别编码语义路径和匿名路径
重要模式识别器 通过 Transformer 注意力识别关键模式

image

模式分词器

分词器的目标是将图实例(节点、边或图)转换为一组模式序列。与自然语言处理中使用预定义词表不同,图模式的词表构建和模式匹配效率低下,难以扩展到大规模图。GPM 通过随机采样近似模式匹配过程,绕过了显式固定词表的需求。

随机游走采样。 GPM 使用无偏随机游走采样图模式。长度为 \(L\) 的随机游走定义为节点序列 \(w = (v_0, v_1, \ldots, v_L)\),通过马尔可夫链生成:\(P(v_{i+1} | v_0, \ldots, v_i) = \mathbb{1}[(v_i, v_{i+1}) \in E] / D(v_i)\),其中 \(D(v_i)\) 表示节点 \(v_i\) 的度数。从任意节点出发生成一组随机游走,过程简单高效。

为什么随机游走可以采样图模式。 本文通过匿名游走的概念建立了随机游走与图模式之间的联系。每个随机游走对应一个匿名路径,匿名路径捕获了独特的图拓扑模式。已有研究证明,从节点 \(v\) 出发的匿名路径分布足以重建固定距离内所有节点诱导的子图。由此得出命题3.2:给定节点 \(v\),如果任务需要 \(k\) 跳自我图 \(B(v, k)\) 的信息,足够大的 \(l\) 长度匿名游走模式集(\(l = O(|E'|)\))可以提供可区分的拓扑表示。

这一命题说明,从一个节点出发的匿名路径分布足以捕捉其拓扑性质。两个节点如果匿名路径分布相似,则可以认为它们共享相似的图模式。这一结论可以扩展到链路和图,将其视为节点的组合。

语义路径与匿名路径。 对于每个随机游走,可以导出两条路径:语义路径(原始节点序列,捕获节点特征信息)和匿名路径(相对位置序列,捕获拓扑结构)。两者的组合在概念上代表了一个特定的图模式。命题3.3指出,通过任意双射映射联合编码语义路径和匿名路径,可以提供图归纳偏置的全面表示。

基于这一理论,GPM 为每个图实例采样一组随机游走,每条游走同时提供语义和拓扑两方面信息,作为后续编码的输入。

模式编码器

对于每个采样得到的模式(即一条随机游走),GPM 通过分别编码语义路径和匿名路径,然后融合两者得到模式表示:

\[p = \lambda \cdot \rho_s(w) + (1-\lambda) \cdot \rho_a(\phi) \]

其中 \(p\) 是模式嵌入,\(\rho_s\)\(\rho_a\) 分别是语义路径和匿名路径的编码器,\(\lambda\) 是加权系数。

语义路径编码器。 语义路径编码根据语义路径构建节点特征序列 \([x_0, \ldots, x_n]\),节点可能重复出现。编码器 \(\rho_s\) 可以是任何处理序列数据的模型,默认使用 Transformer 编码器,因其在捕获长距离依赖方面具有优越的表达能力。替代方案包括均值聚合器或 GRU。编码过程为 \(\rho_s(w) = \rho_s([h_0, \ldots, h_n])\),其中 \(h_i = W x_i + b\)\(x_i\) 是节点特征与可选边特征的拼接。由于路径中边数比节点数少一,边特征在序列开头用零向量填充以对齐长度。

节点位置嵌入。 可选地将节点位置嵌入与节点特征拼接,以增强拓扑信息。本文使用随机游走结构嵌入(RWSE)和拉普拉斯特征向量嵌入(Lap)两种常用位置编码。实验发现位置编码的选择取决于数据集,即使不使用位置嵌入,模型仍能取得有竞争力的性能。

匿名路径编码器。 匿名路径 \(\phi = (\gamma_0, \ldots, \gamma_n)\) 的编码采用类似方法,但匿名节点没有显式特征。本文不使用独热编码,而是采用一种更高级的方法同时编码匿名索引和连接信息。具体而言,对于长度为 \(k\) 的匿名路径,每个节点 \(v_i\) 分配一个 \(k\) 维向量 \(z_i\),其中 \(z_{i,j} = \mathbb{1}[\gamma_i = \gamma_j]\)。这种编码不仅捕获身份信息,还编码了环结构,称为基于环的邻接表示。匿名路径可以表示为 \(\phi = [z_0, \ldots, z_n]\),然后通过编码器 \(\rho_a\) 处理。默认使用 GRU 作为编码器,以平衡表达能力和计算效率。

重要模式识别器

每个图实例由一组编码后的模式 \(P = [p_0, \ldots, p_m]\) 描述。由于模式是随机采样的,可能存在重复或噪声,需要识别与下游任务最相关的模式。GPM 使用 Transformer 编码器通过学习相对重要性来突出主导模式。编码过程遵循标准 Transformer 结构:

  1. 线性投影得到查询、键、值矩阵:\(Q = P W_Q\)\(K = P W_K\)\(V = P W_V\)
  2. 自注意力计算:\(\text{Attn}(P) = \text{softmax}(QK^\top / \sqrt{d_{\text{out}}}) V\)
  3. 残差连接和前馈网络:\(P' = \text{FFN}(P + \text{Attn}(P))\)

使用多头注意力提升表达能力,并可堆叠多层 Transformer 进一步增强容量。最终 Transformer 层的输出 \(P' = [p'_0, \ldots, p'_m]\) 经过平均聚合后输入预测头进行下游预测:

\[\hat{y} = \text{Head}\left(\frac{1}{m} \sum_{i=1}^{m} p'_i\right) \]

通过自注意力机制,模型可以自动学习哪些模式对当前任务最重要,实现端到端的模式选择。

训练和推理策略

测试时扩展。 Transformer编码器的自注意力模块与输入长度呈二次时间复杂度 \(O(k^2)\)。受大语言模型中测试时缩放的启发,GPM 在训练时使用 \(m\) 个模式,推理时使用 \(k\) 个模式(\(k \gg m\))。默认设置 \(m = 16\)\(k = 128\)。为进一步降低模式采样的计算开销,在预处理阶段预采样 \(k\) 个模式,训练时随机选择 \(m\) 个。模式采样的时间消耗很小,大多数数据集不到 10 秒,即使最大的数据集(约 250 万节点)在 Nvidia A40 GPU 上也不到 2 分钟。

多尺度学习。 受视觉Transformer中多尺度学习成功的启发,GPM 采样不同长度的模式,而非使用固定长度。默认多尺度长度设置为 \([2, 4, 6, 8]\),模式总数保持不变。多尺度学习融入了层次子结构知识,进一步提升了性能。

GPM 如何超越消息传递

表达能力提升。 消息传递框架可以区分 1-WL 同构测试可区分的非同构图。本文证明,在温和假设下(图是连通、无权重、无向的,且采样模式数量足够多),GPM 的表达能力超越消息传递。定理 3.4 指出,在重构猜想假设下,给定足够数量的图模式,GPM 可以区分所有非同构图对。推论3.5进一步表明,对于 \(k \geq 1\),存在使用步长 \(k\) 的游走即可被 GPM 区分但无法被 \(k\)-WL 测试区分的图。这意味着 GPM 至少与消息传递框架和高阶 GNN 具有同等的表达能力。

解决过挤压问题。 消息传递的另一个局限是侧重局部信息,无法有效捕获长距离依赖,GPM 在长距离交互建模方面表现出优越能力。在 TREENEIGHBORSMATCHING 任务上的评估显示,GPM 在任务半径达到 7 时仍能完美拟合数据,而消息传递方法在任务半径 4 时就开始出现过挤压效应。

实验结果

数据集和实验设置

实验使用的数据集信息如下:

任务类型 数据集数量 数据集名称 说明
节点分类 9 Products, Computer, Arxiv, WikiCS, CoraFull, Deezer, Blog, Flickr, Flickr-S 同配性比率范围:0.24 – 0.81,覆盖不同规模和同配性水平
链路预测 3 Cora, Pubmed, ogbl-Collab
图分类 & 图回归 6 IMDB-B, COLLAB, Reddit-M5K, Reddit-M12K, ZINC, ZINC-Full 社交网络 + 分子图

使用的对比算法用:

方法类别 代表方法 数量
经典 GNN GCN, GAT, APPNP 3 个
先进 GNN GPRGNN, OrderedGNN, RAW-GNN, RUM 4 个
图 Transformer GraphGPS, SAN, NodeFormer, GOAT, NAGphormer, GraphMamba, VCR-Graphormer, GCFormer 8 个

对比实验

节点分类性能

节点分类结果如表所示,GPM 在全部 9 个数据集上均取得最优性能,全面超越所有基线方法。在同配性较高的数据集上,GPM 同样保持优势。Products 数据集上 GPM 达到 82.62% 的准确率,比 GOAT 的 82.00% 提升 0.62 个百分点。Computer 数据集上达到 92.28%,比 OrderedGNN 的 92.03% 提升 0.25 个百分点。在异配性数据集上提升更为显著。Blog 数据集(同配性 0.40)上 GPM 达到 96.71%,比 GCFormer 的 96.03% 提升 0.68 个百分点。Flickr 数据集(同配性 0.32)上达到 52.22%,比 GCN 的 50.90% 提升 1.32 个百分点。Flickr-S(同配性 0.24)上达到 89.41%,比 OrderedGNN 的 88.68% 提升 0.73 个百分点。
image

值得注意的是,GraphGPS 和 SAN 等图 Transformer 方法在多个数据集上出现内存溢出(OOM),而 GPM 可以高效处理所有数据集,体现了良好的可扩展性。

链路预测性能

链路预测结果如表所示,GPM 在三个数据集上均取得最优性能。Cora 数据集上达到 92.85% 的 AUC,比 LLP 的 89.95% 提升 2.9 个百分点。Pubmed 上达到 88.29%,比 LLP 的 87.23% 提升约 1 个百分点。ogbl-Collab 上达到 49.70%,比 LLP 的 49.10% 提升 0.6 个百分点。这一结果可能归因于捕获的模式有效反映了节点之间的连接性。
image

图分类和回归性能

图分类和回归结果如表所示,GPM 在所有 6 个数据集上一致优于所有其他方法,尤其优于同样使用图模式作为 token 的方法(如 GMT、SAT、GraphViT)。这可能是因为这些方法仍然依赖消息传递作为单个模式的编码器,从而继承了消息传递的局限性。具体来看,IMDB-B 上 GPM 达到 82.67%,比 RUM 的 81.10% 提升 1.57 个百分点。COLLAB 上达到 80.70%,比 GMT 的 78.94% 提升 1.76 个百分点。Reddit-M5K 上达到 51.87%,比 SAN 的 50.76% 提升 1.11 个百分点。Reddit-M12K 上达到 43.07%,比 SAT 的 42.14% 提升 0.93 个百分点。
image

分子回归任务上,ZINC 上 GPM 达到 0.064 的 MAE,优于 GPS 的 0.070 和 GraphViT 的 0.073。ZINC-Full 上达到 0.021,优于 Graphormer 的 0.025 和 GraphViT 的 0.035。

分布外泛化

分布外(OOD)泛化结果如表所示,GPM 在 ACM→DBLP 和 DBLP→ACM 两个迁移任务以及 Twitch 数据集上均表现出色。GPM 单独使用时在 A→D 任务上达到 74.91%,比 StruRW 的 70.19% 提升 4.72 个百分点。结合 DANN 和 SSReg 等 OOD 方法后性能进一步提升,GPM+SSReg 在 A→D 上达到 75.66%,在 D→A 上达到 67.30%,在 Twitch 上达到 62.77%,均为最优结果。这表明 GPM 学习到的模式表示具有良好的泛化能力。
image

可扩展性分析

大规模图。 GPM 的复杂度为 \(O(k^2)\) 的模式内复杂度和 \(O(n \cdot k^2)\) 的整体复杂度(\(n \gg k^2\) 为实例数量),使 GPM 可以通过小批量训练高效扩展到大规模图。在 Products、ogbl-Collab 和 ZINC-Full 等大规模基准上,GPM 均取得了有竞争力的性能。

模型缩放。 借助 Transformer 架构,GPM 可以通过堆叠更多 Transformer 层自然扩展到更大的模型尺寸。图(顶部)显示,增加模型参数在大规模图上带来了性能提升。消息传递 GNN(以 GAT 为例)由于过平滑效应,难以随模型规模扩大而持续提升性能。

分布式训练。 Transformer 由于自注意力机制的并行化特性,在分布式训练中效率很高。消息传递 GNN 的分布式训练则面临通信开销大等挑战。图(底部)显示,随着 GPU 数量增加,GPM 的加速比优于 GNN,在多 GPU 场景下效率优势更加明显。

image

消融实验

模型组件消融。 表展示了各组件的消融结果。位置嵌入(PE)和匿名路径(AP)都对捕获拓扑信息有贡献,PE 编码相对节点位置,AP 表征模式结构。实验中 AP 的影响大于 PE,说明模型更看重模式结构的理解而非节点位置。移除两者导致性能下降最大。语义路径(SP)编码器中,Transformer 效果最优,因其可以自适应建模局部和长距离依赖。
image

训练策略消融。 多尺度训练和测试时增强都有助于提升性能。多尺度训练通过融入层次子结构知识将平均准确率从 70.72 提升到 72.34。测试时增强在训练时使用较少模式(16个)、推理时使用更多模式(128个),显著降低训练成本,性能下降很小(从 72.43 降到 72.34)。

采样策略分析。 图展示了不同随机游走采样策略的效果。无偏随机游走(\(p=1, q=1\))取得了最佳结果,优于偏向局部的采样(\(p=0.1, q=10\))和偏向长距离的采样(\(p=10, q=0.1\))。这说明 GPM 可以利用 Transformer 的自注意力自动平衡局部和长距离依赖,无需手动调整采样偏置。

image

模型可解释性

GPM 利用自注意力识别与下游任务最相关的模式,通过 class token 聚合模式信息。图以 ZINC 数据集中第 24 个分子为例,展示了其 top-9 关键模式,GPM 有效捕获了分子中星形和环形等拓扑上重要的结构。这些结果验证了 GPM 增强的可解释性,模型学习到的主导模式与领域知识一致。
image

优点和讨论

个人认为,本文有如下一些优点和创新点可供参考学习:

  1. 本文没有基于消息传递范式展开,从图模式的角度重新思考图表示学习。现有大多数超越消息传递的工作都可以看作消息传递的扩展或补充,而 GPM 通过随机游走采样、序列编码、注意力选择,从子结构模式出发构建表示学习框架。
  2. 随机游走、匿名路径的图模式建模方式简洁有效,且有理论支撑。语义路径捕获节点特征,匿名路径捕获拓扑结构,两者分别编码后融合,覆盖了图的属性信息和结构信息。理论上也证明了匿名路径分布足以表征节点拓扑性质,为方法提供了理论基础。
  3. 测试时扩展(训练少、推理多)和多尺度学习等工程技巧设计实用,多尺度模式采样融入层次子结构知识,进一步提升了模型能力。理论分析全面,从表达能力和长距离依赖两个维度证明了 GPM 超越消息传递的优势。

随机游走是图机器学习领域早期使用的范式,当图神经网络、图 Transformer 等架构被提出之后,已被较少关注。这篇论文重新审视了随机游走,并通过理论推导,充分使用了语义路径和匿名路径信息进行建模,规避了消息传递范式的不足,实现了更优越的性能,是一种“老药新用”式的研究。其他的模块设计都是一些相应的 Transformer 架构的设计,是建立在上述机制的具体设置。总的来说,这篇论文很有启发性,提出的新思路可以考虑进一步深化。

posted @ 2026-09-06 02:26  乌漆WhiteMoon  阅读(13)  评论(0)    收藏  举报