Paper Reading:ScaleGNN: Towards Scalable Graph Neural Networks via Adaptive High-order Neighboring Feature Fusion
Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。
| 论文概况 | 详细 |
|---|---|
| 标题 | 《ScaleGNN: Towards Scalable Graph Neural Networks via Adaptive High-order Neighboring Feature Fusion》 |
| 作者 | Xiang Li, Jianpeng Qi, Haobing Liu, Yuan Cao, Guoqing Chao, Zhongying Zhao, Junyu Dong, Xinwang Liu, Yanwei Yu |
| 发表会议/期刊 | The ACM Web Conference |
| 发表年份 | 2026 |
| 会议/期刊等级 | CCF-A |
| 论文代码 | https://github.com/lx970414/ScaleGNN |
作者单位:
- Ocean University of China, Qingdao, China(中国海洋大学)
- Harbin Institute of Technology, Weihai, China(哈尔滨工业大学(威海))
- Shandong University of Science and Technology, Qingdao, China(山东科技大学)
- School of Computer, National University of Defense Technology, Changsha, China(国防科技大学)
研究动机
图神经网络通过消息传递机制捕获节点间的复杂关系,在节点分类、链路预测、异常检测和推荐系统等任务上取得了成功。随着数字基础设施的发展,百万甚至十亿级节点和边的图已成为常态,对 GNN 的表达能力和计算可扩展性提出了更高要求。现有研究在可扩展性和过平滑两个挑战上仍未给出令人满意的解决方案。
在可扩展性方面,现有方法主要分为两类。采样型方法如 GraphSAGE 和 Cluster-GCN 通过选择邻居子集来控制计算成本,但不完整的采样可能丢失重要的结构信息。预计算型方法如 SGC、SIGN 和 GAMLP 将邻域聚合与参数学习解耦,允许特征传播预先计算,大幅加速训练和推理,但在融合多跳信息时往往缺乏自适应能力。近期的高阶 GNN 如 S2GC、GBP 和 RpHGNN 通过整合高阶邻居信息来扩大感受野,但高阶邻居的数量随跳数指数增长,导致冗余计算和信息聚合过度。
在过平滑方面,随着消息传递层数增加,节点表示趋于相似并丧失区分能力。残差连接、跳跃连接和解耦传播等技术在一定程度上缓解了这一问题,但往往引入额外计算复杂度或无法有效平衡局部和全局信息。即插即用模块如 RMask 通过噪声掩码或随机游走邻居选择来减少冗余,但仍然继承了基础模型的聚合方案,缺乏对不同跳数信息的自适应有效融合。
综上所述,现有方法在可扩展性和过平滑之间存在难以兼顾的困境,本文针对这一不足,提出了一种通过自适应融合多跳图特征来实现可扩展图学习的框架 ScaleGNN,在降低计算复杂度的同时缓解过平滑问题。
文章贡献
针对大规模图上 GNN 面临的可扩展性和过平滑两大挑战,本文提出了一种可扩展的图神经网络框架 ScaleGNN,通过自适应融合多跳节点特征来实现高效且有效的图学习。ScaleGNN 包含三个主要模块:自适应高阶特征融合模块通过计算每跳纯邻居矩阵来隔离各跳的独有结构信号,并引入可学习权重动态调整不同跳数邻域的贡献;低阶增强特征聚合模块将低阶和高阶特征显式分离后融合,通过可学习平衡因子确保局部细节和全局关联的兼顾;高阶冗余特征掩码模块基于局部贡献评分(LCS)对高阶邻居进行重要性评估,选择性掩码低相关性邻居并施加可学习稀疏约束来剪枝冗余信息。在六个真实世界数据集上的实验表明,ScaleGNN 在预测精度和计算效率上均优于现有 GNN 方法,在十亿级边的 ogbn-papers100M 数据集上 Micro-F1 达到 65.69%,同时训练时间仅为最强基线的几分之一。
本文方法
ScaleGNN 的整体框架如图所示,包含三个模块:自适应高阶特征融合负责构建多跳纯邻居矩阵并加权融合,低阶增强特征聚合负责分离并平衡低阶和高阶特征,高阶冗余特征掩码负责基于 LCS 剪枝低相关性的高阶邻居。三个模块协同工作,在单次卷积过程中完成多跳特征融合,显著提升计算效率。

自适应高阶特征融合
传统 GNN 通过固定邻接矩阵进行消息传递,随着网络深度增加容易导致过平滑。本文提出为每个跳数构建独立的纯邻居矩阵,隔离各跳特有的关系信号。定义第 \(i\) 跳纯邻接矩阵 \(\mathbf{A}_i\) 为第 \(i\) 跳和第 \(i-1\) 跳邻接矩阵的差:
其中 \(\mathbf{A}^i\) 捕获最多 \(i\) 跳的连接,\(\mathbf{A}_i\) 隔离了第 \(i\) 跳新出现的关系,\(K\) 是最大跳数。\(\mathbf{A}^1\) 和 \(\mathbf{A}_1\) 均为图的邻接矩阵,\(\mathbf{A}^0\) 是零矩阵。在得到各跳纯邻居矩阵后,引入可学习权重集合 \(\boldsymbol{\alpha} = [\alpha_1, \alpha_2, \ldots, \alpha_K]\) 来加权融合各跳信息:
权重通过反向传播学习,使用 softmax 函数优化以保证各跳贡献的平衡。基于融合邻接矩阵得到自适应高阶融合嵌入矩阵:
其中 \(d_f\) 是隐藏嵌入维度,\(\mathbf{X} \in \mathbb{R}^{|V| \times f}\) 是输入特征矩阵,\(\mathbf{W} \in \mathbb{R}^{f \times d_f}\) 是高阶特征的可学习权重矩阵,\(\sigma(\cdot)\) 是激活函数。该模块通过单次卷积完成多跳特征融合,避免了传统 GNN 堆叠多层带来的计算开销。仅使用该模块的简化版本记为 ScaleGNN\(_b\),作为模型的基线版本。
低阶增强特征聚合
在多跳信息融合中,高阶特征可能主导低阶特征,削弱模型保留细粒度局部信息的能力。本文通过显式分离低阶和高阶特征后再融合来解决这一问题。低阶特征矩阵和高阶特征矩阵分别计算如下:
其中 \(\mathbf{W}_{\text{low}}, \mathbf{W}_{\text{high}} \in \mathbb{R}^{f \times d}\) 分别是低阶和高阶特征的可学习权重矩阵。低阶特征使用 2 跳邻接矩阵 \(\mathbf{A}^2\) 来捕获局部结构,高阶特征使用融合邻接矩阵 \(\tilde{\mathbf{A}}\) 来捕获全局关联。最终节点表示通过可学习平衡因子 \(\beta\) 加权求和:
其中 \(\beta\) 是超参数,使模型能够根据具体任务和图结构动态调整局部和全局信息的比例。分离和融合过程增强了模型同时捕获细粒度局部细节和宏观全局模式的能力。
高阶冗余特征掩码
高阶邻居引入的信息多样但可能冗余,缺乏有效掩码机制时会引入噪声,稀释信息信号。本文提出基于局部贡献评分(LCS)的方法来选择最相关的邻居并掩码冗余的高阶邻居。LCS 借鉴缩放点积注意力机制的思想,通过考虑结构相似性和特征对齐来量化邻居节点的重要性。对于节点 \(v\) 及其第 \(i\) 跳邻居 \(u\),LCS 值定义为:
其中 \(\mathbf{x}_v, \mathbf{x}_u \in \mathbb{R}^f\) 分别是目标节点 \(v\) 和邻居 \(u\) 的输入特征向量,\(\mathbf{W}_1, \mathbf{W}_2 \in \mathbb{R}^{d_f \times f}\) 是将特征映射到注意力空间的可学习投影矩阵,\(d_f \leq f\) 保证了计算效率,\(\mathcal{N}_i(v)\) 表示由 \(\mathbf{A}_i\) 诱导的节点 \(v\) 的第 \(i\) 跳邻域。分母使用 softmax 函数在每个局部 \(i\) 跳邻域内归一化注意力分数。
\((W_1 x_v)^\top (W_2 x_u)\) 用于衡量目标节点 \(v\) 和第 \(i\) 跳邻居 \(u\) 在注意力空间的相似度,除以 \(\sqrt{d_f}\) 用于防止点积过大并稳定梯度。softmax 把分数归一化成概率分布,表示在 \(v\) 的所有第 \(i\) 跳邻居中,\(u\) 的相对重要性。LCS 越大,说明这个高阶邻居对 \(v\) 越相关、有用。
计算 LCS 后,为每个节点保留其第 \(i\) 跳邻居中 LCS 值最高的前 \(m_i\) 个:
其中 \(\text{Top}_{m_i}(\cdot, \cdot)\) 保留 \(\mathbf{A}_i\) 中每行得分最高的 \(m_i\) 个条目。\(m_i\) 是可学习参数,模型通过学习不同的 \(m_i\) 值来自适应控制不同跳数的邻居采样数量。该机制确保只有信息量最大的高阶邻居贡献到最终节点表示,有效抑制噪声并增强嵌入稳定性。
联合优化
ScaleGNN 的优化框架包含三个损失分量。节点分类任务使用标准交叉熵损失:
为缓解过平滑,对高阶特征传播施加稀疏约束:
其中 \(\bar{\mathbf{A}}_i^{\text{filter}} = \mathbb{I}[\mathbf{A}_i^{\text{filter}} > 0]\) 是过滤后高阶邻接矩阵的指示矩阵,\(\|\cdot\|_1\) 表示 L1 范数,约束模型最小化每跳每个节点保留的邻居数量。
这一项用于统计每一跳保留下来的邻居总数,用 L1 范数鼓励越少越好。防止模型把所有邻居都保留下来,显式控制计算量和稀疏度。
为引导模型选择有意义的高阶邻居,引入基于 LCS 的正则化:
其中 \(\mathcal{N}_i^{\text{select}}(v)\) 是未被过滤的保留邻居节点。该损失项强制高阶邻居的选择基于其 LCS 值,减少噪声或冗余邻居的影响。
这一项的含义是对被保留下来的高阶邻居,希望它们的 LCS 尽量接近 1。如果 LCS 很小却被保留了,平方误差会很大,模型会被惩罚。这样可以促使模型认真挑有用的邻居,而不是随机选几个凑数。
最终优化目标为:
其中 \(\lambda_1\) 和 \(\lambda_2\) 是平衡正则化与主任务目标的超参数。稀疏约束在每跳高阶邻居选择过程中使模型在保留关键特征和抑制冗余信息之间取得平衡。
实验结果
数据集和实验设置
本文在六个真实世界图数据集上进行了实验,包括三个小规模数据集(Citeseer、Cora、Pubmed,均为引文网络)和三个大规模数据集(ogbn-arxiv、ogbn-products、ogbn-papers100M)。其中 ogbn-papers100M 包含超过 1.11 亿个节点和 16.16 亿条边,是目前 GNN 评估中规模最大的基准之一。数据集统计信息如表所示。

评价指标为 Micro-F1 和 Macro-F1,对比方法分为三类:
| 类别 | 模型 |
|---|---|
| 传统 GNN | R-GCN、Cluster-GCN、HetGNN、HAN、MAGNN、Simple-HGN、HINormer |
| 深度 GNN | SIGN、S2GC、GBP、GAMLP、GRAND+、LazyGNN |
| 可扩展 GNN | NARS、SeHGNN、RpHGNN、TOP |
预测性能对比
本文在六个数据集上与三类基线方法进行了比较,结果表所示。ScaleGNN 在所有六个数据集上的 Micro-F1 和 Macro-F1 指标均显著优于全部基线方法,且结果通过 t 检验(\(p < 0.01\))验证了统计显著性。

传统 GNN 方法在小规模数据集上表现良好,但在大规模图上多数方法遇到内存溢出(OOM)问题。R-GCN、HAN、Simple-HGN 和 HINormer 能在 ogbn-arxiv 上运行,在 ogbn-products 和 ogbn-papers100M 上均无法完成实验。深度 GNN 方法通过更深的网络和缓解过平滑的技术在大规模图上表现优于传统方法,但堆叠数十层 GNN 带来了显著的计算复杂度。可扩展 GNN 方法通过预计算技术提升了效率,在性能和效率之间取得了一定平衡。
ScaleGNN 在大规模数据集上的提升尤为显著。在 ogbn-arxiv 上 Micro-F1 达到 73.25%,比最强基线 TOP 的 73.11% 提升 0.14 个百分点;在 ogbn-products 上达到 81.82%,比 TOP 的 80.93% 提升 0.89 个百分点;在 ogbn-papers100M 上达到 65.69%,比 ScaleGNN\(_b\) 的 63.97% 提升 1.72 个百分点,比最强基线 TOP 的 63.95% 提升 1.74 个百分点。基线版本 ScaleGNN\(_b\) 仅保留自适应高阶特征融合模块,性能已接近 SOTA 方法,且运行效率远超所有基线。
效率分析
在三个大规模数据集上比较了 ScaleGNN 和 ScaleGNN\(_b\) 与 S2GC、GBP、GAMLP、RpHGNN 的总运行时间,结果如图所示。ScaleGNN\(_b\) 在所有数据集上运行时间最短,ScaleGNN 紧随其后。在 ogbn-papers100M 数据集上,ScaleGNN\(_b\) 仅需 4110.2 秒完成模型运行,S2GC 需 19914.4 秒,GBP 需 35706.1 秒,GAMLP 需 35656.6 秒,RpHGNN 需 10399.8 秒。ScaleGNN\(_b\) 相比最优基线减少了 4.1 倍到 6.7 倍的运行时间。GBP 和 GAMLP 的运行时间在某些情况下超过 ScaleGNN\(_b\) 的 6 倍,RpHGNN 在大规模数据集上比 ScaleGNN\(_b\) 慢 2.5 倍到 3.1 倍。效率提升得益于选择性邻居聚合和自适应特征扩散机制,减少了冗余计算。

过平滑缓解分析
本文在 ogbn-products 和 ogbn-papers100M 上比较了 ScaleGNN 与 S2GC、GBP、GAMLP、RpHGNN 在不同传播深度下的性能,结果如图所示。传统 GNN 随传播层数增加出现显著性能下降,S2GC、GBP 和 GAMLP 在中等深度(约 8 到 12 层)达到峰值性能,超过该范围后迅速退化,深层传播导致过度聚合从而丧失节点特征的区分能力。ScaleGNN 展现了更稳定的性能曲线,在 30 层深度仍保持较高的 Micro-F1 分数,优于全部基线方法。态平衡局部和全局特征的自适应聚合机制、选择性整合高阶邻居并控制其影响的扩散机制、基于 LCS 优先选择信息性邻居以减少噪声和冗余的掩码机制,这些策略使 ScaleGNN 在深层架构中仍能保持丰富的节点表示。

消融实验
本文在三个大规模数据集上对 ScaleGNN 的四个组件进行了消融实验,设计了四个变体:w/o Ada 移除自适应高阶特征融合模块并使用 S2GC 获取图表示,w/o Low 移除低阶增强特征聚合,w/o LCS 移除高阶冗余特征掩码,w/o SC 移除稀疏约束。
| 缩写 | 含义 |
|---|---|
| w/o Ada | 移除自适应高阶特征融合模块并使用 S2GC 获取图表示 |
| w/o Low | 移除低阶增强特征聚合 |
| w/o LCS | 移除高阶冗余特征掩码 |
| w/o SC | 移除稀疏约束 |
结果如表所示。w/o Ada 变体性能下降最大,在 ogbn-arxiv 上 Micro-F1 下降 3.07%,在 ogbn-products 上下降 2.07%,在 ogbn-papers100M 上下降 1.24%,说明自适应高阶特征融合是捕获结构依赖和缓解信息损失最关键的模块。w/o Low 变体在 ogbn-arxiv 和 ogbn-papers100M 上分别下降 1.33% 和 0.72%,表明低阶增强特征聚合对维护局部信息很重要。w/o LCS 变体在三个数据集上均有中等程度下降,说明高阶冗余特征掩码在减少冗余和防止过度特征混合方面有效。w/o SC 是所有变体中性能最好的,仍然低于完整的 ScaleGNN,说明基于 LCS 的稀疏约束在提升泛化能力和可扩展性方面发挥重要作用。自适应高阶特征融合对性能提升贡献最大,其次是低阶增强特征聚合和高阶冗余特征掩码。

参数敏感性分析
本文对平衡超参数 \(\beta\) 和损失权重 \(\lambda_1\)、\(\lambda_2\) 进行了敏感性分析。对于 \(\beta\),性能随 \(\beta\) 增加而提升,在 \(\beta = 0.5\) 时达到峰值,此后继续增加 \(\beta\) 导致性能下降,过度强调高阶信息可能引入噪声或冗余。\(\beta = 0.5\) 表明低阶和高阶信息的等权平衡是最优选择。

对于 \(\lambda_1\),ScaleGNN 在 \(\lambda_1 = 0.005\) 时取得最佳性能,在此点之前性能逐步提升,之后下降,反映出适度正则化的益处。对于 \(\lambda_2\),性能在 \(\lambda_2 = 0.01\) 时达到峰值且波动较小,说明其在维持模型稳定性方面的作用。\(\lambda_1\) 需要精确调整以获得最优结果,\(\lambda_2\) 则保证了模型的鲁棒性,两个损失项互补地平衡性能和效率。

性能与效率权衡分析
本文分析了 ScaleGNN 和 ScaleGNN\(_b\) 在不同跳数设置下的运行时间和 Micro-F1 分数,结果如图所示。ScaleGNN 在所有跳数设置下的计算成本均高于 ScaleGNN\(_b\),两种方法的运行时间都随跳数增加而上升。ScaleGNN 在 Micro-F1 分数上始终优于 ScaleGNN\(_b\),两种方法都从跳数增加中受益,超过某一点后性能收益递减,远距离节点的冗余或噪声信息开始产生负面影响。ScaleGNN 适合精度优先的任务,ScaleGNN\(_b\) 适合资源受限的环境,模型选择应根据实际约束决定。

优点和讨论
个人认为,本文有如下一些优点和创新点可供参考学习:
- 纯邻居矩阵的设计简洁有效,通过相邻跳数邻接矩阵的差分运算隔离各跳独有的结构信号,避免了传统多跳聚合中信息的重复叠加,这种构造使得每跳的贡献可以被独立评估和加权。
- 将低阶和高阶特征显式分离后再融合的策略,解决了多跳融合中高阶特征主导低阶特征的问题。可学习平衡因子 \(\beta\) 使模型能够根据任务和图结构动态调整局部与全局信息的比例。
- 基于注意力机制的局部贡献评分(LCS)为高阶邻居筛选提供了可微且任务驱动的评估方式,它同时考虑结构相似性和特征对齐,配合可学习稀疏约束在每跳自适应控制保留邻居数量,在减少噪声和冗余的同时保留了信息性高阶邻居。
这篇论文的核心在于为不同阶数的邻居关系构造不同的邻接矩阵。相比于其他工作,这个操作非常地巧妙,既然不同阶数的特征会相互作用,那我就直接让模型只看一种阶数的信息。从理论介绍和实验结果可以看出,这样不仅能提取出有益于决策的信息,在运行效率等方面也有明显的优势。其他的模块和损失函数都是围绕这个机制展开,都是为了更好地利用这种信息,或者规避这种处理带来的负面影响。总的来说,这篇论文兼具技巧性和启发性,是不错的工作。

浙公网安备 33010602011771号