Paper Reading:Forest-based Graph Learning for Semi-Supervised Node Classification


Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。

论文概况 详细
标题 《Forest-based Graph Learning for Semi-Supervised Node Classification》
作者 Jin Li, Shenghao Gao, Kaichen Zhang, Xinlong Chen, Ying Sun, Hui Xiong
发表会议/期刊 International Conference on Learning Representations(ICLR)
发表年份 2026
会议/期刊等级 CCF-A
论文代码 https://anonymous.4open.science/r/FGL/

作者单位:

  1. Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)
  2. College of Computer and Data Science, Fuzhou University
  3. The Hong Kong University of Science and Technology (Hong Kong SAR)

这篇论文概念和公式用的比较多,我同样用引用框写一下我的理解。

研究动机

图神经网络在节点分类、图分类、链路预测等任务上取得了广泛成功,但大多数 GNN 将感受野限制在 2 到 3 跳的局部邻域内,仅关注近距离信息聚合,忽略了远距离知识。这在实际应用中存在局限,例如当图中节点密度或度分布不平衡时,部分节点的局部信息不足,在图异质性条件下问题更加严重,而标签稀缺进一步加剧了过拟合风险。为了实现远距离信息交互,现有工作主要分为两类架构:

  1. 深度局部模型:通过堆叠多个局部聚合层来扩展全局感受野,每个层只考虑一阶信息。这类方法的逐层顺序计算限制了并行性,时间和空间复杂度较高,还面临过平滑风险。
  2. 浅层全局模型:如全局图 Transformer,通过一两个非局部聚合算子在单层内封装所有节点对的交互。这类方法虽然能实现快速全局通信,但通常产生二次方复杂度。近期一些工作尝试通过自适应选择或图重连等稀疏化技术来缓解复杂度,但它们要么牺牲全局覆盖范围,要么依赖复杂的选样策略,存在丢失重要节点交互的风险。

现有范式都将图视为多种结构的融合,总代价可以分解为:Total cost = (cost per structure) × (number of structures)。当使用局部基元,如一阶邻域或短随机游走建模时,单个结构的代价低,但覆盖长距离需要大量结构。当使用全局算子时,结构数量减少了,但每个结构的代价因密集的成对交互而急剧上升。

生成树是连接所有节点的最小子图,在有限结构数量下,生成树是实现全局覆盖的最简单结构,因此更适合长距离传播。由于单棵生成树可能不足以捕获所有拓扑知识,本文进一步提出使用森林(多棵树的集合)来捕获互补的拓扑路径。
image

传统 GNN 有一些局限性,例如 GCN/GAT 通常只聚合 1 跳或 2 跳邻居,想处理远处节点的信息就得堆很多层,容易过平滑、难并行。Graph Transformer 在任意两个节点上直接算注意力,信息全,但复杂度 O(N²),在大图上很容易 OOM。本文认为生成树(Spanning Tree)是连接 N 个节点的最少边数结构(N-1 条),它天然连通全图且没有冗余边。如果在生成树上做消息传递,一条消息从节点 A 到节点 B 最多走树深步就能覆盖全图,就能实现全局感受野和低成本权衡。但是一棵树可能不够表达图的全部拓扑,所以作者采样多棵树(森林 Forest),每棵侧重不同路径最后再进行融合。

文章贡献

针对图学习中全局感受野与计算效率之间的权衡,本文提出了一种基于森林的图学习范式 FGL,将图上的信息传播建模为在生成树森林上的传输。FGL 包含四个组件:预处理器通过伪标签增强原图连通性并提升同质性,树采样器基于同质性估计器通过加权 Wilson 算法生成偏向高同质性树的分布,树聚合器通过两次递归在单棵树上以线性时间实现二次方节点对交互,树融合器通过均值操作合并来自不同树的全局信息并补充局部知识。本文在理论上证明了同质性估计器精度与生成树分布质量之间的渐近关系,表明提升估计器精度可证明地产生更优的树分布。实验结果表明,FGL 在 9 个数据集上的平均排名为 1.22,相对于 GCNII 和 DIFFormer 分别获得 11.90% 和 16.14% 的平均相对提升,同时在训练效率上也具有显著优势。

本文方法

在半监督节点分类任务中,部分节点 \(V_L \subset V\) 具有标签 \(y_i \in \{0, 1, \dots, c-1\}\),其余节点无标签。目标是学习节点嵌入 \(H'' \in \mathbb{R}^{n \times d}\),使得简单的线性预测器可以预测所有节点的标签。FGL 框架由四个步骤组成:预处理、树采样器、树聚合器和树融合器,整体流程如图所示。
image

预处理器

真实图往往不连通,这会阻碍后续的生成树采样。预处理器首先为每个节点计算伪标签 \(Y' \in \mathbb{R}^{n \times c}\)。对于异质图,使用前馈层 \(Y' = \sigma(XW)\);对于同质图,使用 GCN 层 \(Y' = \sigma(\hat{A}XW)\)。其中 \(W \in \mathbb{R}^{d \times c}\) 为可学习参数,在标注节点上通过交叉熵损失优化。随后利用伪标签构建增强图 \(\hat{G}\)。对每个节点,使用其伪标签表示 \(y'_i \in \mathbb{R}^{1 \times c}\) 找到其 \(k\) 近邻,如果对应边不存在则添加新边。该步骤同时实现两个目标:

  1. 确保图连通性以支持后续生成树采样;
  2. 提升同质性比例,即连接相似类别标签节点的边占比,已有研究表明同质性比例的提升有助于改善半监督节点分类性能。

现实图经常不连通,例如存在孤立点时没法直接采生成树。本文的做法是用简单 MLP(异配图)或 GCN(同配图)先对节点过一遍,得到伪标签(pseudo-label)。对每个节点,找特征/KNN 最近的 k 个节点,如果原图没边就加上一条边。这部分的目的是让图连通,同时让新加的边更可能连接同类节点,提高同配性。

树采样器

树采样器的目标是从图 \(\hat{G}\) 中采样若干棵生成树,构成一个高质量的森林。采样过程需要遵循两个原则。一是同质性比率,因为目标是节点分类,同质性是图上的关键度量,可以自然地迁移到树上。二是多样性,如果多棵树高度重叠,森林会退化为单棵树,可能不足以覆盖图的全部拓扑知识。本文期望从偏向高同质性树的分布 \(P_{\hat{G}}(T)\) 中独立采样树。假设每棵树 \(T\) 有一个分数 \(s(T)\),定义为边分数的乘积,树分布定义为:

\[P_{\hat{G}}(T) = \frac{s(T)}{\sum_{T \subseteq \hat{G}} s(T)} = \frac{\prod_{e \in T} s(e)}{\sum_{T \subseteq \hat{G}} \prod_{e \in T} s(e)} \]

边分数 \(s(e)\) 的确定是关键。本文的核心思路是给同质边(连接同类标签节点的边)赋予高分,给异质边赋予低分。为此引入同质性估计器,通过局部注意力机制实现:

\[\alpha_{i \to j} = \frac{\exp\left(\frac{Q_i K_j^\top}{\sqrt{c}}\right)}{\sum_{v \in N(i)} \exp\left(\frac{Q_i K_v^\top}{\sqrt{c}}\right)}, \quad \forall i, j \in V \]

其中 \(Q = XW_Q\)\(K = XW_K\)\(V = XW_V\)\(W_Q, W_K, W_V \in \mathbb{R}^{d \times c}\) 为可学习参数,\(N_i\) 为节点 \(i\) 的一阶邻域。通过在伪标签 \(Y'\) 上最小化交叉熵损失训练该局部图注意力。边 \(e=(i,j)\) 的分数定义为 \(s(e) = (\alpha_{i \to j} + \alpha_{j \to i}) / 2\)。最终,树采样器通过 Wilson 算法从 \(P_{\hat{G}}(T)\) 中生成 \(N_T\) 棵独立生成树,每棵树的采样时间近似为 \(O(n)\)

由于同类节点更容易连通在同一棵树上,所以想采样出同配边多、异配边少的树,这样消息传递更有用。实现方式是用局部图注意力,只在 1 跳邻居上算 attention,给每条边算一个分数 s(e),代表这条边像不像同配边。接着定义树分布,树 T 的概率 ∝ 所有边分数相乘(s(e₁)×s(e₂)×…×s(eₙ₋₁))。然后用 Wilson 算法(随机游走生成树算法)按这个分布采样出 N_T 棵独立生成树。Theorem 2 指出当同配边分数/异配边分数的比值 Δ→∞ 时,采样出的树边同配率会趋近理论上限,也就是说同配估计越准,采样出的树质量越高。

树聚合器

树聚合器是 FGL 的核心组件,负责在每棵生成树上高效传播全局消息。其观察是:对于树上相邻的节点 \(u\)\(v\),它们的全局聚合消息仅在一个边方向上存在差异。利用这一观察,可以基于任意满足特定性质的消息聚合器 \(f_{\text{Agg}}(\cdot)\) 实现高效的树传播。聚合器需要满足两条性质。性质 I(合并):给定两个消息集合 \(A\)\(B\),将 \(A\) 合并到 \(B\) 得到 \(S\),则:

\[f_{\text{Agg}}(S) = \mathcal{M}^+\big(f_{\text{Agg}}(B), f_{\text{Agg}}(A)\big) \]

性质 II(分解):

\[f_{\text{Agg}}(B) = \mathcal{M}^-\big(f_{\text{Agg}}(S), f_{\text{Agg}}(A)\big) \]

其中 \(\mathcal{M}^{+/-}\) 表示添加或删除向量的操作,可以通过辅助信息实现非对称性。这两条性质不牺牲 \(f_{\text{Agg}}(\cdot)\) 的通用性,许多自回归序列模型和一阶 GNN 聚合器都满足这些性质,如线性注意力、线性 RNN、状态空间模型等。

基于上述性质,定理 1 给出了通用的树聚合器。给定以 \(r\) 为根的树 \(T\),每个节点 \(v\) 具有子树 \(T_v^{(\text{sub})}\),记 \(v\) 的父节点为 \(\text{Fa}(v)\),子节点为 \(\text{Child}(v)\)\(S_v\) 表示从 \(V_v^{(\text{sub})}\) 聚合到节点 \(v\) 的消息。树聚合器通过两次递归实现,递归 I(自底向上):

\[\forall u \in V, \quad S_u = f_{\text{Agg}}\left(\{S_v\}_{v \in \text{Child}(u)} \cup \{g(H_u)\}\right) \]

递归 II(自顶向下):

\[\forall v \in V, \quad H'_v = \mathcal{M}^+\left(S_v, \quad \mathcal{M}^-\left(H'_{\text{Fa}(v)}, S_v\right)\right), \quad H'_r = S_r \]

其中 \(H, H' \in \mathbb{R}^{n \times d}\) 分别表示聚合前后的节点嵌入。递归 I 从叶子向根收集所有指向根的远距离消息,递归 II 从根向叶子传播,利用 \(\mathcal{M}^-\)\(\mathcal{M}^+\) 逐层计算各节点的全局嵌入。
image

在具体实现上,本文优先采用线性变体以保证简洁性。将 \(f_{\text{Agg}}\)\(\mathcal{M}^+\) 设为加权和,\(\mathcal{M}^-\) 设为加权差,\(g\) 设为线性变换:

\[\forall u \in V, \quad S_u = \sum_{v \in \text{Child}(u)} (\alpha_{v \to u} \cdot W_A) \cdot S_v + W_B \cdot H_u \in \mathbb{R}^d \]

\[\forall v \in V, \quad H'_v = S_v + \alpha_{\text{Fa}(v) \to v} \cdot W_A \cdot \left(H'_{\text{Fa}(v)} - \alpha_{v \to \text{Fa}(v)} \cdot W_A \cdot S_v\right) \in \mathbb{R}^d \]

其中 \(W_A, W_B \in \mathbb{R}^{d \times d}\) 为可学习矩阵,局部注意力 \(\{\alpha_{i \to j}\}\) 用于增强同质边的影响并减弱异质边的影响。

在普通图上做全局聚合是 O(N²),但在树上可以利用树结构做动态规划式递归。自底向上阶段每个节点先聚合它所有子节点的消息和自己的特征,得到子树汇总信息 Sᵤ。接着自顶向下,根节点直接拿 Sᵣ,其他节点根据父节点传下来的信息再补上自己子树的信息,得到最终 H'ᵥ。相邻节点 u、v 的全局聚合结果只差跨过这条边的那部分信息,所以可以用两个递归(Combine + Disentangle 性质)避免重复计算,实现上就是加权求和(线性注意力变体),复杂度 O(N·d),树与树之间可并行。

树融合器

树融合器负责将来自多棵树的全局信息整合为统一的节点表示。受先前工作启发,融合器首先引入一个局部模块来补充局部知识,以缓解树的局部稀疏性。局部信息 \(H\) 的计算如下:

\[H = \left(\beta_1 \cdot \hat{A}_{\hat{G}} + \beta_2 \cdot \alpha + (1 - \beta_1 - \beta_2) \cdot I_{n \times n}\right) K_L X W_H \in \mathbb{R}^{n \times d} \]

其中 \(\beta_1 + \beta_2 \leq 1\)\(K_L \leq 2\) 为超参数,\(W_H\) 为训练参数。\(\hat{A}_{\hat{G}}\) 为增强图的归一化邻接矩阵,\(\alpha\) 为注意力权重,\(I\) 为单位矩阵,通过加权组合捕获不同粒度的局部信息。融合器对 \(N_T\) 棵树的聚合结果 \(H'^{(k)}_{T}\) 逐行进行 \(L_2\) 归一化后取平均,得到全局信息:

\[H' = \text{Mean}\left(\text{RowNorm}\left(H'^{(k)}_{T}\right)\right)_{k \in [1, N_T]} \in \mathbb{R}^{n \times d} \]

最后通过残差连接平衡局部和全局信息:

\[H'' = (1 - \gamma) \cdot H' + \gamma \cdot H \]

其中 \(\gamma \in [0, 1]\) 为超参数,\(H''\) 为最终节点嵌入,送入线性预测器进行节点分类。

因为采样了多棵树,所以需要对森林的信息进行融合。对采样出的 \(N_T\) 棵树,每棵跑一遍树聚合器得到 \(N_T\) 个节点表示 {H'⁽ᵏ⁾}。每个先做 RowNorm(行归一化)​,再取平均​ 得到全局信息 H',同时用浅层 GCN/注意力(1~2 层)算一个局部信息 H 做残差。最终输出 H'' = (1-γ)·H' + γ·H,送进线性分类器,局部信息补充树结构可能丢失的细粒度邻居特征,γ 控制全局/局部平衡。

理论分析

本文在理论分析部分建立了同质性估计器精度与生成树分布质量之间的渐近关系。首先定义边分数:

  1. 如果节点 \(i\)\(j\) 标签相同,即同质边,则 \(s(e_{ij}) = p\)
  2. 如果标签不同,即异质边,则 \(s(e_{ij}) = q\)

定义分数比 \(\Delta = p/q > 0\),期望边同质性比率为

\[R_{\hat{G}}(\Delta) := \mathbb{E}_{T \sim P_{\hat{G}}^{(p,q)}} [h(T)] \]

其中 \(h(T)\) 为树 \(T\) 的边同质性比率。定理 2 给出了三个主要结论:

  1. 单调性:存在 \(\Delta_0 > 0\),当 \(\Delta > \Delta' \geq \Delta_0\) 时,\(R_{\hat{G}}(\Delta) > R_{\hat{G}}(\Delta')\)。这表明随着同质边与异质边分数比的增大,树分布逐渐向高同质性树偏移。
  2. 上界:对所有 \(\Delta \geq \Delta_0\)\(R_{\hat{G}}(\Delta) \leq 1 - \frac{\text{NHCC}(\hat{G}) - 1}{n - 1}\),其中 \(\text{NHCC}(\hat{G})\) 表示图 \(\hat{G}\) 中同质性连通分量的数量。该上界由图的内在结构决定,反映了图结构对树同质性的固有限制。
  3. 渐近紧致性:当 \(\Delta \to +\infty\) 时,\(R_{\hat{G}}(\Delta) \to 1 - \frac{\text{NHCC}(\hat{G}) - 1}{n - 1}\)。即当同质边分数远大于异质边分数时,树分布的同质性比率趋近于图结构允许的最大值。

定理 2 说明,给同质边赋予更高分数 \(p\)、给异质边赋予更低分数 \(q\) 可以驱动树分布 \(P_{\hat{G}}(T)\) 向图所允许的最大边同质性水平移动。这为本文基于同质性估计器的树采样策略提供了理论基础:估计器越准确,边分数的区分度越高(\(\Delta\) 越大),采样到的树质量越好。

实验结果

数据集和实验设置

实验在 9 个数据集上进行,涵盖同质图和异质图、小型和大型图。同质图遵循标准公开划分,Arxiv 和 Flickr 遵循 OGB 划分。

数据集 任务类型 图类型 规模
Cora 节点分类 同质图 小型
Citeseer 节点分类 同质图 小型
Pubmed 节点分类 同质图 中型
Actor 节点分类 异质图 中型
Cornell 节点分类 异质图 小型
Texas 节点分类 异质图 小型
Wisconsin 节点分类 异质图 小型
Arxiv 节点分类 同质图 大型
Flickr 节点分类 同质图 大型

共选取 26 种对比方法,覆盖经典方法、GNN、深度 GNN、图 Transformer 和 Mamba 五大类。所有实验运行十次不同初始化,报告平均准确率及标准差。效率对比报告每轮训练时间(秒)。

方法 类型
MLP 经典基线
GCN, GAT, GraphSAGE, SuperGAT, APPNP, ClusterGCN, GraphSAINT GNN
Pairnorm, Nodenorm, Meannorm, DropEdge, GCNII, ShadowGNN 深度 GNN
GT, SAN, Graphormer, ANS-GT, NodeFormer, GOAT, NAGphormer, Exphormer, SGFormer, DIFFormer, TDGNN 图 Transformer
GraphMamba Mamba

主要对比实验

实验结果如表所示,FGL 在 9 个数据集上的平均排名为 1.22,显著优于所有对比方法。相对于图 Transformer、DIFFormer、GCN 和 GCNII,平均准确率分别相对提升 16.2%、16.1%、24.5% 和 11.9%。在异质图数据集上优势更为明显,以 Wisconsin 为例,相对于 GT、DIFFormer、GCN 和 GCNII 分别获得 20.2%、35.0%、50.7% 和 22.7% 的相对提升。这些性能提升归因于 FGL 有效捕获了远距离知识,验证了基于森林的范式在标签稀缺条件下的潜力。
image

消融实验

消融实验结果如表所示,共考察五种变体。移除全局子模块后,各数据集性能均显著下降,验证了树聚合器的长距离建模能力。移除局部子模块后性能也有所下降,说明补充局部知识的重要性。使用均匀树采样代替同质性引导采样的结果劣于完整方法,而仅使用单棵同质性引导树的结果也低于完整方法,说明多棵树融合能持续提供收益。完整 FGL 在所有数据集上均优于各变体,证实每个组件的贡献。消融实验还发现单棵同质性引导树的效果优于多棵随机树,强调同质性引导的树采样比单纯增加树数量更重要。
image

效率对比

效率对比结果如表所示,FGL 在大多数场景下训练速度快于基线方法。在小图上每轮训练时间低于 0.02 秒,在 Arxiv 上为 0.246 秒。相比 ANS-GT 和 GOAT 等图 Transformer 在小图上需要超过 1 秒、在大图上需要数十秒,FGL 有显著优势。即使对比 DIFFormer 和 GCNII 等高效方法,FGL 也实现了 2 到 5 倍加速。少数训练速度更快的基线方法性能通常不如 FGL,因为它们因过度简化设计忽略了关键结构知识。与性能相当的基线相比,FGL 具有最高的效率,凸显了线性复杂度和高并行性的优势。
image

同质性估计器对比

如表所示,本文比较了六种同质性估计器变体。使用注意力估计器的 FGL 与独立的注意力估计器性能相当或更优,说明 FGL 通过结构化树聚合有效利用了同质性分数。两阶段估计(先用非注意力模块生成伪标签,再用注意力估计器)在大多数情况下显著优于仅使用注意力估计器的 FGL,证实伪标签提供了有价值的监督来提升同质性估计质量,尤其在标签稀缺条件下。这些实验观察进一步支持了理论分析(定理 2)的结论,即同质性估计器的精度对最终结果有正面影响。
image

同质性估计器精度分析

如图所示,随着同质性估计器精度的提升,模型性能在所有数据集上一致提升,完美估计(精度为 1)时分类性能趋于完美,表明不存在性能瓶颈。
image

如图所示,通过同质性引导分布采样的生成树,其同质性比率显著高于随机采样的树,这从经验上验证了定理 2 的结论。
image

树数量分析表明,少量树(如 4 到 8 棵)即可获得良好的性能,进一步体现了 FGL 范式在总代价分析中的效率优势。
image

优点和讨论

个人认为,本文有如下一些优点和创新点可供参考学习:

  1. 不同于现有深度局部模型和浅层全局模型的设计框架,本文从总代价的分解公式出发,识别出生成树是连接所有节点的最小子图,在结构数量和单结构代价之间取得了平衡。
  2. 树聚合器基于合并和分解两条性质,适用于任意满足这两条性质的消息聚合器,包括线性注意力、线性 RNN、状态空间模型等,具有很强的通用性。同时通过两次递归在单棵树上以线性时间实现了二次方节点对交互,在表达力和效率之间取得了很好的平衡。
  3. FGL 在 Cornell、Texas、Wisconsin 等异质图数据集上取得了性能提升,说明基于森林的范式通过全局树传播和同质性引导采样,能够有效应对异质图上的长距离依赖问题。

针对现有图网络对图的数据处理方面存在的不足,这篇论文通过生成树实现了一种在性能和效率方面权衡的信息表示方式。后续的模块可以视为对常规的信息处理操作进行了针对性的调整,做了图嵌入进行分类。因此,本文的关键机制在于用生成树重新定义了消息传递的结构,这个思路值得在后续的工作中考虑。

posted @ 2026-09-08 15:55  乌漆WhiteMoon  阅读(12)  评论(0)    收藏  举报