Paper Reading: Graph-to-Tree — Topological Decomposition for Self-Supervised Learning
Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。
| 论文概况 | 详细 |
|---|---|
| 标题 | 《Graph-to-Tree: Topological Decomposition for Self-Supervised Learning》 |
| 作者 | Yejiang Wang, Yuhai Zhao, Fangting Li, Jiapu Wang, Meixia Wang, Ling Li, Miaomiao Huang, Zhengkui Wang, Shirui Pan |
| 发表会议 | The ACM Web Conference 2026 (WWW '26) |
| 发表年份 | 2026 |
| 会议等级 | CCF-A |
| 论文代码 | 未公开 |
作者单位:
- Northeastern University, Shenyang, China
- Xiamen University, Xiamen, China
- Nanjing University of Science and Technology, Nanjing, China
- Shanxi University, Taiyuan, China
- Singapore Institute of Technology, Singapore
- Griffith University, Gold Coast, Australia
研究动机
树分解(Tree Decomposition)是图论中的一个基本概念,它通过将图划分为重叠的顶点子集(称为"bag")并将这些子集以树结构连接起来,揭示图的层次组织结构。它在计算生物学、社会网络分析、电力网络计算等多个科学领域都有应用。例如在蛋白质相互作用网络中,树分解能自然捕捉功能模块及其层次关系;在社交网络中,它能揭示重叠的社区结构及其互联关系。如下图所示,一个图 G 可以被分解为一棵树 T,每个树节点代表一个包含原图顶点子集的 bag。树分解满足三个关键性质:
- 每条边至少被一个 bag 包含;
- 任意顶点所在的所有 bag 在树中构成连通子树;
- 共享顶点的 bag 在树中相连。

树分解能够凸显图中的局部簇及其交集,这些特征在原始拓扑结构中往往被掩盖了。鉴于树分解蕴含的丰富结构信息,考虑令图学习模型利用这些层次模式和多尺度上下文,以学习到更具信息量、更具结构感知能力的节点嵌入,使其同时反映局部社区归属和全局位置角色。尽管图表示学习尤其是自监督图学习(如图对比学习)发展迅速,但现有方法仍然主要从全局视角处理图结构。例如 GraphCL 对整个图施加均匀随机扰动,GCA 依赖度或 PageRank 等全局度量,Ad-GCL 和 AutoGCL 通过图级对抗学习掩码,Ci-GCL 在不重叠的全局识别社区中施加不变性约束。这些策略忽略了树分解提供的丰富信息,例如:
- 局部结构桥:某些边在全局看来可能不重要,但在特定局部上下文(bag)中却是连接密集子组件的唯一边,删除它们会导致局部环境中的拓扑信息丢失;
- 多角色顶点:图中的节点常常在重叠社区中同时扮演不同角色,而全局或不相交的划分会抹平这些细微功能;
- 鲁棒性问题:数据错误产生的虚假超级枢纽会扭曲全局中心性或角色识别,树分解将计算局限在 bag 内,将噪声的影响限制在少数上下文中。
文章贡献
针对现有自监督图学习方法缺乏对图的层次结构和多尺度上下文的显式建模的问题,本文提出了一个将树分解引入自监督图学习的框架 TopDsl。TopDsl 将树分解既作为结构先验又作为计算支架,输入图首先被分解为 bag 树结构,然后据此计算结构重要性分数,用于指导模型的增广策略和损失函数,最终生成鲁棒的图表示。图到树的分解策略将输入图分解为树结构,其中每个 bag 捕捉重叠的局部结构上下文,提供了从局部邻域到全局拓扑的自然层次。上下文感知的重要性评估通过 bag 内的接近中心性(节点)和局部边介数(边)计算上下文感知的重要性分数,并跨 bag 聚合,能够识别全局度量忽略的局部结构桥等关键元素。自适应增广策略将结构重要性和属性稳定性分数转化为扰动概率,自适应地扰动节点、边和特征,在保留语义一致邻域的同时允许有意义的变化。新的结构相似性损失融合了基于图的邻近性(PPR)和基于树分解 bag 共现的相似性,使对比学习同时捕捉扁平拓扑关系和层次结构关系。在多个基准数据集上的实验表明,TopDsl 优于当前最优的基线方法。

预备知识
问题定义
设 \(G=(V,E,X)\) 表示一个属性图,其中 \(V=\{v_1,...,v_n\}\) 是 \(n\) 个节点的集合,\(E \subseteq V \times V\) 是边集合。图的结构由邻接矩阵 \(A \in \{0,1\}^{n \times n}\) 表示。每个节点 \(v_i \in V\) 关联一个特征向量 \(x_i \in \mathbb{R}^d\),所有节点特征构成矩阵 \(X \in \mathbb{R}^{n \times d}\)。本文的目标是学习一个映射函数(编码器)\(f_\theta: G \to \mathbb{R}^{n \times q}\),为每个节点生成低维表示向量(嵌入)\(z_v \in \mathbb{R}^q\),其中 \(q \ll n, d\)。整个过程是自监督的,不依赖任何节点标签。
树分解
对于图 \(G\),树分解是一对 \((T, B)\),其中 \(T=(I, F)\) 是一个节点集为 \(I\)、边集为 \(F\) 的树,\(B = \{B_i \mid i \in I\}\) 是 \(V\) 的子集族(称为 bag),满足以下性质:
- 节点覆盖:\(\bigcup_{i \in I} B_i = V\),即每个节点至少出现在一个 bag 中;
- 边覆盖:对于每条边 \((u,v) \in E\),存在某个 \(i \in I\) 使得 \(\{u,v\} \subseteq B_i\),即每条边至少被一个 bag 包含;
- 一致性性质:对于每个节点 \(v \in V\),由树节点 \(\{i \in I \mid v \in B_i\}\) 诱导的 \(T\) 的子图是连通的,也就是包含同一节点的所有 bag 构成连通子树。
树分解的宽度定义为 \(w(T,B) = \max_{i \in I} |B_i| - 1\)。图 \(G\) 的树宽(treewidth)\(tw(G)\) 是所有可能的树分解中宽度的最小值。虽然求最优树分解是 NP-hard 的,但存在多种近似算法可以为实际图计算出宽度合理的树分解。本文使用 \((T,B) = \text{TreeDecomp}(G)\) 来表示通用的树分解算法。
本文方法
TopDsl 框架的核心思想是利用树分解来识别图中固有的多尺度层次结构,从而实现细粒度的自适应增广和结构感知的对比损失。框架分为四个主要阶段:
- 将输入图进行树分解,得到由重叠 bag 组成的树结构层次;
- 计算上下文感知的重要性分数(节点用接近中心性、边用介数中心性,均在每个 bag 内计算),并据此生成两个对比视图;
- 用图神经网络编码器处理这两个视图,生成节点嵌入;
- 使用融合了图邻近性和树分解共现的结构相似性损失来约束嵌入。

Graph to Tree
框架首先对输入图应用树分解算法,将其划分为层次结构。树分解算法大致分为两类:保证最优树宽的精确算法,以及提供近似最优解的启发式算法。由于确定任意图的树宽是 NP 完全问题,精确计算对于大规模真实网络不可行。因此本文采用启发式的最小度(minimum degree)算法,该算法迭代选择度最小的顶点进行消元,具有接近线性的复杂度。
除了计算效率方面的考虑,使用启发式算法不仅与本文的核心目标一致:将生成的 bag 作为有意义的局部上下文来计算相对重要性,而非最小化树宽。最小度启发式在节点消元过程中隐含地寻找稀疏分隔子,同时保留稠密子结构,自然地产生与内在社区或紧密连接区域相对应的 bag。此外,树分解的边覆盖性质保证了社区之间的边必须出现在桥接 bag 中,使得这些边在局部介数中心性中表现为关键连接器。
值得注意的是,虽然启发式分解可能不是最优的,但本文的模型从相对重要性差异中学习,而非依赖绝对中心性值,因此启发式算法在计算可行性和理论有效性之间取得了权衡。
Tree for Augmentation
基于得到的树分解 \((T,B)\),本文计算节点和边在各自局部结构上下文中的上下文感知重要性分数,作为自适应增广策略的基础。增广策略包括节点层面(节点丢弃和特征掩码)和边层面(边丢弃),根据重要性分数自适应地确定扰动概率。整体思路分为两步:
- 计算 bag 级别的重要性权重,反映每个局部上下文在全局层次中的结构显著性;
- 在每个 bag 内计算局部中心性并跨 bag 聚合,得到每个元素的全局重要性分数。
节点层面的增广
节点增广包括结构层面的节点丢弃和特征层面的特征掩码,首先计算 bag 级别的重要性。在树结构 \(T\) 中,对于每个 bag \(B_i\),其结构重要性定义为树中接近中心性的倒数:
其中 \(d_T(i,j)\) 表示 bag \(i\) 和 bag \(j\) 在树 \(T\) 中的最短路径距离,\(I\) 是所有树节点的集合。该分数用于反映每个 bag 在整体层次结构中的中心程度。
然后在每个诱导子图 \(G[B_i]\) 内计算节点的局部接近中心性。对于节点 \(v_k \in B_i\),其局部中心性为:
其中 \(d_{G[B_i]}(v_k, v_l)\) 表示诱导子图中节点 \(v_k\) 和 \(v_l\) 之间的最短路径距离。由于节点可能出现在多个 bag 中,本文使用加权最大策略聚合其重要性分数:
节点丢弃概率与重要性成反比,其中 \(\tilde{S}_{nb}(k)\) 是归一化后的结构重要性,\(p_0\) 是控制基础丢弃率的超参数。
对于特征扰动,本文通过评估每个 bag 内的同质性来衡量局部属性稳定性。对于节点 \(v_k \in B_i\),计算其与局部邻居的属性一致性:
其中 \(N(v_k)\) 是节点 \(v_k\) 在原始图中的邻居,\(\cos(\cdot,\cdot)\) 计算特征向量之间的余弦相似度。最终的属性稳定性分数同样使用加权最大策略聚合,特征掩码概率为:
特征掩码通过采样掩码矩阵 \(M \in \{0,1\}^{n \times d}\) 实现,其中 \(M_{kl} \sim \text{Bernoulli}(p_{ab}(k))\),增广后的特征矩阵为 \(\tilde{X} = X \odot (1-M) + N \odot M\),其中 \(N \sim \mathcal{N}(X, \Sigma)\) 提供高斯噪声。
边层面的增广
边增广侧重于保局部结构桥,在特定上下文中作为关键连接器的边,同时允许扰动不太重要的边。本文使用局部边介数中心性作为 bag 里边重要性的主要度量。对于 bag \(B_i\) 内的边 \(e_{uv} = (u,v)\),其局部介数中心性为:
其中 \(\sigma_{st}\) 表示诱导子图 \(G[B_i]\) 中节点 \(s\) 和 \(t\) 之间的最短路径总数,\(\sigma_{st}(e_{uv})\) 表示其中经过边 \(e_{uv}\) 的路径数。这个度量能有效识别在全局看来不重要、但在局部上下文中作为关键连接器的局部桥。
由于边可能跨越多个 bag(由树分解的边覆盖性质保证),本文跨所有包含该边的 bag 聚合其重要性分数。设 \(B(e_{uv}) = \{i \in I : u,v \in B_i\}\) 为包含边两端点的 bag 集合,最终的边重要性为:
边丢弃概率与重要性成反比:
其中 \(\tilde{S}_{eb}\) 是归一化后的边重要性分数。
Tree for Loss
生成两个增广视图 \(\tilde{G}_1\) 和 \(\tilde{G}_2\) 后,本文进一步利用树分解来设计新的对比损失函数。核心思想是将节点对之间的相似性权重由传统的正负二分类扩展为连续的结构相似性分数,该分数同时融合了原始图拓扑和树分解揭示的层次上下文。这样,共享相似结构角色(无论是通过直接拓扑邻近还是通过共享 bag 成员关系)的节点,其嵌入会被拉近,而不同的节点则被推远。
图相似性与树相似性的融合
首先使用个性化 PageRank(PPR)计算基于图的相似性矩阵 \(S_g \in [0,1]^{n \times n}\),衡量节点之间通过随机游走重启的接近程度。PPR 的稳态分布 \(\pi(s,t)\) 定义为:
其中 \(I\) 是指示函数,\(N(u)\) 表示 \(u\) 在图 \(G\) 中的邻居,\(\alpha\) 是重启概率。作为补充,本文从 bag 共现中推导基于树的相似性矩阵 \(S_t \in [0,1]^{n \times n}\),其直觉是频繁出现在相同 bag 中的节点共享核心结构环境,重叠社区或功能模块。设 \(B(v) = \{i \in I \mid v \in B_i\}\) 为包含节点 \(v\) 的 bag 集合,使用 Jaccard 指数计算成对相似性:
该度量自然编码了多尺度关系,因为 bag 代表通过树 \(T\) 连接的局部簇。将两种互补的视图融合,首先归一化 \(S_g\) 和 \(S_t\) 得到 \(\tilde{S}_g\) 和 \(\tilde{S}_t\),然后通过加权平均得到最终的相似性矩阵,其中 \(\alpha \in [0,1]\) 是可调节的超参数。
广义对比损失
本文的目标函数超越了传统的正负对二分法,将融合后的相似性 \(S_{gt}(u,v)\) 作为任意两个节点 \(u\) 和 \(v\) 之间对应关系的软真值标签。使用广义二元交叉熵目标对所有节点对进行优化,设 \(\Theta_{uv} = (z_u^1)^T z_v^2\) 为来自两个视图的节点 \(u\) 和 \(v\) 的嵌入之间的一致分数,损失定义如下,其中 \(\sigma_{sp}(x) = \log(1 + e^x)\) 是 softplus 函数。
公式中当结构相似性 \(S_{gt}(u,v)\) 高时,模型被训练为预测高概率 \(\sigma(\Theta_{uv})\);反之则预测低概率。这使得目标函数能够利用全谱的成对关系,鼓励嵌入捕捉细微的结构角色,而非拘泥于刚性的正负二分法。
复杂度分析
TopDsl 框架的总体时间复杂度由三部分组成:树分解、增广分数计算和损失计算。
- 树分解:使用最小度启发式,通过高效管理度更新,总代价实际上是线性的,规模为 \(O(n+m)\);
- 增广分数计算:该过程高度局部化在 \(r\) 个 bag 内。每个 bag 的平均大小为 \(w\)(对于小树宽图,\(w \ll n\)),计算接近中心性和介数中心性的总复杂度为 \(O(rw^2)\),可扩展,避免了在整个图上的计算;
- 损失计算:基于 PPR 的图相似性使用局部划分,每对节点的时间为 \(O(2b\log^3 m / \phi^2)\);基于树共现的 Jaccard 相似性需要 \(O(rn)\) 的预处理和 \(O(n^2)\) 的成对计算。
整体来看,对于具有较小树宽的实际图,该框架是高效的。
实验结果
本文在 16 个广泛使用的基准数据集上进行了评估,包括节点级和图级任务,以验证 TopDsl 的广泛有效性。
数据集和实验设置
图分类任务使用了 TU Dataset 中的 8 个数据集,包括:
| 类型 | 数据集 |
|---|---|
| 生物信息学数据集 | NCI1、MUTAG(分子分类)、PROTEINS、DD(蛋白质结构分类) |
| 社交网络数据集 | IMDB-B(演员自我网络)、COLLAB(科研合作)、RDT-B、RDT-M5K(Reddit 讨论线程) |
节点分类任务使用了 8 个标准基准数据集,包括:
| 类型 | 数据集 |
|---|---|
| 引用网络 | Cora、CiteSeer、PubMed |
| 维基百科 | WikiCS(计算机科学文章网络) |
| 共同购买网络 | Amazon-Computers、Amazon-Photo |
| 合作作者网络 | Coauthor-CS、Coauthor-Physics |
对比方法方面,图分类任务的基线包括:
| 算法类型 | 对比模型 |
|---|---|
| 监督 GNN | GCN、GIN |
| 图核方法 | SP、GK、WL、DGK |
| 无监督嵌入方法 | Node2Vec、Sub2Vec、Graph2Vec |
| 自监督对比方法 | InfoGraph、GraphCL、Ad-GCL、AutoGCL、Joaov2、RGCL、SimGrace、SEGA |
节点分类任务的基线包括:
| 算法类型 | 对比模型 |
|---|---|
| 监督方法 | MLP、GCN |
| 嵌入方法 | DeepWalk、Node2Vec |
| 图对比学习方法 | DGI、VGAE、GMI、MvGRL、Grace、GCA、BGRL、SUGRL、CCA-SSG |
节点分类使用预训练的节点嵌入训练线性分类器,报告 50 次运行的平均测试准确率,数据集按 10%/10%/80% 划分训练/验证/测试集。图分类使用线性 SVM 分类器评估图表示,报告 5 次 10 折交叉验证准确率的平均值。
对比实验
下表总结了 8 个 TU 数据集上的图分类结果,可见 TopDsl 始终取得了优于所有现有基线的性能。例如在 PROTEINS 数据集上,TopDsl 达到了 81.13% 的准确率,显著超过了第二名 SEGA(76.00%)多达 5.13 个百分点。在 DD 和 MUTAG 上,TopDsl 也分别以 80.08% 和 90.39% 的成绩稳居第一。在 IMDB-B 上,TopDsl 达到 76.31%,不仅超越了最强的无监督基线 SEGA(73.60%),甚至超过了有监督的 GIN 方法(73.70%)2.61 个百分点。在 COLLAB 上,TopDsl 相比次优方法提升了 1.24%,表明树分解引导的增广策略在保留局部结构方面是有效的。

下表展示了 8 个基准数据集上的节点分类结果。结果表明 TopDsl 在所有数据集上都取得了最优性能。TopDsl 不仅超过了最强的无监督基线,而且始终优于 GCN 等监督方法。例如在 PubMed 数据集上,TopDsl 达到 83.81% 的准确率,超过了表现最好的无监督方法 SUGRL(81.96%)1.85 个百分点,超过监督 GCN 基线(79.16%)多达 4.65 个百分点。在 Cora 和 CiteSeer 上,TopDsl 分别以 84.72% 和 73.33% 的成绩达到 SOTA。在更大的数据集如 Amazon-Computer 和 Coauthor-Physics 上,TopDsl 相比最强竞争者分别提升了 1.56% 和 0.46%。

这些提升验证了树分解能够有效捕捉多尺度结构模式,双重相似性框架融合图邻近性和树基共现模式,使模型能够学习到高度有区分力的表示,同时保留了局部拓扑关系和分解揭示的层次上下文。
消融实验
为了验证各核心组件的单独贡献,本文进行了消融研究,选择性地停用树引导的自适应增广(Aug)和分解感知的结构损失(Loss)。测试了三种变体:仅移除增广(w/o Aug)、仅移除损失(w/o Loss)、同时移除两者(w/o Aug+Loss)。
结果如下所示,可见每个组件对模型都有贡献。例如在 Cora 数据集上,移除自适应增广或结构损失分别导致 2.61 和 2.08 个百分点的显著性能下降。在所有测试数据集上的退化证实了上下文感知的视图生成和结构感知的目标对于学习高质量表示都是重要的。

此外,当两个模块同时移除时,性能下降最为严重。这种变体类似于使用随机增广的标准对比学习基线,表现明显差于完整的 TopDsl 模型。例如在 PubMed 上,完整模型比该基线高出 2.62 个百分点;在 Cora 上,差距更大,达 3.43 个百分点。说明自适应增广策略通过保留关键结构产生语义鲁棒的视图,而分解感知损失则提供了利用这些视图的理想目标。
参数敏感性分析
下表分析了基础扰动率的影响,结果表明 TopDsl 在较低到中等的扰动率(通常在 \(p_0 \in [0.1, 0.3]\) 范围内)下表现稳健且优越。例如在 Cora 和 PubMed 上,最佳性能出现在最低测试率 \(p_0=0.1\);在 CiteSeer 上,最优值在 \(p_0=0.2\)。在这个最优范围内,模型性能相对稳定,如 WikiCS 上 \(p_0\) 从 0.1 增加到 0.3,准确率仅变化 0.1%。相反,当率增加到 0.4 及以上时,所有数据集的准确率都呈下降趋势。在 Cora 上,\(p_0\) 从 0.1 增加到 0.5 导致性能下降 2.42 个百分点。说明足够的扰动对于创建多样化视图是必要的,但过高的率会破坏图的基本语义结构。

下表展示了改变权重 \(\alpha\),即平衡图相似性 \(S_g\) 和树相似性 \(S_t\) 的影响时的模型性能。结果表明最佳融合是数据集依赖的,反映了每个图独特的结构特性。例如 CiteSeer 在很小的 \(\alpha=0.01\) 时取得最佳结果(73.33%),说明更强依赖树分解的层次信息;而 WikiCS 在 \(\alpha=0.5\) 时表现最佳(82.10%),表明需要平衡拓扑邻近性和层次上下文。在极端情况下(如 \(\alpha=0.99\))性能往往会下降,此时其中一种相似性信号几乎完全被忽略。这证实了融合传统图拓扑和新颖的树基结构上下文对于图表示学习都是重要的。

优点和讨论
个人认为,本文有如下一些优点和创新点可供参考学习:
- 本文将图论中的经典树分解算法作为结构先验和计算支架引入自监督图学习的工作,相比于已有方法依赖全局度量或学习隐式结构,树分解提供了显式的、有理论保证的层次结构表示,这是一个非常有新意的思路;
- 上下文感知的重要性评估机制方面,通过在每个 bag 内计算局部中心性(节点的接近中心性、边的介数中心性),然后使用 bag 重要性加权聚合的方法,能够识别全局度量忽略的局部结构桥和多角色顶点;
- 损失函数将 bag 共现的 Jaccard 指数作为树相似性,与 PPR 的图相似性融合成软标签,用广义二元交叉熵替代传统的正负对损失。软真值使得对比学习不再局限于刚性的正负二分,能够捕捉更细粒度的结构关系。
讨论:这篇论文读起来像是就是用图论的树分解概念作为理论依据,对图结构进行一些扰动增强来得到图嵌入,然后损失函数进行调整适应。本质上说是一种有理论支撑的基于增强的图嵌入算法,树分解、局部中心性和相似度计算都不是新的东西,但是以树分解本身可以作为一个强的理论支撑,使其整体框架有意义。在实验方面,正文主要还是围绕性能做了几个基础性的实验,没有进一步通过例如可视化分析等揭示模型的行为或特性。同时,我在正文和搜索引擎中没有找到代码仓库链接,可能会影响可复现性。

浙公网安备 33010602011771号