Paper Reading:Towards Graph Foundation Models: Learning Generalities Across Graphs via Task-Trees
Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。
| 论文概况 | 详细 |
|---|---|
| 标题 | 《Towards Graph Foundation Models: Learning Generalities Across Graphs via Task-Trees》 |
| 作者 | Zehong Wang, Zheyuan Zhang, Tianyi Ma, Nitesh V. Chawla, Chuxu Zhang, Yanfang Ye |
| 发表会议/期刊 | International Conference on Machine Learning(ICML) |
| 发表年份 | 2025 |
| 会议/期刊等级 | CCF-A |
| 论文代码 | https://github.com/Zehong-Wang/GIT |
作者单位:
- University of Notre Dame
- University of Pittsburgh
研究动机
基础模型在文本和视觉领域取得了巨大成功,通过在大规模语料上预训练,模型能够捕获跨领域和跨任务的可迁移模式。例如图像中的轮廓和纹理,或文本中的词元和句子,这些通用知识使得模型可以通过上下文学习和零样本泛化高效地适应下游任务。但将基础模型扩展到图结构数据仍然处于起步阶段,主要原因在于图数据集之间的高度异质性。不同领域的图往往编码完全不同的现象,社交网络建模人际关系,分子图则代表化学结构,这导致了特征异质性和结构异质性。更关键的是,图任务的学习单元各不相同,节点级任务以节点为单位,边级任务以边为单位,图级任务以整个图为单位,这限制了统一模型在不同任务间的兼容性。现有探索图通用模式的工作主要有两条路线:
- 基于 graphon 的视角:用 graphon 概念建模跨图的可迁移模式。如果图从同一个 graphon 采样,它们应共享结构属性,从而支持有效迁移。但 graphon 方法依赖强生成假设,在真实场景中很少成立,从多样图中推断共享 graphon 的计算复杂度也很高。
- 基于子结构的视角:寻找重复出现的模体如三角形等。这类方法受限于子图表示的学习效果,GNN 在捕获子图中保留的基本子结构方面存在困难。
文章贡献
本文针对图学习中的任务异质性问题,提出了 task-trees 的概念作为统一的学习实例,用于对齐节点级、边级和图级任务。任务树的核心思想是在消息传递 GNN 中,无论任务类型如何,预测都依赖于任务相关节点的嵌入,这些节点的计算树可以通过引入一个虚拟任务节点连接起来,形成一棵统一的任务树。基于此,本文构建了 Graph Generality Identifier on Task-Trees 模型,简称 GIT,通过在多样化的任务树上以重建目标进行预训练,使模型获得可迁移的知识,再通过领域后训练实现专业化。本文还进行了理论推导,分析了任务树的稳定性、可迁移性和泛化界,为任务树作为跨任务通用学习单元提供了形式化保证。实验结果表明,GIT 在 5 个领域的 30 多个图数据集上,在 fine-tuning、上下文学习和零样本三种评估范式下均取得了优秀表现。
预备知识
消息传递图神经网络是图学习的主流范式。给定图 \(G=(V,E)\),每个节点 \(v \in V\) 关联一个特征向量 \(x \in \mathbb{R}^d\)。GNN 编码器 \(\phi\) 以图为输入,通过消息传递学习节点嵌入 \(Z = \phi(V, E)\)。具体来说,第 \(l\) 层的节点嵌入更新为:
其中 \(N(i)\) 表示节点 \(i\) 的 1 跳邻居,\(z_i^{(0)} = x_i\),\(W_1, W_2\) 是可学习矩阵。\(\sigma, \rho, g\) 分别为激活函数、聚合函数和更新函数。为简化分析,通常假设 \(\rho\) 为平均操作,\(g\) 为恒等函数。图任务大致可分为节点级、边级和图级三类,节点级任务的预测基于目标节点的嵌入,边级任务基于边两个端点的嵌入,图级任务基于所有节点的聚合嵌入。这些参与预测的节点被称为任务相关节点。
本文方法
任务树的构建与编码
消息传递 GNN 的学习过程可以理解为在计算树上的递归聚合。L 层 GNN 产生的节点表示,对应于该节点的 L 跳计算树的嵌入。由于图任务的预测完全依赖任务相关节点的嵌入,而这些嵌入由各自的计算树决定,因此可以通过合并相关计算树,为每个学习实例构建一棵统一的任务树。

具体来说,对于任意图实例,无论是节点、边还是整个图,都有一组任务相关节点 \(\{v_{t_1}, \dots, v_{t_n}\}\) 和对应的 L 层计算树 \(\{T_1, \dots, T_n\}\)。通过引入一个连接所有任务相关节点的虚拟节点,可以将这些计算树重构为一棵更大的任务树 \(T_t\)。任务树的编码采用简单的平均聚合策略。给定由虚拟节点 \(v_t\) 和任务相关节点组成的任务树 \(T_t\),其表示计算为:
其中 \(T_i\) 表示以 \(v_{t_i}\) 为根的计算树,\(\phi\) 为共享的 GNN 编码器。该表示可用于重建、分类或对齐等下游目标。任务树相比子图方法具有三方面优势:
| 特性 | 说明 |
|---|---|
| 可学习性 | 树结构信息可以被消息传递 GNN 有效捕获。 |
| 统一性 | 任务树可以无缝应用于节点级、边级和图级任务,缓解任务异质性。 |
| 高效性 | 编码任务树在操作上等价于编码附加在原图上的虚拟节点,只需在现有图中添加节点和边,计算开销很小。 |
理论分析
本节对任务树进行三个维度的理论分析:稳定性、可迁移性和泛化界,为 Task-Tree Generality Assumption(任务树通用性假设)提供形式化支持。该假设认为跨图任务的通用性至少部分地保留在所涉及图的任务树结构中。
稳定性分析
稳定性分析的目标是证明:如果两棵任务树的子树相似,它们的表示也会相似。为此首先定义子树信息的记号:
其中 \(x_i^{(0)} = x_i\) 表示节点的原始特征,\(x_i^{(l)}\) 表示节点 \(i\) 在第 \(l\) 层 GNN 聚合后的子树特征,\(N_i\) 为节点 \(i\) 的邻居集合。

该公式刻画了 GNN 每一层的子树聚合信息,\(l\) 越大,子树越宽越深。给定两棵任务树 \(T_{t_1}\) 和 \(T_{t_2}\),分别包含任务相关节点 \(\{v_{t_1}, \dots, v_{t_n}\}\) 和 \(\{v_{t_1}, \dots, v_{t_m}\}\),两棵任务树之间的距离定义为:
其中 \(\phi\) 为 GNN 编码器,\(T_i\) 为对应节点 \(i\) 的计算树。定理 3.1 给出了该距离的上界:
其中 \(C_1, C_2\) 是与编码器相关的常数,\(B_x\) 表示节点特征 \(x\) 的有界范数。该上界的关键在于:距离 \(\Delta\) 由各层子树特征的差异 \(C_l \|x_i^{(l)} - x_j^{(l)}\|\) 逐层累加而成,而最终的界 \(\frac{2B_x}{C_1-1} \cdot C_2\) 与子树的数量(即任务树的宽度 \(n\) 和 \(m\))无关。这说明即使两棵任务树的宽度差异很大,只要子树之间存在一定程度的相似性,就能产生相似的表示。值得注意的是,定理还暗示增加 GNN 层数 \(L\) 可能导致上界变松,与先前关于 GNN 过平滑的研究结论一致。
可迁移性分析
可迁移性分析回答的问题是:在任务树重建任务上预训练获得的知识,有多少可以迁移到下游任务?首先定义预训练目标和下游风险,预训练目标(重建损失)如下:
其中 \(P\) 为预训练任务树分布,\(T\) 为原始任务树,\(\hat{T}\) 为通过随机边掩码和属性掩码生成的被腐蚀版本,\(\phi \in \Phi\) 为 GNN 编码器,\(g \in \mathcal{G}\) 为重建头(仅在预训练阶段使用,微调时丢弃)。下游任务风险如下:
其中 \(\mathcal{T}\) 为下游任务分布,\(f \in \mathcal{F}\) 为线性预测头,\(y\) 为标签,\(\kappa\) 为损失函数。定理 3.3 给出了预训练损失与下游风险之间的关系:
其中 \(\phi\) 和 \(\phi'\) 分别为两个不同的编码器(例如预训练编码器与随机初始化编码器),\(C_\delta\) 和 \(\delta\) 为常数。不等式左侧 \(\min_{f} R_T(f \circ \phi) - \min_{f'} R_T(f' \circ \phi')\) 衡量预训练期间获得且可迁移到下游任务的知识量,右侧 \(\min_{g} L_P(g \circ \phi) - \min_{g'} L_P(g' \circ \phi')\) 衡量预训练期间获得的总知识量。因此 \(C_\delta\) 和 \(\delta\) 量化了总知识中可迁移部分的比例。由于 \(C_\delta\) 和 \(\delta\) 都较小,该定理说明在任务树上预训练可以为下游任务提供足够的可迁移知识。
泛化界分析
泛化界进一步给出了预训练加微调框架下,微调模型在下游任务上的风险上界。定理 3.5 指出,给定预训练分布 \(P\) 和微调分布 \(\mathcal{T}\),编码器在 \(P\) 上预训练、在 \(\mathcal{T}\) 上用 \(n\) 个样本微调后,以至少 \(1-\nu\) 的概率满足:
其中各符号含义如下。\(\phi^* = \arg\min_{\phi} \min_{g \in \mathcal{G}} L_P(g \circ \phi)\) 为在预训练分布 \(P\) 上获得的最优任务树编码器。\(\mathcal{E}_P(g, \phi) = L_P(g \circ \phi) - \min_{g', \phi'} L_P(g' \circ \phi')\) 为预训练阶段的超额风险,衡量当前模型距预训练最优解的差距。\(C_1, C_2\) 为与下游任务相关的常数,\(C_\delta \approx O(1)\),\(\delta = 1\)。
该泛化界包含四个关键部分。第一项最优风险是预训练编码器在下游任务上能达到的理论下界。第二项分布差异项刻画了预训练分布与微调分布之间的差距,其中 \(\sum_{x \in X_\phi}\|T_\phi(x) - P_\phi(x)\|\) 越小,即预训练数据与下游数据分布越接近,泛化效果越好。这一项直接支持了增加预训练数据多样性的重要性,也为基于预训练通用模型发展领域专业化模型提供了理论依据。第三项预训练超额风险说明预训练越充分(\(\mathcal{E}_P\) 越小),对下游泛化越有利。第四项复杂度正则项约束了微调样本嵌入的范数,防止过拟合。
综合来看,定理 3.5 表明:当微调样本数量 \(n\) 足够大、预训练分布与微调分布差距足够小、预训练足够充分时,微调模型可以取得良好的泛化性能。这也解释了 GIT-G 通过在多样化数据上预训练来缩小分布差异,以及 GIT-S 通过领域后训练进一步调整预训练分布以提升目标域泛化的设计动机。
GIT-G:通用预训练模型
GIT-G 是 GIT 的通用预训练版本,使用任务树重建任务作为预训练 pretext。给定从图数据库中采样的一组任务树,对每个任务树应用两种 corruption 技术生成两个视图,corruption 方式包括随机边掩码和随机属性掩码。然后用编码器 \(\phi\) 得到被腐蚀任务树的嵌入,执行双向重建。预训练损失函数为:
其中 \(g\) 是非线性 MLP 投影头,\(\rho(z) = z/\|z\|\) 用于归一化,sg 是停止梯度操作,\(h\) 是所有实例 \(z_i\) 的平均值。重建损失以预测方式捕获任务树的语义,KL 正则化项通过最小化个体实例与其中心之间的 KL 散度,确保嵌入被投影到共享空间中。
为了聚焦于任务空间对齐而非特征对齐,实验中采用文本属性图基准,使用 Sentence-BERT 将所有节点特征编码到共享的 768 维嵌入空间,从而保持节点特征在跨域时的一致性,隔离并检验任务树预训练的效果。
GIT-S:指令调优专业化
根据泛化界定理,预训练数据分布与微调数据分布之间的差距越小,泛化效果越好。基于这一发现,可以从预训练的通用模型出发,为特定领域开发专业化模型。其前提假设是同一领域的图具有相似的任务树分布。如果在目标领域的任务树上对预训练模型进行后训练,预训练分布 \(P\) 会向目标领域的任务树分布调整,从而减小分布差距,提升目标领域上的泛化能力。
GIT-S 通过指令调优方法实现后训练。给定预训练模型 \(\phi^*\) 和来自目标领域的一组任务树,使用监督微调损失进行后训练:
其中 \(\psi\) 是每个任务树的指令生成函数,\(\kappa\) 是对应的损失函数。在文本属性图的设置下,指令定义为由大语言模型编码的标签描述的嵌入,损失函数使用均方误差。
实验结果
数据集和实验设置
实验在超过 30 个文本属性图上进行,涵盖学术网络、电商网络、知识图谱、分子图和时序图等领域。预训练在多样化的子集上进行,包括 Arxiv、Products、WN18RR、FB15K237、Chemblpre 和 PCBA。

本文使用的对比方法如下:
| 方法 | 类型 | 出处 |
|---|---|---|
| GCN, GAT, GIN | 监督 GNN | 经典基线 |
| BGRL | 自监督 | ICLR 2022 |
| GraphMAE | 自监督 | KDD 2022 |
| OFA | 图基础模型 | ICLR 2024 |
| GraphPrompt+ | 图基础模型 | WWW 2023 |
| AllinOne | 图基础模型 | WWW 2023 |
| OpenGraph | 图基础模型 | arXiv 2024 |
| AnyGraph | 图基础模型 | arXiv 2024 |
实验使用 GraphSAGE 作为编码器,每个实验重复 5 次并使用不同的随机种子。fine-tuning 更新所有模型参数,上下文学习即少样本学习不进行微调,通过每个类别采样 k 个实例计算原型嵌入,使用最近原型推理进行分类,零样本学习用大语言模型生成的类别描述嵌入替代原型。节点分类和边分类报告准确率,图分类和链接预测报告 AUC。
主要结果
领域层面的性能如表所示,held-out avg 表示所有排除在预训练和专业化之外的图的平均得分,提供了泛化能力的无偏评估。通用模型 GIT-G 已经在多个领域中优于强基线。经过领域特定的专业化后,GIT-S 获得了进一步提升,尤其在零样本和上下文学习设置中更为显著,这印证了后训练在使预训练模型适应特定领域方面的作用。结果与理论发现一致,表明专业化增强了模型的适应能力。

数据集层面的性能如图所示,GIT 在大多数情况下优于最强基线,验证了任务树作为跨异构图任务的可泛化学习单元的有效性。

专业化的效果可以总结出三点结论:
- 专业化 GIT-S 在大多数设置下提升了 GIT-G 的性能,但专业化的影响因数据集而异。
- 专业化不会显著降低模型在其他领域上的性能。
- 将所提出的专业化方法应用于其他模型也能在特定领域获得性能提升,说明后训练增强模型容量的思路具有通用性。
与 SOTA 方法对比
如表所示,GIT 在学术网络、知识图谱和分子图三个领域与 SOTA 方法进行了比较。在学术网络领域,GIT-G 在 fine-tune 设置下达到 75.82,优于 GraphPrompt+ 的 74.80、Allinone 的 75.25、OpenGraph 的 74.64 和 AnyGraph 的 75.01。在知识图谱领域,GIT-G 达到 75.73,同样优于所有对比方法。在分子图领域,GIT-G 达到 74.57,也保持领先。结果表明 GIT 在跨任务和跨域泛化方面具有优势。

训练策略消融实验
下表报告了在学术网络上对不同训练策略的消融研究。实验考察了四种方法。Base Model 在目标图上预训练。Expert Model 在所有学术网络上预训练。General Model 在默认预训练数据集上预训练。Specialized Model 在默认数据集上预训练后,在 Arxiv 上进行专业化。

GIT 的通用模型相对于 base 模型和 expert 模型保持了稳定的性能。GraphMAE 和 OFA 在从 base 和 expert 模型过渡到通用模型时出现了性能下降,说明任务树在缓解负迁移方面具有潜力。此外,GIT 中的专业化使其性能逼近专门在学术图上训练的 expert 模型。
任务树与子图的对比
本文在 fine-tuning 设置下比较了任务树与基于子图的学习单元在效率和效果上的差异。为公平比较,实现了 GIT 的子图变体 GIT-SubG,将任务树替换为子图,其他组件保持不变。实验结果如表和图所示,在学术网络、知识图谱和分子图三个领域,任务树在计算效率和预测性能上都始终优于子图。

学术网络领域 GIT-Tree 达到 75.82,GIT-SubG 为 73.48。知识图谱领域 GIT-Tree 为 75.73,GIT-SubG 为 73.59。分子图领域 GIT-Tree 为 75.73,GIT-SubG 为 72.67。held-out 平均和总体平均也呈现同样趋势。效率方面,任务树版本在内存占用和训练时间上都明显优于子图版本。说明任务树作为紧凑、表达力强且结构对齐的学习实例具有优势,尤其在跨任务和跨域泛化场景中。

非文本属性图上的结果
GIT 并不固有地依赖文本信息。先前实验使用文本属性图是为了隔离任务异质性的影响,同时规避特征异质性的混淆效应。文本属性通过共享编码器实现跨图的特征对齐,使得可以更清晰地评估任务树泛化的收益。为了验证 GIT 在非文本属性图上的适用性,本文引入了一个轻量级模块,通过 SVD 将特征投影到共享空间来处理特征异质性。在 PubMed、Citeseer 和 IMDB-B 上预训练 GIT-G,在 Cora 上微调,结果如表所示。使用 SVD 加预训练的 GIT-G 达到 95.70 的 AUC,优于 GraphMAE 的 95.10,证实了 GIT 在不依赖文本信息的情况下仍然有效。

优点和讨论
个人认为,本文有如下一些优点和创新点可供参考学习:
- 本文将任务树作为图学习的统一基本单元,将节点级、边级和图级任务都抽象为任务树表示,解决了图任务异质性问题。这一思路类比于图像中的图像块和语言中的句子,为图基础模型提供了统一的学习实例抽象。
- 建立了稳定性、可迁移性和泛化界的理论框架,从任务树表示的稳定性出发,逐步推导出预训练知识的可迁移性和微调后的泛化误差上界。理论分析不仅为方法提供了形式化保证,还揭示了分布差异对泛化的影响。
- 任务树的实现非常轻量,只需在原图上添加虚拟任务节点并连接到任务相关节点,然后直接用标准 GNN 进行编码。相比子图方法需要提取和存储每个实例的子图,任务树在内存和计算上都有显著优势,同时性能更优。
在学习数据结构课程的时候,我们就学到树结构是图结构的特殊情况,二者关系紧密。这篇文章主要就是通过计算树的概念,对图学习中节点/边/图三类任务统一成预测虚拟节点嵌入,然后参考 NLP 基础模型的统一表示 + 预训练 + 适配下游的路径走了一遍。它的关键在于找到了一种数据表达的方法,用同一种方式表示了图学习的预测任务,后续的工作可以考虑从计算树作为切入点进行设计。

浙公网安备 33010602011771号