NodeFormer : A Scalable Graph Structure Learning Transformer for Node Classification
abstract
- 本文工作:all-pair消息传递方案,用于在任意节点之间高效地传播节点信号,作为在大型图上进行节点分类的pioneering Transformer-style network的重要构建模块。
- 高效计算的实现是由一个内核化的Gumbel-Softmax算子实现的,该算子将算法复杂度降低到线性(节点数),以可微的方式从大型、潜在的全联通图中学习潜在的图结构。
- 节点分类、图增强(图像分类)、缺少输入图
introduction
- 沿着观察到的图结构传播信息必然会产生更好的节点级表示,用于对每个个体实例节点的预测。
- 本文:all-pair 信息传递方案,扩展到大型系统且不影响性能。核化Gumbel-Softmax算子,综合了随机特征图(random feature map)和近似采样策略(approximated sampling strategy),用于提取所有实例节点中的潜在结构,通过可微优化生成适度梯度。这两种包含随机性的操作组合潜在地可能导致失真,但本文从理论上证明了算法对于具体变量(离散结构)的良好逼近,避免了繁琐的all-pair相似度的显式计算,降低了算法复杂度。
- NodeFormer灵活地在潜在图的特定层里的任意节点对之间有效地传播信息。
- 为了适应输入图(如果有输入图),设计了两种简单的技术,关系偏差和边级别的正则化损失,作为正确学习自适应结构的指导。
- 本文工作总结:
- 开发内核化的Gumbel-Softmax算子,被证明用作具体变量(数据点之间的离散潜在结构)的良好近似。在不牺牲精度的前提下,降低消息传递拓扑的算法复杂度。将图结构学习扩展到百万级别的大型图。
- 提出了NodeFormer(第一次将all-pair消息传递扩展到大型节点分类图),新型的图网络,在潜在的连接所有节点的图上操作分层消息传递,通过新目标以端到端可微的方式进行优化,追求从结点特征和标签的后验条件中采样最优拓扑。
related works
- GNN:
- 构建有表达的GNN作为图数据学习中的一个基本问题,包括的尝试有:图注意力网络GAT,对输入图的边加权,稀疏化输入结构促进鲁棒表示,子图采样,线性特征映射,通道转换等提出可伸缩的GNN(scalable GNNs)。
- 但限制于无法学习输入范围之外的新边,将模型的接受域限制在局部邻域,忽略了全局信息。
- GSL:图结构学习,
- 目标是超越观察到的拓扑结构,学习一个新的图,用于在所有实例之间传递消息。
- 其中一项工作是:相似驱动,边的置信度通过节点对之间的一些相似函数反映,
- 另一项工作:优化邻接矩阵
- 本文:为了提高结构学习的极限,在表1(比较了一些流行的图结构学习方法)中突出模型优点,尤其是在每一层都能实现高效的结构学习,不需要输入图形。
- 节点级预测vs图级预测:
- 本文工作主要关注结点级别的任务,将所有节点视为非独立同分布的,由于相互依赖而产生。每个节点是一个带有标签的实例,当任务涉及跨所有节点的任意关系时,模型的可伸缩性是十分重要的。
- 图级别分类任务:每个独立同分布的实例本身是一个小图,对于完全连接每个图中的结点的计算成本并不十分昂贵。该任务在图结构学习和all-pair消息传递已经有了实现,但是不乏扩展到节点级,预测特有的大型图。
NODEFORMER
- 设定:NODEFORMER,一个大规模的变压器图网络,结点u有其结点特征和一个标签。邻接矩阵为A。当没有输入结构时,边集为空集。
- 两种常见设置:
- 换向学习(transductive learning),测试结点位于用于训练的图中
- 归纳学习(inductive learning),处理训练图之外的新的不可见结点,目标是学习节点级预测的函数,即估计图中未标记或是新节点的标签。
- 存在的挑战:输入结构可能并不是节点之间传播信号的理想结构,相反某些潜在的结构可以促进学习更好的结点表示。
- Zl和Al分别表示第l层的结点表示和估计的潜在图,目的是:1)基于结点表示进行特定层的潜在图的结构估计。2)更新节点表示的特征传播,由公式定义的模型遵循transformer,潜在地支持了每层的任何节点对之间的消息传递。
导致的挑战:1)可伸缩性:如何降低学习新图的二次复杂度。(潜在图可能连接所有实例节点)2)可微性:如何实现离散结构的端到端可微优化。 - 高效学习离散结构:高效的内核化算子
- 内核化消息传递,定义一个全图注意网络,可以估计实例节点之间的潜在交互,并实现相应的密集连接消息传递。(在计算上做了一些优化,减少计算次数,但仍存在过度规范化的问题,而消息传递是在一个加权的全连通图上进行的,在只有部分边重要的情况下,对所有实例进行特征聚合的确定性方法可能会增加过拟合的风险,因此会通过从全连通图中提取稀疏结构解决当N很大时的过拟合问题。)
- 可微随机结构学习:如何实现离散图结构的可微优化
- 对分类分布进行多次采样,获得每个节点的邻居,采样过程带来的问题是不连续以及阻碍反向传播。
- 通过公式实现经过采样的潜在图的消息传递(对每个节点采样一次),实践时可以限定对每个节点的采样次数,并取聚合结果的平均值。
- 核化Gumbel Softmax算子的适定性
- 对于公式7的关注点之一:核函数的RF近似是否保持目标离散变量的Gumbel近似的适定性
- 回答理论问题:1)公式6利用方程中的Gumbel变量进行幂运算时,RF对原始点的逼近能力如何。2)公式7是否仍然保证类别分布的持续松弛。
- 输入结构作为关系偏差
- 将输入拓扑(如果有的话)调整为关系偏置,设定注意权重,对可学习的标量b(l),任何相邻节点对(u, v)的关系偏置都是一个确定值。
- 关系偏差的目的是为G中的相邻结点分配适当的权值,公式8用于更新结点表示。
- 可将高阶邻接视为关系偏差,以牺牲效率为代价获得更好的表达。
- 学习目标
- 给定结点特征和训练标签,使数据对数似然最大化,用C类数据进行监督。
- 图拓扑学习增加了自由度,已有的标签数量无法与之比拟。引入边级正则化。
- Loss = Ls + λLe
discussion
- 学习到的潜在拓扑对下游任务多有效?
从贝叶斯角度理论分析,理想的潜在图应该考虑到下游任务,并最大化消息传递的潜力,再产生信息结点表示。但是这样的目标是难以实现的。
conclusion
提出了一种可扩展和高效的图Transformer(特别是节点级),可以在输入拓扑之外的任意对之间传播分层节点信号。关键模块是一个内核化的Gumbel-Softmax算子,使我们能够学习具有线性算法复杂度的特定层潜在图,而不影响精度。在不同的图形数据集和情况下的结果验证了该方法的有效性、可扩展性和稳定性。
浙公网安备 33010602011771号